Назад к блогу✏️
AI-инжиниринг
Как научить ИИ мыслить, создавая видео: обзор метода OpenCoF
Нейросети всё увереннее генерируют реалистичные ролики, но, как выясняется, видеосинтез может стать не просто инструментом для творчества, а настоящей ступенью к развитию искусственного разума. Новая работа исследователей, представленная в препринте OpenCoF, предлагает неожиданный подход: обучать модели рассуждать, заставляя их предсказывать развитие сцен.
Авторы исходят из простой, но глубокой идеи: если модель способна сгенерировать правдоподобное продолжение видеоряда, она уже должна «понимать» физику мира, законы причинно-следственных связей и логику событий. На этом строится новый фреймворк OpenCoF (Open-world Continuous Forecasting). Вместо того чтобы просто учить нейросеть классифицировать картинки или отвечать на вопросы, исследователи предлагают задачу непрерывного прогнозирования. ИИ смотрит на несколько начальных кадров, а затем должен дорисовать (сгенерировать) всё, что произойдёт дальше.
Что особенно важно — подход не требует размеченных вручную аннотаций или готовых сценариев. Модель учится на сырых видеозаписях, самостоятельно вычленяя закономерности: что мяч отскочит от стены, что чашка разобьётся при падении, а пешеход не пройдёт сквозь машину. Это называется обучением без учителя на основе видеоданных.
Результаты экспериментов показывают, что такие модели не только генерируют более качественные и долгие ролики, но и начинают проявлять зачатки «рассуждения»: например, они способны предугадывать, как изменится сцена, если в неё внести небольшое изменение. Это превращает OpenCoF из просто генератора видео в потенциальную модель мира — шаг к созданию ИИ общего уровня.
Конечно, до полноценного «разума» пока далеко, но сам принцип — учить мыслить через визуальное предсказание — выглядит крайне перспективно. Возможно, будущие нейросети будут не заучивать ответы, а «прокручивать у себя в голове» вероятные варианты будущего.
📎 [Источник](http://arxiv.org/abs/2607.08763v1)