Назад к блогу✏️
AI-инжиниринг
Видеогенерация как новый способ обучения машин рассуждать
Представьте, что вместо того, чтобы учить нейросеть логике через текст, вы показываете ей, как устроен мир через движение. Именно такой подход предлагает новая работа учёных под названием OpenCoF.
Суть метода проста и гениальна: чтобы научить искусственный интеллект понимать причинно-следственные связи, авторы предлагают использовать генерацию видео. Вместо того чтобы решать абстрактные задачи на рассуждение (типа «Если А больше В, а В больше С, то...»), модель учится предсказывать, как изменится сцена на кадрах. Когда мяч катится к краю стола — упадёт он или нет? Если толкнуть стакан — куда прольётся вода?
OpenCoF (Open-world Chain-of-Feel) — это не просто очередной генератор видео. Это попытка создать «двигатель физической интуиции». Нейросеть не просто повторяет увиденные паттерны, а учится моделировать базовые законы физики, пространственные отношения и временную последовательность событий. И самое интересное: этот навык затем переносится на текстовые задачи на логику. Модели, обученные предсказывать физические трансформации в видео, значительно лучше справлялись с вопросами, требующими многошагового рассуждения, чем их «чисто текстовые» аналоги.
Ключевое преимущество подхода — наглядность. Ошибки рассуждения становятся видимыми: если модель генерирует видео, где шарик проходит сквозь стену, мы сразу понимаем, что она не усвоила закон твёрдости. Исследователи утверждают, что OpenCoF позволяет добиться более глубокого, «телесного» понимания мира, чем стандартные языковые модели.
Для мира AI это важный сдвиг. Мы привыкли думать, что разум — это про слова и цифры. Но, возможно, настоящее мышление начинается с того, как мы представляем себе движение.
📎 [Источник](http://arxiv.org/abs/2607.08763v1)