Назад к блогу✏️
AI-инжиниринг
Управление видео через графы: как новая модель позволяет редактировать ролики, рисуя связи между объектами
Представьте, что вы можете управлять каждым элементом в видео не сложными текстовыми запросами, а простой схемой — нарисовали граф, и нейросеть поняла, как должны двигаться персонажи и предметы. Именно это предлагает GraphVid — новая архитектура для генерации видео, в которой ключевую роль играют не слова, а графы.
Исследователи из нескольких университетов объединили графовые нейронные сети с диффузионными моделями. Вместо того чтобы описывать сцену текстом, пользователь задаёт структуру: узлы — это объекты, а рёбра — их отношения (например, «человек держит мяч» или «машина едет за велосипедистом»). Модель учится отображать эту абстрактную схему в реалистичное движение.
Главное преимущество — интерактивность. Вы можете изменить один узел (добавить объект) или перерисовать ребро (сменить взаимодействие), и видео перестроится в реальном времени. Это открывает путь к новым интерфейсам для дизайнеров, аниматоров и разработчиков игр — вместо сотен текстовых правок достаточно скорректировать граф.
Архитектура GraphVid состоит из двух этапов: сначала **графовый кодировщик** превращает схему в скрытое представление, затем **видео-декодер** на основе диффузии создаёт кадры, согласуя движение с заданными связями. Эксперименты показывают, что модель превосходит текстовые аналоги в точности управления: графы позволяют избежать неоднозначности, свойственной естественному языку.
Пока работа находится на стадии препринта, но потенциал огромен. Возможно, в будущем мы будем «рисовать» сюжеты для коротких роликов так же легко, как сейчас пишем промпты.
📎 [Источник](http://arxiv.org/abs/2607.21580v1)