Назад к блогу✏️
AI-инжиниринг
Указатели внешности — мультимодальное управление региональными областями в диффузионных трансформерах
Представьте, что вы рисуете портрет и хотите, чтобы у персонажа были зелёные глаза, но при этом остальная картинка осталась без изменений. Звучит просто? Для современных нейросетей это до сих пор вызов. Новая работа исследователей предлагает элегантное решение — «Указатели внешности» (Appearance Pointers).
Суть метода в том, чтобы научить диффузионный трансформер (DiT) понимать, какую именно область изображения нужно изменить и на что она должна быть похожа. Вместо грубого маскирования или перерисовки всего кадра, модель получает два сигнала: региональную маску (где менять) и референсное изображение (как должно выглядеть). Но главная инновация — как эти сигналы подаются.
Авторы предлагают встраивать управляющие токены прямо в последовательность визуальных патчей на ранних слоях модели. Эти токены действуют как «указатели»: они не перезаписывают содержимое, а мягко направляют генерацию, сохраняя контекст и стиль исходного изображения. В результате можно менять цвет волос, добавлять очки, заменять фон или даже переносить текстуру одного объекта на другой — и всё это без артефактов и без изменения композиции.
Эксперименты показывают, что метод превосходит существующие подходы (вроде ControlNet или InstructPix2Pix) по точности следования инструкции и сохранению идентичности исходного изображения. Особенно впечатляет работа с мелкими деталями: модель не «забывает» форму носа или изгиб улыбки, когда вы просите изменить цвет губ.
Практический вывод: скоро мы сможем редактировать изображения на уровне «укажи пальцем и скажи, что хочешь изменить». Это не просто инструмент для дизайнеров — это шаг к настоящему мультимодальному пониманию визуальных сцен.
📎 [Источник](http://arxiv.org/abs/2607.19344v1)