Назад к блогу✏️
AI-инжиниринг
Непрерывные запросы и ограниченная память: как сделать языковые модели экономнее и умнее
Представьте себе языковую модель, которая не пытается запомнить каждый ваш чих из прошлого диалога, но при этом блестяще улавливает долгосрочный контекст. Именно эту задачу решает новая архитектура Co-LMLM (Continuous-Query Limited Memory Language Models), представленная в недавнем препринте.
Классические трансформеры страдают от квадратичной сложности внимания: чем длиннее текст, тем больше вычислительных ресурсов требуется. Решение? Вместо того чтобы хранить всю историю, модель учится сжимать ключевую информацию в специальные векторы-запросы. Эти запросы непрерывно взаимодействуют с ограниченным пулом памяти, извлекая только то, что действительно нужно для генерации следующего токена.
Авторы предлагают элегантную механику: модель использует ограниченный кэш (например, 256 токенов), но при этом поддерживает «бесконечный» контекст за счет циклического внимания к сжатому представлению прошлого. Эксперименты показывают, что Co-LMLM не только не уступает полномасштабным моделям на задачах понимания длинных текстов, но и значительно превосходит их по скорости инференса. Например, на бенчмарке LongBench с текстами до 32 тысяч токенов модель показала точность, сопоставимую с GPT-3.5, при затратах памяти в 4 раза меньше.
Главный практический вывод: Co-LMLM открывает путь к созданию эффективных чат-ботов и ассистентов, способных работать на мобильных устройствах или в бюджетных облаках без потери качества. Теперь не нужно таскать за собой всю историю разговора — достаточно умного конспекта.
Будущее за «бережливым интеллектом», и этот архитектурный подход — отличный шаг в нужном направлении.
📎 [Источник](http://arxiv.org/abs/2607.07707v1)