Назад к блогу✏️
AI-инжиниринг
Меньше копируй, больше обосновывай: как новое обучение с подкреплением избавляет нейросети от «синдрома попугая» в длинных контекстах
Одна из главных головных болей современных языковых моделей при работе с объёмными текстами — бессмысленное копирование. Когда нейросети дают задание найти ответ в многостраничном документе, она нередко просто переписывает большие куски исходника, не показывая настоящего понимания. Это похоже на студента, который на экзамене переписывает параграф из учебника, не вникнув в суть. Исследователи наконец-то предложили элегантное решение.
В новой работе «Copy Less, Ground More» авторы применили обучение с подкреплением на основе доказательств (ELR — Evidence-Aware Reinforcement Learning). Вместо того чтобы штрафовать модель за длинный ответ или просто требовать точности, алгоритм учит нейросеть буквально «доказывать» каждый тезис. Модель не просто генерирует текст, а маркирует в контексте именно те фрагменты, на которые она опирается в текущем предложении.
Почему это прорыв? Традиционные модели, даже с десятками миллиардов параметров, часто путают запоминание паттернов с истинным reasoning. Они начинают копировать, потому что так «дешевле» с точки зрения вычислительной логики — нет нужды строить внутренние связи. ELR же внедряет метрику «степени привязки к источнику». Если модель не указывает конкретный отрывок из документа, который подтверждает её слова, она получает отрицательное подкрепление.
Результаты впечатляют: на эталонных бенчмарках длинного контекста количество бессмысленного копирования снизилось на 40%, а точность фактологических ответов выросла до 92%. Фактически, это шаг к «честному искусственному интеллекту», который умеет сказать: «Я знаю это, потому что прочитал вот здесь».
Для индустрии это сигнал: будущее не за моделями, которые просто накачаны данными, а за теми, которые понимают, на чём основаны их выводы. И RL здесь выступает не просто как оптимизатор, а как инструмент формирования интеллектуальной честности.
📎 [Источник](http://arxiv.org/abs/2607.19345v1)