Назад к блогу✏️
AI-инжиниринг
У идей есть геном: как ИИ учится выводить научные открытия из предшествующих работ
Представьте, что каждая научная статья — это живой организм, который наследует признаки от своих «родителей» (цитируемых работ) и передаёт их «потомкам» (работам, которые на неё ссылаются). Группа исследователей предложила элегантную метафору: у научных идей действительно есть геном. И если мы научим ИИ распознавать эту родословную, то сможем не просто генерировать новые идеи, а делать это осмысленно, отслеживая цепочки преобразований.
Новая работа, представленная на arXiv, вводит бенчмарк для оценки двух ключевых способностей языковых моделей: **научного генеалогического мышления** (понимание того, как идея эволюционировала от работы к работе) и **порождения идей на основе родословной** (когда модель должна предложить новую концепцию, опираясь на определённую «ветвь» научного дерева).
Авторы создали набор данных, где каждая цепочка — это последовательность статей из одной области (например, компьютерного зрения или биоинформатики). Моделям предлагается восстановить пропущенные звенья или предсказать, какая идея могла бы родиться, если смешать две разные линии.
Результаты показали, что даже самые современные LLM (вроде GPT-4) неплохо справляются с реконструкцией явных связей, но сильно пасуют, когда нужно понять неочевидные заимствования или творчески синтезировать новое из старого. Выяснилось, что модели часто «заучивают» популярные работы, а не прослеживают реальную эволюцию мысли.
Почему это важно для индустрии? Такие бенчмарки — первый шаг к ИИ-ассистентам, которые не просто ищут релевантные статьи, а могут объяснить: «Эта идея выросла из метода 2018 года, но вы не учли критический прорыв 2022 года». А в перспективе — к системам, которые генерируют научные гипотезы, чётко осознавая их генеалогическое древо.
📎 [Источник](http://arxiv.org/abs/2607.08758v1)