Назад к блогу✏️
AI-инжиниринг
Автоматическое открытие не имеет универсально превосходящей упряжи
Может ли одна нейросеть одинаково эффективно решать любые задачи по открытию новых знаний? Исследователи изучили этот вопрос и пришли к неожиданному выводу: инструменты, которые отлично справляются с поиском формул в физике, проваливаются при анализе литературных текстов, и наоборот.
В работе «Automated Discovery Has No Universally Superior Harness» авторы протестировали более десятка различных архитектур на задачах из трёх областей: физики (восстановление законов), биологии (предсказание мутаций) и лингвистики (извлечение семантических связей). Оказалось, что для каждой дисциплины оптимальная «упряжь» (набор алгоритмов и метрик) своя. Например, генетические алгоритмы блестяще находят уравнения, но путаются в падежах, а трансформеры, обученные на текстах, не видят причинно-следственных связей в численных данных.
Но самое ценное — это критерий оценки. Учёные предложили новую метрику, которая измеряет не просто точность, а **релевантность** открытия: насколько полученный результат помогает исследователю сделать следующий шаг. Оказалось, что даже не очень точная, но неожиданная гипотеза может быть полезнее сверхточного предсказания, которое учёный и так бы сделал сам. Грубо говоря, нейросеть, которая скажет: «Посмотри на этот необычный выброс», — часто ценнее той, которая просто подтвердит известное.
Практический итог для AI-сообщества: не ищите серебряную пулю. Вместо этого калибруйте инструмент под свою область — и обязательно добавьте человеческую оценку «полезности». Потому что лучшее открытие — это не то, что быстро нашли, а то, что заставило думать.
📎 [Источник](http://arxiv.org/abs/2607.18235v1)