Эксперимент с двумя реальными исследовательскими задачами показал: современные ИИ-агенты уже умеют выполнять значительную часть инженерной работы, но слабо справляются с ключевыми этапами самостоятельного научного исследования.
Агентам предложили центральные открытые вопросы двух неопубликованных работ, поданных на NeurIPS 2026. На каждую задачу им дали шесть дней и вычислительный бюджет в тысячи долларов, а результаты оценивали авторы исходных исследований.
Системы могли писать код, запускать эксперименты, собирать результаты и готовить технические отчёты. Однако им было трудно выбрать действительно перспективное направление, сформулировать новую идею, правильно интерпретировать неоднозначные результаты и понять, когда нужно изменить исходную гипотезу.
Авторы называют вывод предварительным: исследованы только два случая. Но работа показывает разницу между автоматизацией научной инженерии и полноценным исследовательским мышлением.
ИИ-агенты справляются с инженерией, но пока не заменяют учёных в открытых исследованиях
Источник: arXiv