Исследователи из Принстонского университета проверили, способен ли современный ИИ-агент самостоятельно провести научное исследование уровня топ-конференции. Результаты опубликованы 18 августа 2026 года.
Агент на базе Claude Opus 4.8 от Anthropic получил шесть дней, бюджет в 3000 долларов на API, доступ к GPU и интернету. Ему дали два исследовательских вопроса из еще не опубликованных статей, поданных на конференцию NeurIPS 2026.
Агент справился с инженерной частью: изучил литературу, провел сотни экспериментов и собрал результаты. Однако авторы оригинальных статей оценили работы ИИ как непригодные для публикации в топовой конференции.
По словам соавтора исследования Саяша Капура, агент проводил странные эксперименты, плохо писал, не делал новых открытий и слишком быстро отказывался от перспективных гипотез на основе ограниченных данных. Он не мог пересмотреть подход, если он не работал.
Причина — в обучении моделей на задачах с проверяемыми ответами. Для открытых исследований нужна другая среда обучения, отметил Капур. Сейчас команда проводит аналогичный эксперимент с более продвинутой моделью Mythos от Anthropic.
Результаты ставят под сомнение прогнозы о скором рекурсивном самосовершенствовании ИИ. Сооснователь Anthropic Джек Кларк назвал отсутствие интуитивной креативности у современных ИИ «медвежьим сигналом для коротких сроков рекурсивного самосовершенствования».
Исследователи отмечают: пока неясно, насколько открытые исследования критичны для самосовершенствования ИИ. Возможно, прогресс возможен и через улучшение в узких задачах. Но самые большие прорывы — изобретение трансформеров и новых архитектур — требовали творческих скачков.