RECLAIM: Новый бенчмарк для оценки ИИ-агентов в воспроизведении научных исследований
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
RECLAIM — это набор из 100 статей конференции NeurIPS 2025, отобранных для оценки способности ИИ-агентов воспроизводить описанные в них результаты. Важной особенностью бенчмарка является то, что его можно ежегодно обновлять, используя материалы новых конференций. Для каждой статьи заранее фиксируется целевой результат, критерии успешного воспроизведения и бюджет вычислительных ресурсов в GPU-часах.
Агент должен самостоятельно воспроизвести результат, используя только текст статьи и те материалы, которые авторы опубликовали в открытом доступе. Именно от объёма этих материалов зависит уровень сложности:
- Run (запуск) — доступны код, данные и веса модели, задача агента — настроить окружение и выполнить код для получения результата.
- Retrain (переобучение) — есть код и данные, но нет весов модели; агенту придётся обучить модель с нуля.
- Reimplement (перереализация) — доступен только текст статьи и, возможно, данные; код и веса отсутствуют, агенту нужно написать реализацию самостоятельно.
Как оценивались агенты
Оценка результатов проходила без участия человека: специальная языковая модель анализировала логи и выходные данные, которые генерировал агент в ходе своей работы. Это исключает субъективность и ошибки, связанные с отчётами агента о проделанной работе.
Для каждой из 100 статей запускали четырёх разных агентов. По итогам тестирования наилучший результат в каждом уровне сложности выглядит так:
- Run (запуск): воспроизведено 41% статей.
- Retrain (переобучение): успешных воспроизведений — 27%.
- Reimplement (перереализация): только 15% статей были воспроизведены успешно.
Эти цифры показывают, что даже при наличии кода и данных современные ИИ-агенты справляются менее чем с половиной задач. Задачи, требующие самостоятельного написания кода, оказываются для них особенно сложными.
Почему это важно
Проблема воспроизводимости результатов — одна из ключевых в машинном обучении. Исследователи часто сталкиваются с тем, что не могут повторить заявленные в статьях результаты из-за отсутствия кода, неполных данных или неописанных деталей эксперимента. RECLAIM предлагает системный и автоматизированный способ проверки того, насколько хорошо ИИ может справляться с этой задачей.
Редакционный анализ: низкие показатели успешности агентов (особенно на высоких уровнях сложности) указывают на то, что текущие модели далеки от полноценного понимания научных работ. Они могут хорошо работать с готовым кодом, но написание реализации с нуля или воспроизведение результата без весов модели требует более глубокого понимания предмета, которого агентам пока не хватает. Тем не менее, сам подход к автоматической верификации результатов может в будущем ускорить проверку научных статей и снизить нагрузку на рецензентов.
Что это даёт пользователю
Для исследователей и практиков машинного обучения RECLAIM может стать полезным инструментом. Во-первых, он позволяет оценить, насколько надёжно опубликованы результаты конкретной работы — если агент не смог воспроизвести результат, это повод более внимательно изучить код и данные. Во-вторых, наличие ежегодно обновляемого бенчмарка стимулирует разработчиков ИИ-агентов улучшать свои модели, что в итоге может привести к созданию более надёжных инструментов для автоматической проверки научных результатов.
Что пока неизвестно
Исследование опубликовано в виде препринта на arXiv и ещё не прошло рецензирование. Неясно, какие именно агенты участвовали в тестировании и насколько их архитектура повлияла на итоговые показатели. Также остаётся открытым вопрос, насколько результаты на статьях NeurIPS 2025 обобщаются на другие конференции и области исследований.