Исследования

RECLAIM: Новый бенчмарк для оценки ИИ-агентов в воспроизведении научных исследований

Автор: AI-Sphere· обновлено 25 сентября 2026 г. в 01:46· 7 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

RECLAIM — это набор из 100 статей конференции NeurIPS 2025, отобранных для оценки способности ИИ-агентов воспроизводить описанные в них результаты. Важной особенностью бенчмарка является то, что его можно ежегодно обновлять, используя материалы новых конференций. Для каждой статьи заранее фиксируется целевой результат, критерии успешного воспроизведения и бюджет вычислительных ресурсов в GPU-часах.

Агент должен самостоятельно воспроизвести результат, используя только текст статьи и те материалы, которые авторы опубликовали в открытом доступе. Именно от объёма этих материалов зависит уровень сложности:

  • Run (запуск) — доступны код, данные и веса модели, задача агента — настроить окружение и выполнить код для получения результата.
  • Retrain (переобучение) — есть код и данные, но нет весов модели; агенту придётся обучить модель с нуля.
  • Reimplement (перереализация) — доступен только текст статьи и, возможно, данные; код и веса отсутствуют, агенту нужно написать реализацию самостоятельно.

Как оценивались агенты

Оценка результатов проходила без участия человека: специальная языковая модель анализировала логи и выходные данные, которые генерировал агент в ходе своей работы. Это исключает субъективность и ошибки, связанные с отчётами агента о проделанной работе.

Для каждой из 100 статей запускали четырёх разных агентов. По итогам тестирования наилучший результат в каждом уровне сложности выглядит так:

  • Run (запуск): воспроизведено 41% статей.
  • Retrain (переобучение): успешных воспроизведений — 27%.
  • Reimplement (перереализация): только 15% статей были воспроизведены успешно.

Эти цифры показывают, что даже при наличии кода и данных современные ИИ-агенты справляются менее чем с половиной задач. Задачи, требующие самостоятельного написания кода, оказываются для них особенно сложными.

Почему это важно

Проблема воспроизводимости результатов — одна из ключевых в машинном обучении. Исследователи часто сталкиваются с тем, что не могут повторить заявленные в статьях результаты из-за отсутствия кода, неполных данных или неописанных деталей эксперимента. RECLAIM предлагает системный и автоматизированный способ проверки того, насколько хорошо ИИ может справляться с этой задачей.

Редакционный анализ: низкие показатели успешности агентов (особенно на высоких уровнях сложности) указывают на то, что текущие модели далеки от полноценного понимания научных работ. Они могут хорошо работать с готовым кодом, но написание реализации с нуля или воспроизведение результата без весов модели требует более глубокого понимания предмета, которого агентам пока не хватает. Тем не менее, сам подход к автоматической верификации результатов может в будущем ускорить проверку научных статей и снизить нагрузку на рецензентов.

Что это даёт пользователю

Для исследователей и практиков машинного обучения RECLAIM может стать полезным инструментом. Во-первых, он позволяет оценить, насколько надёжно опубликованы результаты конкретной работы — если агент не смог воспроизвести результат, это повод более внимательно изучить код и данные. Во-вторых, наличие ежегодно обновляемого бенчмарка стимулирует разработчиков ИИ-агентов улучшать свои модели, что в итоге может привести к созданию более надёжных инструментов для автоматической проверки научных результатов.

Что пока неизвестно

Исследование опубликовано в виде препринта на arXiv и ещё не прошло рецензирование. Неясно, какие именно агенты участвовали в тестировании и насколько их архитектура повлияла на итоговые показатели. Также остаётся открытым вопрос, насколько результаты на статьях NeurIPS 2025 обобщаются на другие конференции и области исследований.

Источники

#RECLAIM#AI-агенты#воспроизводимость#NeurIPS

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат