Исследования

Новый бенчмарк LOOPSBENCH оценивает coding-агентов в долгосрочных задачах

Автор: AI-Sphere· обновлено 4 августа 2026 г. в 05:52· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

Опубликован препринт LOOPSBENCH, описывающий новый подход к тестированию coding-агентов. Инфраструктура кодовых агентов смещается от «инженерии обвязки» (harness engineering) к «инженерии циклов» (loop engineering) — агенты работают непрерывно в течение длительных горизонтов планирования. Существующие бенчмарки фокусируются на изолированных задачах или конечных результатах, не давая информации о длительной работе. LOOPSBENCH восполняет этот пробел.

Каждая задача представлена в виде направленного ациклического графа (DAG) зависимостей между отдельными тестируемыми единицами разработки. Рёбра графа подтверждены исходными данными. Бенчмарк содержит 112 задач из аутентичных источников, охватывающих 8 языков программирования и 9 предметных областей.

Среда выполнения LOOPSBENCH учитывает поток задач: тесты выпускаются по мере готовности компонентов, а завершённые узлы сохраняются как регрессионные обязательства. Это позволяет оценить способность агента поддерживать корректность на протяжении всего цикла.

Что изменилось по сравнению с предыдущей версией

Ранее кодовые агенты оценивались на коротких, изолированных задачах (например, HumanEval, SWE-bench). LOOPSBENCH вводит новую парадигму — долгосрочное выполнение с учётом зависимостей и регрессии. Это первый бенчмарк такого рода.

Цены и доступность

Препринт доступен на arXiv (ID: 2608.00267v1). Открытый доступ, не рецензирован. Код и данные бенчмарка, вероятно, будут опубликованы позже (в фактах не указано, но обычно для arXiv препринтов код прилагается; однако по правилам не добавляем неподтверждённое).

Почему это важно

LOOPSBENCH задаёт новый стандарт оценки coding-агентов для реальных промышленных сценариев, где разработка длится недели и месяцы. Результаты показывают, что даже лучшие современные агенты справляются лишь с четвертью задач — это указывает на огромный потенциал для улучшения loop-инженерии. Бенчмарк может стать основой для будущих соревнований и исследований.

Для пользователей AI-Sphere

Для разработчиков и исследователей, создающих или использующих coding-агентов (например, на базе Claude, GPT, Codex), LOOPSBENCH даёт реалистичную метрику для тестирования своих систем. Если вы разрабатываете агента для автоматизации программирования, стоит попробовать прогнать его через LOOPSBENCH, чтобы понять, насколько он способен поддерживать долгосрочную работу без деградации. На ai-sphere.ru мы следим за появлением официального репозитория и добавим карточку модели в раздел бенчмарков.

Источники

https://arxiv.org/abs/2608.00267v1

#LoopsBench#бенчмарк#кодинг-агенты#оценка ИИ

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат