Исследования

CatchBench: Новый бенчмарк для оценки способности выявлять сбои AI-агентов

Автор: AI-Sphere· обновлено 25 августа 2026 г. в 03:38· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

CatchBench: Новый бенчмарк для оценки способности выявлять сбои AI-агентов

Кратко: Исследователи представили CatchBench — бенчмарк для оценки того, на каком этапе выполнения задачи можно обнаружить сбой AI-агента. В тестировании участвовали 72 модели, включая 11 LLM-судей из девяти семейств (GPT, Claude, Gemini, Gemma, Llama, Qwen, DeepSeek, Mistral, Nova).

Что произошло

CatchBench ставит вопрос: когда можно обнаружить сбой агента? Аудит обычно ограничен записью, а не методом. Бенчмарк оценивает способность одного аудитора отвечать на вопросы в трёх информационных состояниях:

  • PRE — объявленная конфигурация до запуска.
  • LIVE — растущий префикс трассы выполнения.
  • POST — завершённая трасса.

Предыдущие бенчмарки фиксировали одно из этих состояний или варьировали телеметрию. По заявлению авторов, ни один не оценивал все три состояния в рамках единого интерфейса задач и методов.

Каждое состояние допускает разные вопросы, поэтому семь контрактов задач имеют собственные метки и метрики, а не единую таблицу лидеров. Четыре контракта — доказательные, три — диагностические механизмы на основе Gold.

В релизе представлены результаты 72 участников: от сканеров правил и структурных моделей до 11 LLM-судей (GPT, Claude, Gemini, Gemma, Llama, Qwen, DeepSeek, Mistral, Nova). Тестирование проведено на 1187 объявленных конфигурациях и 1162 записанных запусках. Большинство участников не показали упорядоченности: 47 из 118 предварительно объявленных контрастов разделились.

Что изменилось по сравнению с предыдущей версией

CatchBench — новый бенчмарк, не имеющий прямой предыдущей версии. Его отличие от аналогов в том, что он оценивает все три информационных состояния (PRE, LIVE, POST) в рамках единого интерфейса, тогда как предшественники фиксировали одно состояние или варьировали телеметрию.

Цены и доступность

CatchBench опубликован в виде препринта на arXiv (ID: 2608.22808v1). Данные и код, вероятно, будут доступны в репозитории авторов после рецензирования. Бенчмарк не является коммерческим продуктом.

Почему это важно

CatchBench предлагает новый подход к оценке надёжности AI-агентов. Возможность выявить сбой на ранней стадии (PRE или LIVE) критична для безопасного развёртывания автономных систем. Отсутствие единой метрики и разделение на семь контрактов подчёркивает сложность задачи: один и тот же метод может хорошо работать на одном этапе и плохо на другом.

Для пользователей AI-Sphere

Для разработчиков и исследователей AI-агентов CatchBench — инструмент для тестирования собственных моделей на устойчивость к сбоям. Если вы работаете с агентами на базе GPT, Claude или Gemini, результаты бенчмарка помогут понять, на каком этапе выполнения задачи ваша модель наиболее уязвима. Следите за обновлениями в карточке модели на ai-sphere.ru.

Источники

#CatchBench#бенчмарк#AI-агенты#надежность

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат