CatchBench: Новый бенчмарк для оценки способности выявлять сбои AI-агентов
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
CatchBench: Новый бенчмарк для оценки способности выявлять сбои AI-агентов
Кратко: Исследователи представили CatchBench — бенчмарк для оценки того, на каком этапе выполнения задачи можно обнаружить сбой AI-агента. В тестировании участвовали 72 модели, включая 11 LLM-судей из девяти семейств (GPT, Claude, Gemini, Gemma, Llama, Qwen, DeepSeek, Mistral, Nova).
Что произошло
CatchBench ставит вопрос: когда можно обнаружить сбой агента? Аудит обычно ограничен записью, а не методом. Бенчмарк оценивает способность одного аудитора отвечать на вопросы в трёх информационных состояниях:
- PRE — объявленная конфигурация до запуска.
- LIVE — растущий префикс трассы выполнения.
- POST — завершённая трасса.
Предыдущие бенчмарки фиксировали одно из этих состояний или варьировали телеметрию. По заявлению авторов, ни один не оценивал все три состояния в рамках единого интерфейса задач и методов.
Каждое состояние допускает разные вопросы, поэтому семь контрактов задач имеют собственные метки и метрики, а не единую таблицу лидеров. Четыре контракта — доказательные, три — диагностические механизмы на основе Gold.
В релизе представлены результаты 72 участников: от сканеров правил и структурных моделей до 11 LLM-судей (GPT, Claude, Gemini, Gemma, Llama, Qwen, DeepSeek, Mistral, Nova). Тестирование проведено на 1187 объявленных конфигурациях и 1162 записанных запусках. Большинство участников не показали упорядоченности: 47 из 118 предварительно объявленных контрастов разделились.
Что изменилось по сравнению с предыдущей версией
CatchBench — новый бенчмарк, не имеющий прямой предыдущей версии. Его отличие от аналогов в том, что он оценивает все три информационных состояния (PRE, LIVE, POST) в рамках единого интерфейса, тогда как предшественники фиксировали одно состояние или варьировали телеметрию.
Цены и доступность
CatchBench опубликован в виде препринта на arXiv (ID: 2608.22808v1). Данные и код, вероятно, будут доступны в репозитории авторов после рецензирования. Бенчмарк не является коммерческим продуктом.
Почему это важно
CatchBench предлагает новый подход к оценке надёжности AI-агентов. Возможность выявить сбой на ранней стадии (PRE или LIVE) критична для безопасного развёртывания автономных систем. Отсутствие единой метрики и разделение на семь контрактов подчёркивает сложность задачи: один и тот же метод может хорошо работать на одном этапе и плохо на другом.
Для пользователей AI-Sphere
Для разработчиков и исследователей AI-агентов CatchBench — инструмент для тестирования собственных моделей на устойчивость к сбоям. Если вы работаете с агентами на базе GPT, Claude или Gemini, результаты бенчмарка помогут понять, на каком этапе выполнения задачи ваша модель наиболее уязвима. Следите за обновлениями в карточке модели на ai-sphere.ru.
Источники