LayerRAG-Bench: Новый бенчмарк для оценки надёжности агентных RAG-систем
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
LayerRAG-Bench: Новый бенчмарк для оценки надёжности агентных RAG-систем
Кратко: Исследователи представили LayerRAG-Bench — контролируемый бенчмарк для оценки надёжности агентных систем с дополненной генерацией (RAG) на восьми корпоративных доменах. Тесты на девяти моделях от OpenAI, Anthropic и Gemini показали, что нормализация схем эффективно устраняет дрейф схем, но не решает проблемы устаревших данных, отсутствующих результатов инструментов, запрещённых разрешений и неверного контекста сессии.
Что произошло
Опубликована работа LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation (arXiv:2607.27353v1). Бенчмарк включает:
- 8 корпоративных доменов
- 240 задач
- 9 сценариев сбоев
- 2 режима контрактов
- 38 880 живых записей на уровне задач
Протестированы девять моделей от OpenAI, Anthropic и Gemini. Ключевой результат: нормализация схем повышает успешность при дрейфе схем с 0.000 до 0.913. Однако устаревшие свидетельства, отсутствующие выводы инструментов, запрещённые разрешения и неверный контекст сессии нормализация схем не восстанавливает.
Что изменилось по сравнению с предыдущей версией
Ранее оценка RAG-систем фокусировалась в основном на groundedness (обоснованности) ответов. LayerRAG-Bench вводит многослойный анализ: проверяет не только groundedness, но и корректность работы на уровне свидетельств, контрактов инструментов, авторизации и состояния сессии. Показано, что оценка только groundedness даёт существенные ложноположительные результаты при устаревших и неверных свидетельствах сессии.
Цены и доступность
Бенчмарк опубликован в виде препринта на arXiv. Данные и код, вероятно, будут доступны в репозитории авторов. Дата публикации: 2607.27353v1.
Почему это важно
Агентные RAG-системы всё чаще используются в корпоративных приложениях, где надёжность критична. LayerRAG-Bench предлагает принцип послойной оценки: вмешательство по надёжности должно засчитываться за исправление своего целевого слоя, но не должно восприниматься как универсальное решение. Это меняет подход к тестированию и разработке RAG-агентов.
Для пользователей AI-Sphere
Если вы разрабатываете или используете агентные RAG-системы (например, для поиска по документам или поддержки клиентов), LayerRAG-Bench — инструмент для проверки, насколько ваша система устойчива к типовым сбоям. Рекомендуем ознакомиться с методологией и сценариями сбоев, чтобы улучшить свои решения.
Источники