Исследования

LayerRAG-Bench: Новый бенчмарк для оценки надёжности агентных RAG-систем

Автор: AI-Sphere· обновлено 31 июля 2026 г. в 01:59· 6 мин чтения
Источники: arxiv.org
<!-- NewsArticle JSON-LD { "@context": "https://schema.org", "@type": "ScholarlyArticle",\n "headline": "ScholarlyArticle", "description": "LayerRAG-Bench: Новый бенчмарк для оценки надёжности агентных RAG-систем", "datePublished": "Представлен LayerRAG-Bench — бенчмарк для оценки надёжности агентных RAG-систем на восьми доменах. Тесты показали, что нормализация схем устраняет дрейф, но не спасает от устаревших данных и ошибок до", "dateModified": "2026-07-31T04:59:40+03:00", "author": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru/about" }, "publisher": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru" }, "mainEntityOfPage": { "@type": "2026-07-31T04:59:40+03:00",\n "@id": "https://ai-sphere.ru/news/research/layerrag-bench-reliability-benchmark-agentic-rag" } } -->

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

LayerRAG-Bench: Новый бенчмарк для оценки надёжности агентных RAG-систем

Кратко: Исследователи представили LayerRAG-Bench — контролируемый бенчмарк для оценки надёжности агентных систем с дополненной генерацией (RAG) на восьми корпоративных доменах. Тесты на девяти моделях от OpenAI, Anthropic и Gemini показали, что нормализация схем эффективно устраняет дрейф схем, но не решает проблемы устаревших данных, отсутствующих результатов инструментов, запрещённых разрешений и неверного контекста сессии.

Что произошло

Опубликована работа LayerRAG-Bench: A Cross-Layer Reliability Benchmark for Agentic Retrieval-Augmented Generation (arXiv:2607.27353v1). Бенчмарк включает:

  • 8 корпоративных доменов
  • 240 задач
  • 9 сценариев сбоев
  • 2 режима контрактов
  • 38 880 живых записей на уровне задач

Протестированы девять моделей от OpenAI, Anthropic и Gemini. Ключевой результат: нормализация схем повышает успешность при дрейфе схем с 0.000 до 0.913. Однако устаревшие свидетельства, отсутствующие выводы инструментов, запрещённые разрешения и неверный контекст сессии нормализация схем не восстанавливает.

Что изменилось по сравнению с предыдущей версией

Ранее оценка RAG-систем фокусировалась в основном на groundedness (обоснованности) ответов. LayerRAG-Bench вводит многослойный анализ: проверяет не только groundedness, но и корректность работы на уровне свидетельств, контрактов инструментов, авторизации и состояния сессии. Показано, что оценка только groundedness даёт существенные ложноположительные результаты при устаревших и неверных свидетельствах сессии.

Цены и доступность

Бенчмарк опубликован в виде препринта на arXiv. Данные и код, вероятно, будут доступны в репозитории авторов. Дата публикации: 2607.27353v1.

Почему это важно

Агентные RAG-системы всё чаще используются в корпоративных приложениях, где надёжность критична. LayerRAG-Bench предлагает принцип послойной оценки: вмешательство по надёжности должно засчитываться за исправление своего целевого слоя, но не должно восприниматься как универсальное решение. Это меняет подход к тестированию и разработке RAG-агентов.

Для пользователей AI-Sphere

Если вы разрабатываете или используете агентные RAG-системы (например, для поиска по документам или поддержки клиентов), LayerRAG-Bench — инструмент для проверки, насколько ваша система устойчива к типовым сбоям. Рекомендуем ознакомиться с методологией и сценариями сбоев, чтобы улучшить свои решения.

Источники

https://arxiv.org/abs/2607.27353

#LayerRAG-Bench#RAG#надежность#бенчмарк

Читайте также

OpenAIOpenAI — модели, продукты и новостиAnthropicAnthropic (Claude) — модели, продукты и новостиGoogleНовости Google

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат