Исследования

EviScope: новый бенчмарк проверяет, действительно ли ИЛ доверяет своим источникам

Автор: AI-Sphere· обновлено 16 сентября 2026 г. в 05:46· 6 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

Группа исследователей (авторство не указано) опубликовала на arXiv препринт с описанием бенчмарка EviScope. Он построен по принципу парных контрфактических тестов: один вопрос формулируется один раз, но модель получает четыре разных варианта контекста — с добавлением, удалением, искажением или смещением важных фактов. Такой дизайн позволяет отделить случаи, когда модель честно использует источник, от ситуаций, когда она просто угадывает ответ.

Бенчмарк EviScope-v1.1 содержит 40 наборов по четыре условия, с выверенными контрфактическими утверждениями и разметкой на уровне отдельных предложений для автоматической оценки. Всего для тестов использовано 960 прогонов.

Результаты тестов

В экспериментах участвовали три модели: Qwen2.5-7B, Llama 3.1 8B и Gemini 3.5 Flash. Оценка велась по парным метрикам, которые выявляют зависимости поведения от типа искажения — то, что скрыто за привычной точностью ответов.

Наиболее неожиданный результат: у двух локальных открытых моделей механизм явного «шлюза» контроля над тем, какие именно факты использовать, показал себя хуже, чем наивный RAG (Retrieval-Augmented Generation — метод, при котором модель сначала ищет релевантные фрагменты в базе знаний, а затем отвечает на их основе). У Qwen оценка QCS (критерий, который мы не можем раскрыть без авторов) составила 0,15 против 0,50 у той же модели с RAG. У Llama — 0,10 против 0,375. Иными словами, явная попытка заставить модель «честно» сверяться с источниками привела к обратному эффекту.

Gemini 3.5 Flash продемонстрировал наилучшие результаты: при обоих вариантах промптов он набрал 0,944 балла по комбинированной метрике. Однако даже он в 5% случаев отвечал на вопросы, где в источники была внесена прямая контринтуитивная правка, не замечая противоречия.

Почему это важно

Внешне бенчмарки точности не ловят одну из главных проблем современных ИЛ: модель может дать верный ответ, но совершенно неверным путём. Если ошибка происходит не на уровне вывода, а на уровне работы с источниками, она может оставаться незамеченной месяцами — пока не возникнет ситуация, когда источник намеренно подменён или содержит ошибку.

Редакционный вывод: EviScope интересен тем, что он не просто оценивает «честность» модели, а выявляет, насколько сама архитектура и метод подачи данных влияют на эту честность. Тот факт, что специальный «контрольный шлюз» ухудшил показатели, может означать, что современные модели ещё не готовы к таким жёстким ограничениям — или сам шлюз был реализован неоптимально. В любом случае, это сигнал, что доверять модели на основании одной лишь точности пока преждевременно.

Что это даёт пользователю

На практике EviScope может помочь разработчикам QA-систем и чат-ботов, работающих с документами, точнее настраивать свои пайплайны. Вместо того чтобы полагаться исключительно на финальную точность, они смогут диагностировать, насколько модель привязана к конкретным источникам, и какая стратегия подачи данных — с явным контролем или без — работает лучше для их задачи. Пользователь в перспективе получит более надёжные ответы, которые опираются на факты, а не на выученные паттерны.

Что пока неизвестно

Авторы не раскрывают никаких деталей о себе. Метрика QCS не описана детально в доступной части аннотации, поэтому её содержательный смысл пока открыт для интерпретации. Неясно, как поведёт себя EviScope на других моделях, особенно более крупных и новых. Нет и данных о том, насколько сложно масштабировать такой бенчмарк на тысячи и миллионы тестов — пока он содержит лишь 40 наборов условий.

Источники

#EviScope#бенчмарк#языковые модели#достоверность

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат