EviScope: новый бенчмарк проверяет, действительно ли ИЛ доверяет своим источникам
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Группа исследователей (авторство не указано) опубликовала на arXiv препринт с описанием бенчмарка EviScope. Он построен по принципу парных контрфактических тестов: один вопрос формулируется один раз, но модель получает четыре разных варианта контекста — с добавлением, удалением, искажением или смещением важных фактов. Такой дизайн позволяет отделить случаи, когда модель честно использует источник, от ситуаций, когда она просто угадывает ответ.
Бенчмарк EviScope-v1.1 содержит 40 наборов по четыре условия, с выверенными контрфактическими утверждениями и разметкой на уровне отдельных предложений для автоматической оценки. Всего для тестов использовано 960 прогонов.
Результаты тестов
В экспериментах участвовали три модели: Qwen2.5-7B, Llama 3.1 8B и Gemini 3.5 Flash. Оценка велась по парным метрикам, которые выявляют зависимости поведения от типа искажения — то, что скрыто за привычной точностью ответов.
Наиболее неожиданный результат: у двух локальных открытых моделей механизм явного «шлюза» контроля над тем, какие именно факты использовать, показал себя хуже, чем наивный RAG (Retrieval-Augmented Generation — метод, при котором модель сначала ищет релевантные фрагменты в базе знаний, а затем отвечает на их основе). У Qwen оценка QCS (критерий, который мы не можем раскрыть без авторов) составила 0,15 против 0,50 у той же модели с RAG. У Llama — 0,10 против 0,375. Иными словами, явная попытка заставить модель «честно» сверяться с источниками привела к обратному эффекту.
Gemini 3.5 Flash продемонстрировал наилучшие результаты: при обоих вариантах промптов он набрал 0,944 балла по комбинированной метрике. Однако даже он в 5% случаев отвечал на вопросы, где в источники была внесена прямая контринтуитивная правка, не замечая противоречия.
Почему это важно
Внешне бенчмарки точности не ловят одну из главных проблем современных ИЛ: модель может дать верный ответ, но совершенно неверным путём. Если ошибка происходит не на уровне вывода, а на уровне работы с источниками, она может оставаться незамеченной месяцами — пока не возникнет ситуация, когда источник намеренно подменён или содержит ошибку.
Редакционный вывод: EviScope интересен тем, что он не просто оценивает «честность» модели, а выявляет, насколько сама архитектура и метод подачи данных влияют на эту честность. Тот факт, что специальный «контрольный шлюз» ухудшил показатели, может означать, что современные модели ещё не готовы к таким жёстким ограничениям — или сам шлюз был реализован неоптимально. В любом случае, это сигнал, что доверять модели на основании одной лишь точности пока преждевременно.
Что это даёт пользователю
На практике EviScope может помочь разработчикам QA-систем и чат-ботов, работающих с документами, точнее настраивать свои пайплайны. Вместо того чтобы полагаться исключительно на финальную точность, они смогут диагностировать, насколько модель привязана к конкретным источникам, и какая стратегия подачи данных — с явным контролем или без — работает лучше для их задачи. Пользователь в перспективе получит более надёжные ответы, которые опираются на факты, а не на выученные паттерны.
Что пока неизвестно
Авторы не раскрывают никаких деталей о себе. Метрика QCS не описана детально в доступной части аннотации, поэтому её содержательный смысл пока открыт для интерпретации. Неясно, как поведёт себя EviScope на других моделях, особенно более крупных и новых. Нет и данных о том, насколько сложно масштабировать такой бенчмарк на тысячи и миллионы тестов — пока он содержит лишь 40 наборов условий.