Исследования

Дрейф показателей доверия в открытых LLM: аудит Yi, Qwen, Mistral и Gemma

Автор: AI-Sphere· обновлено 11 августа 2026 г. в 04:57· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Кратко: Исследователи провели аудит четырёх открытых линий чат-LLM (Yi, Qwen, Mistral, Gemma) и обнаружили, что показатели доверия (trust-benchmark scores) существенно различаются между последовательными чекпоинтами одной и той же линейки. Средний абсолютный дрейф показателей между соседними поколениями в несколько раз превышает нулевую гипотезу, основанную на независимости. Результат устойчив при различных проверках.

Что произошло

В препринте arXiv (2607.02587v2) представлены результаты лонгитюдного аудита дрейфа показателей доверия в открытых чат-LLM. Исследователи проверили гипотезу о том, что показатели доверия, сообщаемые для целой линейки релизов, могут не отражать реальных изменений модели между чекпоинтами. Для этого были отобраны четыре открытые линейки (Yi, Qwen, Mistral, Gemma) — по три последовательных публичных поколения каждой. Каждый чекпоинт оценивался на фиксированном наборе из 200 пунктов, включающем пять бенчмарков: TruthfulQA, BBQ, ToxiGen, CrowS-Pairs и XSTest, с тремя различными шаблонами промптов. Четыре из пяти вариантов бенчмарков являются неканоническими, два из них — синтетические прокси.

Результаты показали, что средний абсолютный дрейф показателей между соседними поколениями (Score Drift Rate) в несколько раз превышает среднее значение нулевой гипотезы, построенной на основе независимости. Этот вывод сохраняется при исключении одного бенчмарка, одной линейки, при переходе к строгой оценке или при ограничении переходами с постоянным размером параметров.

Что изменилось по сравнению с предыдущей версией

В отличие от распространённой практики, когда для всей линейки моделей указывается единый показатель доверия, данное исследование демонстрирует, что значения могут существенно различаться между разными чекпоинтами одной и той же линейки. Таким образом, цитируемый показатель доверия следует рассматривать как привязанный к конкретному чекпоинту, а не ко всей линии релизов.

Цены и доступность

Исследование опубликовано в виде препринта на arXiv и не прошло рецензирование. Все использованные модели (Yi, Qwen, Mistral, Gemma) являются открытыми и доступны для загрузки. Дата публикации — 2025 год (точная дата не указана).

Почему это важно

Результаты аудита ставят под сомнение достоверность единых показателей доверия, которые разработчики часто указывают для целых линеек моделей. Для рынка AI это означает, что пользователям и исследователям необходимо учитывать конкретную версию чекпоинта при сравнении моделей. Дрейф показателей может влиять на выбор модели для задач, где важна безопасность, предвзятость или токсичность.

Для пользователей AI-Sphere

При выборе открытой LLM для своих проектов обращайте внимание не только на название линейки, но и на конкретный чекпоинт. Показатели доверия, заявленные для всей линейки, могут не соответствовать реальным характеристикам используемой версии. Рекомендуем проверять актуальные бенчмарки для конкретного чекпоинта перед интеграцией.

Источники

#LLM#open-source#trust benchmarks#model drift

Читайте также

YiЦены на AI-моделиQwenЦены на AI-моделиMistralЦены на AI-моделиGemmaЦены на AI-модели01.AIНовости 01.AIAlibabaНовости AlibabaMistral AIНовости Mistral AIGoogleНовости Google

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат