Исследования

Исследование выявило уязвимость в оценке точности объяснений нейросетей

Автор: AI-Sphere· обновлено 20 августа 2026 г. в 08:18· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Кратко: Стандартный тест на точность объяснений нейросетей (реконструкция активаций) не чувствителен к отдельным ложным утверждениям. Исследователи показали, что объяснения могут проходить тест, не будучи фактически точными, и предложили новые протоколы аудита.

Что произошло

В новой научной работе, опубликованной на arXiv, исследователи проанализировали метод оценки точности объяснений нейросетей, основанный на реконструкции скрытых активаций. Этот метод предполагает, что объяснение считается точным, если по нему можно восстановить исходную активацию. Ученые выявили фундаментальную проблему: тест структурно нечувствителен к отдельным ложным утверждениям. Если изменение конкретного утверждения не влияет на реконструкцию, это утверждение никогда не штрафуется.

Исследователи продемонстрировали два способа, которыми тест может быть пройден без фактической точности. На примере вербализатора Qwen-2.5-7B было показано, что объяснения реконструируются значительно выше случайного уровня, но лишь около 2% конкретных утверждений действительно важны для реконструкции. Это означает, что оценка отслеживает общий смысл, а не конкретные факты. В условиях точной синтетической истины стандартное обучение последовательно приводит к появлению коадаптированных приватных кодов — ложных формулировок, от которых зависит реконструкция. При этом исправления, не затрагивающие целевую модель, не помогают.

Что изменилось по сравнению с предыдущей версией

Работа является обновлением предыдущей версии (arXiv:2607.20379v2, тип объявления: replace-cross). Ключевые изменения не указаны, но факт обновления подтвержден.

Цены и доступность

Исследование опубликовано в виде препринта на arXiv и не прошло рецензирование. Информация о ценах или доступности коммерческого продукта отсутствует.

Почему это важно

Работа ставит под сомнение надежность широко используемого метода оценки точности объяснений нейросетей. Если объяснения могут проходить тест, не будучи фактически точными, это создает риски для интерпретируемости и доверия к моделям ИИ. Предложенные протоколы аудита — сравнение обоснования и истины, а также замена на независимого оценщика — могут стать основой для более надежных методов верификации.

Для пользователей AI-Sphere

Исследование напоминает о необходимости критически относиться к заявлениям о точности объяснений нейросетей. При выборе инструментов для анализа моделей стоит обращать внимание на то, какие методы верификации используются. В карточке модели на ai-sphere.ru можно будет отслеживать появление новых методов оценки интерпретируемости.

Источники

#верификация объяснений#активации нейросетей#Qwen-2.5-7B#arXiv

Читайте также

Qwen-2.5-7BЦены на AI-модели

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат