Исследования

Само-дистилляция может ухудшать рассуждения LLM: до 40% падения производительности

Автор: AI-Sphere· обновлено 19 августа 2026 г. в 13:20· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Кратко: Само-дистилляция — метод пост-тренировки больших языковых моделей (LLM) — в задачах математического рассуждения не улучшает, а ухудшает производительность, вызывая падение точности до 40%. Причина — подавление вербализации неуверенности, когда модель перестаёт выражать сомнения в ходе рассуждения.

Что произошло

Исследователи изучили эффект само-дистилляции на способность LLM к рассуждению. В контролируемых экспериментах с варьированием контекста и охвата задач они обнаружили, что обучение на богатом контексте подавляет выражение неуверенности (epistemic verbalization). Это позволяет модели быстро адаптироваться к узкому кругу задач (in-domain), но резко ухудшает производительность на новых, не встречавшихся ранее задачах (out-of-domain), где выражение неуверенности и корректировка хода рассуждения критически важны.

Что изменилось по сравнению с предыдущей версией

По сравнению с предыдущей версией статьи (arXiv:2603.24472v3, replace) были уточнены детали экспериментов и анализ механизма деградации. Исследование получило статус "replace", что означает обновление версии на arXiv.

Цены и доступность

Исследование опубликовано на arXiv в виде препринта (не рецензированная версия). Код и данные авторами не указаны. Результаты экспериментально подтверждены на моделях: Qwen3-1.7B, Qwen3-8B, DeepSeek-Distill-Qwen-7B и Olmo3-7B-Instruct.

Почему это важно

Само-дистилляция широко применяется для сжатия и ускорения LLM. Результаты показывают, что в задачах математического рассуждения этот метод не только бесполезен, но и вреден. Падение производительности на Out-of-Distribution задачах ставит под сомнение универсальность само-дистилляции и требует пересмотра подходов к пост-тренировке.

Для пользователей AI-Sphere

Если вы используете модели, прошедшие само-дистилляцию, для решения нестандартных математических задач, будьте готовы к снижению точности. Для критически важных рассуждений стоит отдавать предпочтение исходным, недистиллированным версиям LLM. Следите за обновлениями карточек моделей на ai-sphere.ru — мы будем отслеживать, какие из популярных моделей подвергались само-дистилляции, и публиковать результаты независимых тестов.

Источники

#self-distillation#LLM reasoning#mathematical reasoning#epistemic verbalization

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат