LLM-рекомендатели не знают, когда галлюцинируют: новое исследование калибровки уверенности
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Авторы провели аудит четырёх zero-shot LLM-рекомендателей от разных вендоров: Mistral Large, Llama-3.3-70B, GPT-OSS-120B и Claude Sonnet 4.6. Модели не были дообучены или привязаны к конкретным каталогам. Тестирование прошло на трёх наборах данных: MovieLens-25M, Amazon Reviews 2023 Toys и Yelp Open Dataset. Оценка проводилась с разбивкой по популярности элементов.
Ключевые результаты:
- Частота галлюцинаций (OOD@10) сильно зависит от каталога: от 0–0,2% на MovieLens до 4,5–8,3% на Amazon и 2,2–8,4% на Yelp.
- Вербализованная уверенность моделей оказалась существенно некалиброванной даже при нулевых галлюцинациях. Например, на MovieLens при 0% OOD показатель ECE (Expected Calibration Error) достигал 0,223.
- Все четыре LLM систематически проявляют недооценку уверенности: среднее значение вербализованной уверенности по всем 12 комбинациям модель-каталог составило от 67 до 86 (из 100).
Что изменилось по сравнению с предыдущими подходами
Ранее аудит галлюцинаций в рекомендательных системах ограничивался бинарной метрикой out-of-domain rate — проверяли, выходит ли модель за пределы целевого каталога. Ни одно из предшествующих исследований не задавалось вопросом, осознаёт ли модель свою галлюцинацию. Новая работа впервые объединяет оценку галлюцинаций и калибровку уверенности, показывая, что даже при нулевом уровне галлюцинаций доверие к собственным ответам может быть сильно искажено.
Цены и доступность
Исследование опубликовано в виде препринта на arXiv и не прошло рецензирование. Все использованные модели доступны через API соответствующих вендоров. Дата публикации — 2025 год (номер arXiv: 2608.10008v1).
Почему это важно
Результаты ставят под сомнение надёжность LLM-рекомендателей в сценариях, где важна не только точность, но и адекватная оценка собственной уверенности. Если модель не способна корректно сигнализировать о своей неуверенности, пользователи или вышестоящие системы могут принимать ошибочные решения, полагаясь на ложную уверенность. Особенно критично это для приложений с высокими требованиями к достоверности (медицина, финансы, юридические рекомендации).
Для пользователей AI-Sphere
Если вы используете LLM для построения рекомендательных систем, учитывайте, что даже при низком уровне галлюцинаций модель может быть плохо откалибрована. Рекомендуется внедрять дополнительные механизмы проверки уверенности, особенно при работе с каталогами, где допустимая погрешность мала. На ai-sphere.ru можно отслеживать обновления карточек моделей и сравнивать их калибровочные характеристики по мере появления новых данных.