Исследования

Фиксация промежуточных выводов ухудшает работу LLM-судей: новое исследование

Автор: AI-Sphere· обновлено 12 августа 2026 г. в 04:45· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В препринте arXiv:2608.05353v2 (ещё не прошёл рецензирование) авторы сравнили четыре режима работы LLM-судей:

  • стандартное попарное суждение (standard pairwise judging);
  • структурированное однократное суждение (structured one-call judging);
  • двухэтапное суждение с фиксацией доказательств (two-call evidence locking);
  • трёхэтапное поточечное суждение с фиксацией (three-call pointwise locking).

Тестирование проводилось на моделях Claude Sonnet 4.5 и GPT-5 по 24 000 суждений над наборами данных HelpSteer3, FeedbackQA и CoVal. Evidence locking — когда модель сначала извлекает и записывает доказательства, а затем использует только их для вынесения вердикта — показал худшие результаты. Pointwise locking также оказался вредным, а структурированное извлечение доказательств без фиксации (structured evidence elicitation) осталось близким к стандартному суждению.

Что изменилось по сравнению с предыдущей версией

Ранее предполагалось, что промежуточная запись критериев и доказательств помогает LLM-судье сохранить информацию для последующего вердикта. Исследование опровергает это: видимый порядок полей не отражает внутренний порядок принятия решений, и принудительная фиксация ухудшает согласованность с человеческими оценками.

Цены и доступность

Исследование носит академический характер, коммерческих продуктов на его основе пока нет. Результаты опубликованы в открытом доступе на arXiv.

Почему это важно

LLM-судьи всё чаще используются для автоматической оценки качества ответов языковых моделей. Если фиксация промежуточных выводов систематически снижает точность, это ставит под сомнение некоторые популярные пайплайны оценки. Разработчикам стоит пересмотреть архитектуру судей: возможно, более эффективно позволять модели обрабатывать все данные в одном вызове, а не разбивать на этапы с жёсткой фиксацией.

Для пользователей AI-Sphere

Если вы используете LLM-судей для оценки собственных моделей или датасетов, избегайте пайплайнов, где модель сначала записывает доказательства, а потом выносит вердикт по этим записям. Лучше применять структурированное однократное суждение — оно даёт результаты, близкие к стандартному pairwise judging, но без дополнительных затрат. Следите за обновлениями карточки модели на ai-sphere.ru — мы добавим ссылку на это исследование в раздел «Оценка и бенчмарки».

Источники

#LLM-as-Judge#оценка LLM#исследование arXiv#заморозка интерфейса

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат