Исследования

LLM-рецензии не совпадают с человеческими: сравнение GPT-5.4, Gemini 3.1 и Claude Opus 4.6 на ICLR 2026

Автор: AI-Sphere· обновлено 5 августа 2026 г. в 01:17· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

LLM-рецензии не совпадают с человеческими: сравнение GPT-5.4, Gemini 3.1 и Claude Opus 4.6 на ICLR 2026

Кратко: Новое исследование на arXiv показывает, что три ведущие LLM — OpenAI GPT-5.4, Google Gemini 3.1 Pro Preview и Anthropic Claude Opus 4.6 — при рецензировании 300 докладов ICLR 2026 отличают принятые работы от отклонённых, но не различают уровень oral и poster. Все модели работали по одинаковым инструкциям и без знания итогового решения.

Что произошло

Учёные подготовили набор из 300 докладов, поданных на ICLR 2026, поровну разделённых на три категории: oral, poster и отклонённые. Каждая модель — GPT-5.4, Gemini 3.1 Pro Preview и Claude Opus 4.6 — получила одинаковые инструкции и шкалы оценок, при этом информация о реальном решении была удалена. Затем сгенерированные рецензии сравнили с человеческими отзывами и финальными решениями конференции по трём направлениям:

  • соответствие широким и детальным категориям решений;
  • различия в использовании шкалы рекомендаций;
  • тематическое совпадение по выявленным слабым местам.

Результат: все три LLM смогли отличить принятые работы от отклонённых, но ни одна не воспроизвела разницу между oral и poster. Это означает, что модели не улавливают более тонкую градацию качества, которую видят люди.

Что изменилось по сравнению с предыдущей версией

Предыдущих версий этого исследования нет — работа представлена как препринт arXiv (номер 2608.03659v1, тип анонса new). Она не прошла рецензирование, поэтому выводы стоит рассматривать как предварительные.

Цены и доступность

Исследование опубликовано на arXiv в открытом доступе. Участвующие модели: OpenAI GPT-5.4 (доступен через API OpenAI), Google Gemini 3.1 Pro Preview (доступен в Google AI Studio и Vertex AI), Anthropic Claude Opus 4.6 (доступен через API Anthropic). Стоимость использования зависит от тарифов провайдеров.

Почему это важно

LLM всё чаще привлекают для автоматического рецензирования научных работ, но данное исследование показывает, что даже топовые модели не полностью соответствуют человеческим оценкам. Если они не различают устные и постерные доклады, это сигнал: автоматическая рецензия может быть полезна только как грубый фильтр, но не как замена человека. Для площадок, где внедряют AI-рецензирование (например, конференции, журналы), важно понимать границы возможностей моделей.

Для пользователей AI-Sphere

Если вы используете LLM для оценки качества текстов, научных работ или идей, помните: модели хорошо отделяют «принято/отклонено», но могут ошибаться в более тонких градациях. Для критически важных решений стоит комбинировать AI с человеческой экспертизой. На ai-sphere.ru можно отслеживать обновления моделей — возможно, будущие версии GPT, Gemini и Claude исправят этот пробел.

Источники

#LLM#рецензирование#ICLR 2026#сравнение моделей

Читайте также

GPT-5.4Цены на AI-моделиGemini 3.1 ProЦены на AI-моделиClaude 4.6Цены на AI-моделиOpenAIOpenAI — модели, продукты и новостиGoogleНовости GoogleAnthropicAnthropic (Claude) — модели, продукты и новости

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат