Новый бенчмарк SciIG: как LLM справляются с написанием введений к научным статьям
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Авторы работы сформулировали задачу SciIG (Scientific Introduction Generation) — создание связного введения к научной статье на основе трёх входных данных: заголовка, аннотации и списка релевантных работ (related works). Для оценки они собрали датасеты из докладов конференций NAACL 2025 и ICLR 2025, что обеспечило актуальность и предметную специфику.
Для измерения качества генерации использовалась комплексная система метрик, разделённая на несколько групп:
- лексическое перекрытие (lexical overlap);
- семантическое сходство (semantic similarity);
- покрытие содержания (content coverage);
- точность (faithfulness) — насколько сгенерированный текст соответствует исходным данным;
- согласованность (consistency);
- корректность цитирований (citation correctness);
- качество нарратива (narrative quality).
Оценка проводилась как автоматическими методами, так и с помощью подхода LLM-as-a-judge, когда одна модель оценивает результаты другой.
Результаты сравнения моделей
Среди пяти протестированных моделей (DeepSeek-v3, Gemma-3-12B, LLaMA 4-Maverick, MistralAI Small 3.1, GPT-4o) наилучшие показатели по большинству метрик продемонстрировала LLaMA 4-Maverick. Особенно сильным было её преимущество в семантическом сходстве и faithfulness (точности следования фактам). В исследовании также упоминается использование подсказки из трёх примеров (three-shot prompting), что, вероятно, применялось для всех моделей.
Почему это важно
Написание введения к научной статье — трудоёмкая задача, требующая не только понимания предмета, но и умения логично выстроить нарратив, ссылаясь на предыдущие работы. SciIG предлагает стандартизированный способ измерить, насколько хорошо LLM справляются с этой задачей. Редакционный анализ: появление такого бенчмарка может стимулировать развитие специализированных моделей-помощников для исследователей, а также позволит объективно сравнивать разные LLM в контексте академического письма. Пока что работа не прошла рецензирование, поэтому к цифрам стоит относиться как к предварительным.
Что это даёт пользователю
Для практикующих исследователей и авторов научных статей SciIG открывает возможность:
- автоматически генерировать черновик введения, экономя время;
- проверять, насколько хорошо модель понимает контекст и не искажает факты;
- выбирать наиболее подходящую LLM для задач академического письма.
Разработчики и платформы, создающие инструменты для помощи учёным, могут использовать SciIG как часть своей системы оценки качества.
Что пока неизвестно
Детали методологии (например, точные размеры датасетов, промпты, гиперпараметры моделей) не раскрыты в доступной аннотации. Не указаны также авторы работы. Кроме того, результаты не прошли экспертную оценку — это препринт. Пока нельзя сказать, насколько хорошо модели справятся с введениями для других дисциплин, не связанных с машинным обучением и искусственным интеллектом.