Исследования

Ошибки LLM при поиске научной литературы: новое исследование на примере экологических наук

Автор: AI-Sphere· обновлено 6 октября 2026 г. в 08:22· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

Группа исследователей опубликовала на arXiv препринт, в котором сравнила работу шести широко используемых LLM-платформ: Claude, ChatGPT, Grok, DeepSeek, Perplexity и Gemini. Задача моделей заключалась в том, чтобы найти по 10 библиографических ссылок к 50 случайно выбранным оригинальным статьям из пяти ведущих журналов по экологии и устойчивому развитию (Energy and Environmental Science, Nature Sustainability, Nature Climate Change, Lancet Planetary Health, Environmental Science and Technology) за 2024–2025 годы.

Каждой модели давали в качестве промпта либо только аннотацию статьи, либо её полный текст. Полученные ссылки затем оценивались по мультиметрическому показателю, который включал: валидность библиографических данных, наличие ссылки на Google Scholar, корректность цифрового идентификатора объекта (DOI) и присутствие записи в Scopus. Таким образом, исследователи стремились измерить не просто количество найденных статей, а именно качество и достоверность информации.

Почему это важно

Использование LLM для обзора литературы становится всё популярнее среди учёных и студентов. Однако данное исследование ставит под сомнение их надёжность в этой задаче. Если модель неверно указывает авторов, название журнала или DOI, это может привести к ошибкам в цитировании и даже к включению несуществующих работ в научные обзоры. Особенно критично, что ошибки могут различаться в зависимости от того, использует ли пользователь аннотацию или полный текст. Редакционный вывод: это означает, что доверять автоматическому поиску литературы пока преждевременно — необходима верификация каждой ссылки вручную, особенно при подготовке серьёзных научных публикаций.

Что это даёт пользователю

Практический вывод для исследователей и студентов: LLM можно использовать как вспомогательный инструмент для первичного поиска релевантных статей, но не как единственный источник библиографической информации. Например, можно попросить модель предложить список работ по теме, а затем вручную проверить каждую ссылку через базы данных (Scopus, Google Scholar) или каталоги библиотек. Если есть возможность, лучше передавать модели полный текст статьи, а не только аннотацию, так как полный текст содержит больше контекста и может снизить вероятность ошибок. Кроме того, стоит сравнивать результаты, полученные от разных LLM, чтобы выявить возможные расхождения.

Что пока неизвестно

Исследование пока не прошло рецензирование, а в опубликованной аннотации не приведены количественные показатели ошибок для каждой модели. Неясно, какие именно типы ошибок встречаются чаще — неверные названия, авторы, DOI или отсутствие ссылок на Google Scholar. Также неизвестно, насколько результаты применимы к другим научным областям, кроме экологических наук. Полные данные и статистический анализ, вероятно, будут раскрыты после публикации рецензированной версии статьи.

Источники

https://arxiv.org/abs/2610.05690

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат