Призрачные пары: как LLM создают вымышленных соавторов и засоряют научные репозитории
Что произошло
В препринте arXiv (2606.02184v2) исследователи показали, что имена Elena Vasquez и Marcus Chen — не существующие люди — появляются как вулканологи, астронавты, ведущие подкастов и соавторы в сотнях независимо созданных AI-сгенерированных документов. Анализ выявил, что LLM генерируют коррелированные ансамбли персонажей: пары и тройки, частота совместного появления которых значительно превышает случайную и согласована между независимыми генерациями.
Эти приоры (внутренние вероятностные предпочтения) оказались:
- специфичными для семейства моделей (Claude: Elena Vasquez + Marcus Chen + Amara Okafor; Gemini: Aris Thorne + Lena Petrova; GPT: Elara Voss без фиксированного партнёра);
- версионно-зависимыми;
- активно подавляемыми на границах релизов, что оставляет датируемые поведенческие отпечатки в сгенерированном контенте.
Документировано масштабное downstream-последствие: на Zenodo — репозитории, управляемом CERN, — такие имена массово появляются в AI-сгенерированных публикациях.
Что изменилось по сравнению с предыдущей версией
Исследование впервые системно описывает коррелированные именные приоры LLM и их влияние на научные репозитории. Ранее проблема вымышленных имён рассматривалась как случайные галлюцинации, а не как структурированные паттерны.
Цены и доступность
Исследование опубликовано на arXiv в виде препринта и не связано с коммерческими продуктами. Полный текст доступен бесплатно.
Почему это важно
Результаты показывают, что LLM не просто «выдумывают» имена, а формируют устойчивые социальные сети несуществующих людей, которые затем проникают в научные базы данных. Это создаёт проблему для академической честности: рецензенты, редакторы и поисковые системы могут тратить ресурсы на проверку несуществующих авторов. Кроме того, паттерны имён могут служить «цифровыми отпечатками» для идентификации AI-сгенерированного контента.
Для пользователей AI-Sphere
Если вы используете LLM для написания научных текстов или генерации примеров, помните: модели склонны повторять одни и те же вымышленные имена. При проверке AI-сгенерированных материалов обращайте внимание на повторяющиеся пары — это может быть маркером автоматической генерации. В карточке модели на ai-sphere.ru мы добавили примечание об этой особенности для Claude, Gemini и GPT.