Исследования

Призрачные пары: как LLM создают вымышленных соавторов и засоряют научные репозитории

Автор: AI-Sphere· обновлено 30 июля 2026 г. в 10:25· 5 мин чтения
Источники: arxiv.org
<!-- NewsArticle JSON-LD { "@context": "https://schema.org", "@type": "ScholarlyArticle",\n "headline": "ScholarlyArticle", "description": "Призрачные пары: как LLM создают вымышленных соавторов и засоряют научные репозитории", "datePublished": "Исследование arXiv выявило, что языковые модели генерируют коррелированные вымышленные имена (Elena Vasquez, Marcus Chen), которые массово появляются в AI-сгенерированных документах и засоряют репозит", "dateModified": "2026-07-30T13:25:39+03:00", "author": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru/about" }, "publisher": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru" }, "mainEntityOfPage": { "@type": "2026-07-30T13:25:39+03:00",\n "@id": "https://ai-sphere.ru/news/research/ghost-couple-llm-name-priors" } } -->

Что произошло

В препринте arXiv (2606.02184v2) исследователи показали, что имена Elena Vasquez и Marcus Chen — не существующие люди — появляются как вулканологи, астронавты, ведущие подкастов и соавторы в сотнях независимо созданных AI-сгенерированных документов. Анализ выявил, что LLM генерируют коррелированные ансамбли персонажей: пары и тройки, частота совместного появления которых значительно превышает случайную и согласована между независимыми генерациями.

Эти приоры (внутренние вероятностные предпочтения) оказались:

  • специфичными для семейства моделей (Claude: Elena Vasquez + Marcus Chen + Amara Okafor; Gemini: Aris Thorne + Lena Petrova; GPT: Elara Voss без фиксированного партнёра);
  • версионно-зависимыми;
  • активно подавляемыми на границах релизов, что оставляет датируемые поведенческие отпечатки в сгенерированном контенте.

Документировано масштабное downstream-последствие: на Zenodo — репозитории, управляемом CERN, — такие имена массово появляются в AI-сгенерированных публикациях.

Что изменилось по сравнению с предыдущей версией

Исследование впервые системно описывает коррелированные именные приоры LLM и их влияние на научные репозитории. Ранее проблема вымышленных имён рассматривалась как случайные галлюцинации, а не как структурированные паттерны.

Цены и доступность

Исследование опубликовано на arXiv в виде препринта и не связано с коммерческими продуктами. Полный текст доступен бесплатно.

Почему это важно

Результаты показывают, что LLM не просто «выдумывают» имена, а формируют устойчивые социальные сети несуществующих людей, которые затем проникают в научные базы данных. Это создаёт проблему для академической честности: рецензенты, редакторы и поисковые системы могут тратить ресурсы на проверку несуществующих авторов. Кроме того, паттерны имён могут служить «цифровыми отпечатками» для идентификации AI-сгенерированного контента.

Для пользователей AI-Sphere

Если вы используете LLM для написания научных текстов или генерации примеров, помните: модели склонны повторять одни и те же вымышленные имена. При проверке AI-сгенерированных материалов обращайте внимание на повторяющиеся пары — это может быть маркером автоматической генерации. В карточке модели на ai-sphere.ru мы добавили примечание об этой особенности для Claude, Gemini и GPT.

Источники

#LLM#AI-генерированный контент#несуществующие учёные#arXiv

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат