Аудит ИИ-советников: ChatGPT чаще всего навязывает своё мнение при выборе товаров
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Авторы работы собрали набор из 2 528 реальных коммерческих запросов (ConsumerQ) и проанализировали 1 536 ответов от популярных систем: ChatGPT (в веб-версии и через API), Google Gemini (также в двух вариантах) и Google Search (AI Overviews).
Ключевой результат: ChatGPT выражает предпочтение от первого лица в 79% ответов, содержащих рекомендацию товара. Для сравнения, у Gemini этот показатель составил 7%, а у AI Overviews — 2%. Кроме того, ответы на повторяющиеся запросы часто различаются: модели могут менять рекомендуемые товары. Также заметна разница в источниках: для одного и того же запроса интерфейсы ChatGPT и Gemini в среднем делят лишь 5,4% доменов, а совпадений по доменам вообще может не быть.
Как проводился аудит
Исследователи использовали метод ИИ-аудита: они задавали системам вопросы о покупках и сравнивали ответы. Такой подход позволяет оценить не только точность, но и возможные смещения, связанные с монетизацией через рекламу. Поскольку и OpenAI, и Google внедряют рекламу в свои продукты, вопрос о том, насколько советы беспристрастны, становится особенно актуальным.
Почему это важно
Редакционный вывод: результаты показывают, что восприятие ИИ-советов как нейтрального источника информации может быть ошибочным. Если ChatGPT в подавляющем большинстве случаев говорит «я рекомендую», пользователь может принять это за объективную истину, хотя на деле модель формирует ответ на основе своих внутренних закономерностей и, возможно, рекламных интеграций. Это может означать, что доверие к ИИ-советам требует осторожности: даже если система не манипулирует явно, её ответы не являются статистически нейтральными.
Разница в источниках между системами также показательна: она говорит о том, что разные модели используют разные наборы данных и алгоритмы ранжирования, а значит, пользователь, полагающийся на один конкретный чат-бот, рискует получить однобокую картину.
Что это даёт пользователю
На практике это исследование — повод критически относиться к рекомендациям ИИ. Пользователю стоит:
- Сравнивать советы из нескольких источников, включая традиционные обзоры и мнения других людей.
- Понимать, что фраза «я рекомендую» в ответе ChatGPT — это не факт, а результат работы модели, которая может быть обучена на данных с рекламными предпочтениями.
- Проверять повторяемость ответов: если на один и тот же вопрос система даёт разные ответы, это сигнал о нестабильности рекомендаций.
Что пока неизвестно
В препринте не раскрываются детали того, как именно монетизация влияет на конкретные ответы. Неясно также, насколько результаты применимы к другим категориям товаров и услуг, помимо тех, что попали в выборку ConsumerQ. Поскольку работа опубликована в виде препринта arXiv, она ещё не прошла полное независимое рецензирование, и окончательные выводы делать преждевременно.