Исследование выявило неявные предубеждения в языковых моделях в отношении людей с интеллектуальными нарушениями
Исследование выявило неявные предубеждения в языковых моделях в отношении людей с интеллектуальными нарушениями
Кратко: Ученые изучили наличие неявных предубеждений (implicit bias) в пяти крупных языковых моделях, включая GPT-4 и Claude, по отношению к людям с интеллектуальными нарушениями (ID). Анализ 25 000 сгенерированных историй показал различия в том, как модели представляют людей с ID и без ID.
Что произошло
В работе, опубликованной на arXiv (препринт, не рецензирован), исследователи использовали модель GPT-4-Turbo для генерации историй на основе 10 типов промптов — с указанием и без указания на интеллектуальные нарушения. Затем процесс повторили с четырьмя другими LLM: OpenAI GPT-4o, Meta Llama-3-3-70B-Instruct, Anthropic Claude-3-5-Sonnet и Mistral-Large-2411. Всего было получено 25 000 текстов. Для выявления различий в представлении людей применялся отдельный экземпляр GPT-4-Turbo, который искал темы предвзятости, описанные в предыдущей литературе.
Что изменилось по сравнению с предыдущей версией
Это новое исследование, а не обновление. Ранее схожие работы фокусировались на явных стереотипах или на предвзятости по другим признакам (раса, пол). Данное исследование впервые системно анализирует неявные смещения именно в отношении людей с интеллектуальными нарушениями сразу в нескольких современных моделях.
Цены и доступность
Исследование опубликовано на arXiv как препринт. Сами модели (GPT-4, Claude, Llama, Mistral) доступны через API или открытые версии. Результаты не привязаны к конкретной коммерческой версии.
Почему это важно
Неявные предубеждения в языковых моделях могут приводить к дискриминационным или стигматизирующим ответам при общении с пользователями или при генерации контента. Выявление таких смещений — первый шаг к их устранению и созданию более инклюзивных AI-систем. Работа показывает, что проблема затрагивает не одну модель, а широкий спектр современных LLM.
Для пользователей AI-Sphere
Если вы используете LLM-чат-модели в проектах, связанных с людьми с ограниченными возможностями, стоит учитывать потенциальные искажения. Полный текст препринта доступен на arXiv. Рекомендуем ознакомиться с методологией, чтобы оценить риски в ваших сценариях.
Краткое объяснение технологии простыми словами
Исследователи попросили языковые модели написать короткие истории на одни и те же темы, но с разными вводными — например, «расскажи о человеке, который любит читать» и «расскажи о человеке с интеллектуальными нарушениями, который любит читать». Затем специальный алгоритм сравнил, какие слова, роли и характеристики модели используют в обоих случаях. Если в историях про людей с ID чаще встречаются негативные оттенки или ограниченные сценарии — это и есть неявное предубеждение.
Источники