Исследование выявило систематическую небезопасность LLM в распознавании токсичности на урду
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Исследование выявило систематическую небезопасность LLM в распознавании токсичности на урду
Кратко: Пять крупных языковых моделей (GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5, Llama-3.1) показали нестабильность классификации hate speech на урду от 15,9% до 31,6% при переводе с оригинального письма на английский. До 9,9% вредоносного контента, помеченного как опасный в английском переводе, остаётся незамеченным в оригинальном тексте на урду («Missed-in-Urdu»).
Что произошло
Исследователи проверили пять LLM на шести датасетах, охватывающих Nastaliq Urdu, Roman Urdu, английский и смешанный урду-английский. Для урду-скриптовых датасетов показатель нестабильности меток (label instability) между классификацией на оригинальном письме и на английском переводе составил:
- Gemini 2.5 Flash: 15,9%
- Qwen-2.5: 31,6%
Показатель «Missed-in-Urdu» (контент, признанный вредным в английском переводе, но пропущенный в оригинале) варьировался от 2,4% до 9,9% (медиана 4,3%).
Полный перебор всех 205 статей из девяти выпусков конференций ALW/WOAH через ACL Anthology API подтвердил, что ни одна из них не была посвящена урду.
Что изменилось по сравнению с предыдущей версией
Ранее отсутствовали целенаправленные исследования безопасности LLM для урду (десятый по распространённости язык в мире с 246 млн носителей). Данная работа — первая, систематически измеряющая cross-script несоответствия в модерации hate speech для этого языка.
Цены и доступность
Исследование опубликовано в виде препринта на arXiv (arXiv:2608.24191v1) и доступно бесплатно. Не является рецензированным.
Почему это важно
Проблема касается не только урду: она демонстрирует, что LLM, обученные преимущественно на английском, могут систематически пропускать вредоносный контент на других письменностях. Это ставит под вопрос безопасность автоматической модерации в мультиязычных средах. Для AI-Sphere это сигнал: при внедрении LLM для модерации контента на редких языках необходимо учитывать cross-script несоответствия.
Для пользователей AI-Sphere
Если вы используете LLM для анализа текстов на языках с нелатинским письмом (например, арабский, хинди, бенгали, урду), обратите внимание на риск пропуска вредоносного контента. Рекомендуется перепроверять результаты через перевод на английский. В карточке модели на ai-sphere.ru (например, GPT-4o, Claude, Gemini) теперь можно указать на эту особенность.