Исследования

Исследование выявило систематическую небезопасность LLM в распознавании токсичности на урду

Автор: AI-Sphere· обновлено 26 августа 2026 г. в 02:46· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Исследование выявило систематическую небезопасность LLM в распознавании токсичности на урду

Кратко: Пять крупных языковых моделей (GPT-4o, Claude Sonnet 4.5, Gemini 2.5 Flash, Qwen-2.5, Llama-3.1) показали нестабильность классификации hate speech на урду от 15,9% до 31,6% при переводе с оригинального письма на английский. До 9,9% вредоносного контента, помеченного как опасный в английском переводе, остаётся незамеченным в оригинальном тексте на урду («Missed-in-Urdu»).

Что произошло

Исследователи проверили пять LLM на шести датасетах, охватывающих Nastaliq Urdu, Roman Urdu, английский и смешанный урду-английский. Для урду-скриптовых датасетов показатель нестабильности меток (label instability) между классификацией на оригинальном письме и на английском переводе составил:

  • Gemini 2.5 Flash: 15,9%
  • Qwen-2.5: 31,6%

Показатель «Missed-in-Urdu» (контент, признанный вредным в английском переводе, но пропущенный в оригинале) варьировался от 2,4% до 9,9% (медиана 4,3%).

Полный перебор всех 205 статей из девяти выпусков конференций ALW/WOAH через ACL Anthology API подтвердил, что ни одна из них не была посвящена урду.

Что изменилось по сравнению с предыдущей версией

Ранее отсутствовали целенаправленные исследования безопасности LLM для урду (десятый по распространённости язык в мире с 246 млн носителей). Данная работа — первая, систематически измеряющая cross-script несоответствия в модерации hate speech для этого языка.

Цены и доступность

Исследование опубликовано в виде препринта на arXiv (arXiv:2608.24191v1) и доступно бесплатно. Не является рецензированным.

Почему это важно

Проблема касается не только урду: она демонстрирует, что LLM, обученные преимущественно на английском, могут систематически пропускать вредоносный контент на других письменностях. Это ставит под вопрос безопасность автоматической модерации в мультиязычных средах. Для AI-Sphere это сигнал: при внедрении LLM для модерации контента на редких языках необходимо учитывать cross-script несоответствия.

Для пользователей AI-Sphere

Если вы используете LLM для анализа текстов на языках с нелатинским письмом (например, арабский, хинди, бенгали, урду), обратите внимание на риск пропуска вредоносного контента. Рекомендуется перепроверять результаты через перевод на английский. В карточке модели на ai-sphere.ru (например, GPT-4o, Claude, Gemini) теперь можно указать на эту особенность.

Источники

#LLM#безопасность#урду#модерация контента

Читайте также

GPT-4oЦены на GPT-4oClaude Sonnet 4.5Цены на AI-моделиGemini 2.5 FlashЦены на AI-моделиQwen-2.5Цены на AI-моделиLlama-3.1Цены на AI-модели

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат