Исследования

Эмодзи выявляют пробелы в безопасности LLM: исследование arXiv

Автор: AI-Sphere· обновлено 20 августа 2026 г. в 01:54· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Эмодзи выявляют пробелы в безопасности LLM: исследование arXiv

Кратко: Безопасность больших языковых моделей (LLM) обычно оценивается с помощью текстовых adversarial-промптов. Новое исследование показало, что замена части текста на эмодзи может выявить скрытые уязвимости. Gemma 2 9B и Mistral 7B продемонстрировали 10% успешных атак, Llama 3 8B — 6%, а Qwen 2 7B оказался полностью устойчив.

Что произошло Авторы работы "Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation" протестировали 50 эмодзи-аугментированных промптов на четырёх открытых LLM: Mistral 7B, Qwen 2 7B, Gemma 2 9B и Llama 3 8B. Результаты показали значительные различия в отказоустойчивости:

  • Gemma 2 9B и Mistral 7B — 10% успешных атак.
  • Llama 3 8B — 6%.
  • Qwen 2 7B — 0% (полная устойчивость). Статистический тест (χ² = 32.94, p < 0.001) подтвердил, что различия между моделями неслучайны.

Что изменилось по сравнению с предыдущей версией В отличие от стандартных текстовых adversarial-оценок, которые доминируют в существующих практиках безопасности, эмодзи-промпты вскрывают уязвимости, невидимые при обычном тестировании. Это указывает на то, что безопасность LLM чувствительна к форме представления входных данных, и оценки, основанные только на тексте, могут недооценивать риски.

Цены и доступность Исследование опубликовано в виде препринта на arXiv (ID: 2608.18164). Все участвовавшие модели — открытые и доступны для скачивания и тестирования.

Почему это важно Результаты ставят под сомнение надёжность текущих методик оценки безопасности LLM, которые полагаются исключительно на текст. Если модели могут быть обойдены с помощью эмодзи, то и другие нестандартные входные форматы (изображения, аудио, символы) могут содержать скрытые риски. Это требует пересмотра подходов к безопасности мультимодальных AI-систем.

Для пользователей AI-Sphere При разработке приложений на базе открытых LLM учитывайте, что даже обычные эмодзи в пользовательском вводе могут привести к нежелательным ответам. Рекомендуется тестировать модели на нестандартных входах и выбирать более устойчивые варианты, например Qwen 2 7B, который показал нулевую уязвимость в данном эксперименте.

Источники

#LLM#безопасность#эмодзи#уязвимость

Читайте также

Mistral 7BЦены на AI-моделиQwen 2 7BЦены на AI-моделиGemma 2 9BЦены на AI-моделиLlama 3 8BЦены на AI-модели

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат