Эмодзи выявляют пробелы в безопасности LLM: исследование arXiv
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Эмодзи выявляют пробелы в безопасности LLM: исследование arXiv
Кратко: Безопасность больших языковых моделей (LLM) обычно оценивается с помощью текстовых adversarial-промптов. Новое исследование показало, что замена части текста на эмодзи может выявить скрытые уязвимости. Gemma 2 9B и Mistral 7B продемонстрировали 10% успешных атак, Llama 3 8B — 6%, а Qwen 2 7B оказался полностью устойчив.
Что произошло Авторы работы "Are LLMs Safe Beyond Text: Do Emojis Expose Gaps in Safety Evaluation" протестировали 50 эмодзи-аугментированных промптов на четырёх открытых LLM: Mistral 7B, Qwen 2 7B, Gemma 2 9B и Llama 3 8B. Результаты показали значительные различия в отказоустойчивости:
- Gemma 2 9B и Mistral 7B — 10% успешных атак.
- Llama 3 8B — 6%.
- Qwen 2 7B — 0% (полная устойчивость). Статистический тест (χ² = 32.94, p < 0.001) подтвердил, что различия между моделями неслучайны.
Что изменилось по сравнению с предыдущей версией В отличие от стандартных текстовых adversarial-оценок, которые доминируют в существующих практиках безопасности, эмодзи-промпты вскрывают уязвимости, невидимые при обычном тестировании. Это указывает на то, что безопасность LLM чувствительна к форме представления входных данных, и оценки, основанные только на тексте, могут недооценивать риски.
Цены и доступность Исследование опубликовано в виде препринта на arXiv (ID: 2608.18164). Все участвовавшие модели — открытые и доступны для скачивания и тестирования.
Почему это важно Результаты ставят под сомнение надёжность текущих методик оценки безопасности LLM, которые полагаются исключительно на текст. Если модели могут быть обойдены с помощью эмодзи, то и другие нестандартные входные форматы (изображения, аудио, символы) могут содержать скрытые риски. Это требует пересмотра подходов к безопасности мультимодальных AI-систем.
Для пользователей AI-Sphere При разработке приложений на базе открытых LLM учитывайте, что даже обычные эмодзи в пользовательском вводе могут привести к нежелательным ответам. Рекомендуется тестировать модели на нестандартных входах и выбирать более устойчивые варианты, например Qwen 2 7B, который показал нулевую уязвимость в данном эксперименте.
Источники