NINJA: Новый метод jailbreak-атак на длинноконтекстные языковые модели
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Исследователи представили метод NINJA (Needle-in-haystack jailbreak attack), который использует длинный контекст для обхода защиты языковых моделей. Атака показала высокую эффективность на HarmBench, обходя защиту LLaMA, Qwen, Mistral и Gemini.
Что произошло В препринте arXiv «Jailbreaking in the Haystack» описана техника, при которой к вредоносному запросу пользователя добавляется большой объём безвредного, сгенерированного моделью текста. Ключевое наблюдение: положение вредоносного запроса в этом длинном контексте критически влияет на успех атаки. NINJA требует минимальных вычислительных ресурсов, легко переносится между моделями и сложнее обнаруживается по сравнению с традиционными методами.
Что изменилось по сравнению с предыдущими версиями Традиционные jailbreak-методы (например, ручное составление промптов или оптимизация токенов) обычно либо ресурсоёмки, либо легко фильтруются. NINJA использует естественную уязвимость моделей к обработке длинных контекстов, не требуя доступа к внутренним параметрам (black-box) и оставаясь менее заметным для систем безопасности.
Цены и доступность На момент публикации метода не сообщается о коммерческой доступности или инструментах для использования NINJA. Исследование опубликовано в виде препринта на arXiv и не прошло рецензирование.
Почему это важно С ростом длины контекста (до миллиона токенов) возрастает и поверхность атаки. NINJA демонстрирует, что даже хорошо выровненные модели остаются уязвимыми, если вредоносный запрос «спрятан» среди большого объёма нейтрального текста. Это ставит новые задачи перед разработчиками систем безопасности AI.
Для пользователей AI-Sphere Пользователям, использующим длинноконтекстные модели (например, для обработки больших документов или агентов), стоит учитывать, что такие возможности могут использоваться для обхода защиты. Рекомендуется следить за обновлениями моделей LLaMA, Qwen, Mistral и Gemini, так как патчи безопасности вероятны.
Источники