Непреднамеренная утечка контекста: языковые модели могут выдавать секреты через безобидные ответы
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
В новой работе на arXiv (статья ещё не прошла рецензирование) авторы изучают феномен непреднамеренной утечки контекста в языковых моделях. Они показывают, что когда в контекстном окне модели присутствуют чувствительные данные (календари, учётные записи, медицинские записи, финансовая информация), сама по себе их наличие вводит скрытые корреляции в генерируемый моделью текст. Это позволяет злоумышленнику реконструировать секреты даже при условии, что модель корректно отказывается от прямого извлечения.
Исследователи разработали адаптивную атаку, которая работает в условиях чёрного ящика (без доступа к внутренним параметрам модели). В контролируемых экспериментах на восьми проприетарных моделях они добились почти идеального восстановления 2-значных секретов и 82% точного совпадения для 4-значных секретов. Атака использует обычные, не враждебные запросы, но при этом модель выступает как скрытый переносчик секретов.
Что изменилось по сравнению с предыдущей версией
Это новое исследование, а не обновление существующей работы. Ранее утечка контекста в основном рассматривалась как результат прямых инъекций или атак на извлечение. Данная работа показывает, что даже при отсутствии явных попыток извлечения, секреты могут быть восстановлены косвенно.
Цены и доступность
Исследование опубликовано на arXiv и находится в открытом доступе. Дата публикации: 2608.19857v1 (предположительно 26 августа 2025 года).
Почему это важно
Результаты ставят под сомнение безопасность использования языковых моделей для обработки конфиденциальных данных в контексте. Если модель может непреднамеренно «просачивать» секреты через обычные ответы, то даже при корректной реализации механизмов отказа от прямого раскрытия, данные могут быть скомпрометированы. Это особенно критично для AI-агентов, которые работают с личной информацией пользователей.
Для пользователей AI-Sphere
Пользователям AI-Sphere стоит учитывать, что даже если модель отказывается отвечать на прямой запрос о пароле или номере карты, эти данные могут быть восстановлены через серию безобидных вопросов. Рекомендуется минимизировать передачу чувствительных данных в контекстное окно, особенно при работе с проприетарными моделями. Следите за обновлениями в карточках моделей на ai-sphere.ru — мы будем добавлять информацию о защите от подобных атак.