Исследования

Непреднамеренная утечка контекста: языковые модели могут выдавать секреты через безобидные ответы

Автор: AI-Sphere· обновлено 21 августа 2026 г. в 02:54· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В новой работе на arXiv (статья ещё не прошла рецензирование) авторы изучают феномен непреднамеренной утечки контекста в языковых моделях. Они показывают, что когда в контекстном окне модели присутствуют чувствительные данные (календари, учётные записи, медицинские записи, финансовая информация), сама по себе их наличие вводит скрытые корреляции в генерируемый моделью текст. Это позволяет злоумышленнику реконструировать секреты даже при условии, что модель корректно отказывается от прямого извлечения.

Исследователи разработали адаптивную атаку, которая работает в условиях чёрного ящика (без доступа к внутренним параметрам модели). В контролируемых экспериментах на восьми проприетарных моделях они добились почти идеального восстановления 2-значных секретов и 82% точного совпадения для 4-значных секретов. Атака использует обычные, не враждебные запросы, но при этом модель выступает как скрытый переносчик секретов.

Что изменилось по сравнению с предыдущей версией

Это новое исследование, а не обновление существующей работы. Ранее утечка контекста в основном рассматривалась как результат прямых инъекций или атак на извлечение. Данная работа показывает, что даже при отсутствии явных попыток извлечения, секреты могут быть восстановлены косвенно.

Цены и доступность

Исследование опубликовано на arXiv и находится в открытом доступе. Дата публикации: 2608.19857v1 (предположительно 26 августа 2025 года).

Почему это важно

Результаты ставят под сомнение безопасность использования языковых моделей для обработки конфиденциальных данных в контексте. Если модель может непреднамеренно «просачивать» секреты через обычные ответы, то даже при корректной реализации механизмов отказа от прямого раскрытия, данные могут быть скомпрометированы. Это особенно критично для AI-агентов, которые работают с личной информацией пользователей.

Для пользователей AI-Sphere

Пользователям AI-Sphere стоит учитывать, что даже если модель отказывается отвечать на прямой запрос о пароле или номере карты, эти данные могут быть восстановлены через серию безобидных вопросов. Рекомендуется минимизировать передачу чувствительных данных в контекстное окно, особенно при работе с проприетарными моделями. Следите за обновлениями в карточках моделей на ai-sphere.ru — мы будем добавлять информацию о защите от подобных атак.

Источники

https://arxiv.org/abs/2608.19857

#Language Models#Context Leakage#Security#Privacy#AI Safety

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат