Исследования

Know Your Agent: новый метод тестирования ИИ-агентов на устойчивость к атакам

Автор: AI-Sphere· обновлено 16 сентября 2026 г. в 09:56· 7 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

Авторы работы исходят из того, что традиционное тестирование на проникновение (пентест) всегда включает этап разведки: специалист изучает систему, находит уязвимости и только потом строит атаку. По их мнению, ИИ-агенты требуют такого же подхода.

В препринте авторы формализуют понятие «разведки агента»: описывают процесс, а также определяют, какие именно знания нужны атакующему, как они используются и какие слабости агента позволяют злоумышленнику получить преимущество. Эти знания применяются в атаках типа indirect prompt injection — когда вредоносная инструкция попадает в агента не напрямую, а через внешние данные, например содержимое веб-страницы или документа.

На основе этих идей создан фреймворк KYA. Он автоматизирует чёрный ящик пентеста: система зондирует агента, собирает информацию в целевой профиль и использует его для создания более сильных атак. Другими словами, вместо случайных проверок KYA сначала изучает агента, а затем бьёт точно в слабые места.

Эффективность KYA проверена на бенчмарках безопасности агентов и на реальном агенте для написания кода. Авторы обещают опубликовать код фреймворка, бенчмарки и базовые реализации для воспроизводимости результатов.

Как это работает на практике

Представьте, что у вас есть ИИ-агент, который читает почту и может отправлять ответы. Злоумышленник может встроить скрытую инструкцию в письмо. Агент прочитает письмо и, сам того не желая, выполнит команду, например отправит конфиденциальные данные на чужой адрес. Это и есть непрямая инъекция промпта.

KYA автоматизирует поиск таких уязвимостей. Фреймворк не просто отправляет агенту случайные вредоносные запросы, а сначала изучает его поведение, реакцию на разные типы данных и границы дозволенного. На основе собранного профиля KYA генерирует атаки, которые с большей вероятностью сработают.

Такой подход позволяет разработчикам и специалистам по безопасности находить уязвимости до того, как их обнаружат злоумышленники. Это особенно важно для агентов, которые работают с внешними данными из интернета или от сторонних сервисов.

Почему это важно

ИИ-агенты становятся всё более автономными и получают доступ к чувствительным данным и действиям. Чем больше полномочий, тем серьёзнее последствия ошибки или атаки. Классические методы тестирования безопасности, ориентированные на обычные приложения, не всегда подходят для агентов из-за их способности к планированию и работе с непредсказуемыми внешними данными.

Редакционный вывод: предложенный подход может стать шагом к стандартизации проверки безопасности ИИ-агентов. Вместо разрозненных тестов появляется систематический метод, который повторяет логику атакующего: сначала разведка, потом атака. Это может означать, что безопасность агентов станет более предсказуемой и проверяемой.

Что это даёт пользователю

Для разработчиков и компаний, которые внедряют ИИ-агентов, KYA предлагает практический инструмент для оценки рисков. Фреймворк может использоваться для регулярных проверок: запустил тест — получил отчёт об уязвимостях. Это позволяет:

  • обнаруживать слабые места до выхода продукта в продакшн;
  • проверять, насколько агент устойчив к манипуляциям через внешние данные;
  • сравнивать эффективность разных защитных мер.

Открытый код и бенчмарки, которые обещают авторы, означают, что сообщество сможет воспроизвести результаты и развивать метод дальше.

Что пока неизвестно

Работа опубликована в виде препринта и не прошла рецензирование. Конкретные результаты тестов на бенчмарках и реальном агенте в аннотации не раскрываются. Неизвестно также, насколько хорошо KYA справляется с агентами разных архитектур и насколько сложно внедрить фреймворк в существующие процессы разработки. Полные данные появятся после публикации полного текста работы.

Источники

#AI-агенты#пентест#безопасность#разведка

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат