AgentProv: новый метод аудита подлинности LLM в agentic API
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Группа исследователей опубликовала на arXiv препринт с описанием метода AgentProv (Agentic Provenance). Работа посвящена аудиту провайдеров LLM API, работающих в agentic-режиме — то есть когда модель получает возможность вызывать внешние инструменты (функции) и возвращает не текст, а структурированные команды. В таких сервисах (среди примеров — OpenAI, Anthropic, Gemini, Cloudflare Workers AI, LangGraph) современные серверные стеки отбрасывают текстовые ответы и выдают только действия. Текст-канал становится бесполезным для верификации. Авторы предлагают новый канал — анализ самих вызовов инструментов, который остаётся доступным и слабо зависит от контекста развёртывания.
Как работает AgentProv
AgentProv опирается на наблюдение, что современное post-training для agentic задач встраивает использование инструментов непосредственно в веса модели. Это означает, что модель при запросе на вызов инструмента генерирует специфические паттерны действий, которые можно измерить и сопоставить с эталоном. Исследователи создают пробные запросы (tool-use policy probes), которые провоцируют модель на вызов определённых инструментов. Анализируя возвращаемые структурированные ответы (какие инструменты выбраны, в каком порядке, с какими аргументами), AgentProv может определить, действительно ли сервер использует заявленную модель или её замену. Важно, что этот канал не требует доступа к текстовому выводу и устойчив к манипуляциям со стороны провайдера, так как логика вызовов инструментов жёстко зашита в веса и её трудно подделать без потери совместимости.
Почему это важно
Редакционный анализ: скрытая подмена модели — серьёзная проблема для бизнеса, который полагается на конкретные характеристики LLM (качество, скорость, стоимость). Например, если провайдер обещает GPT-4, а использует квантированную версию меньшей модели, это может привести к ошибкам в задачах, требующих высокой точности, особенно при agentic вызовах (например, автоматическое заведение тикетов, управление API, генерация кода). AgentProv впервые предлагает надёжный способ аудита именно для agentic API, где традиционные методы бессильны. Это может изменить практику взаимоотношений клиентов и провайдеров, повышая прозрачность и доверие к cloud API.
Что это даёт пользователю
Разработчики и инженеры, использующие LLM API с поддержкой инструментов (function calling), смогут внедрить автоматическую проверку подлинности модели в свои CI/CD пайплайны или мониторинг. Вместо того чтобы полагаться на декларации провайдера, можно запускать набор AgentProv-проб регулярно и сравнивать результаты с эталонными для конкретной модели. Это особенно актуально при смене версии API или при подключении через сторонних реселлеров (например, Cloudflare Workers AI). Практический сценарий — создание внутреннего аудита, который перед каждым важным запуском агента проверяет, что используемая модель действительно та, за которую платят.
Что пока неизвестно
Препринт не раскрывает точных метрик точности и полноты метода. Не указано, сколько запросов требуется для достоверного вывода и каков уровень ложноположительных или ложноотрицательных результатов. Также неясно, насколько метод устойчив против целенаправленных атак провайдера, который может попытаться эмулировать поведение целевой модели. Работа ещё не прошла рецензирование, поэтому выводы следует рассматривать как предварительные.