Goodfire находит вредоносных AI-агентов в 4,5 раза дешевле традиционного мониторинга
Стартап Goodfire представил технологию «внутреннего мониторинга» AI-агентов, которая позволяет выявлять нежелательное или вредоносное поведение со значительно меньшими вычислительными затратами, чем традиционные методы. В тестах на модели Kimi K3 стоимость проверки 1500 сессий составила около $51, тогда как использование более дешёвой AI-модели для сплошного анализа обошлось бы в $233.
Что произошло
Goodfire опубликовала результаты испытаний своего подхода, получившего название «inside-out monitors». Вместо того чтобы запускать отдельную дорогую модель для анализа каждого действия агента (что типично для внешнего мониторинга), новый метод анализирует внутренние состояния самой модели-агента. Это позволило снизить затраты в 4,57 раза при сохранении способности обнаруживать отклонения.
Тестирование проводилось на модели Kimi K3. При 1500 сессиях мониторинг через Goodfire стоил $51, а альтернативный подход с непрерывной проверкой каждой сессии — $233. Разница становится ещё более заметной при масштабировании: чем больше агентов работает в системе, тем значительнее экономия.
Как работает «внутренний мониторинг»
Традиционные системы безопасности для AI-агентов обычно используют внешний ИИ, который читает логи выходных данных агента и ищет признаки вредоносного поведения. Это эффективно, но требует постоянной работы второго ИИ, что приводит к высоким операционным расходам.
Goodfire предлагает другой подход: анализировать не то, что агент делает вовне, а то, как он принимает решения внутри своей нейросети. По сути, мониторинг встраивается в сам процесс генерации ответов, а не накладывается поверх. Это напоминает методологию интерпретируемости, когда исследователи изучают активации нейронов, чтобы понять, о чём «думает» модель.
Почему это важно
Рынок AI-агентов быстро растёт: компании автоматизируют клиентскую поддержку, обработку документов, финансовые операции. Однако каждый агент потенциально может выдать неверный результат, проигнорировать инструкции или поддаться атаке через промпт-инжиниринг. Без эффективного мониторинга внедрение таких систем рискованно.
Традиционный мониторинг стоит дорого, поэтому многие компании либо ограничивают число проверок, либо вовсе отказываются от глубокого контроля. Редакционный вывод: если Goodfire масштабирует своё решение, это может снизить барьер входа для использования агентов в чувствительных сферах. Однако пока неясно, насколько хорошо метод работает против всех видов угроз и подходит ли для любых архитектур моделей.
Что это даёт пользователю
Для разработчиков и компаний, внедряющих AI-агентов, технология Goodfire означает возможность:
- Организовать непрерывный мониторинг без взрывного роста затрат на облачные вычисления.
- Быстрее выявлять аномалии в поведении агентов, не дожидаясь дорогостоящего аудита.
- Масштабировать число активных агентов, оставаясь в рамках бюджета на безопасность.
На практике это может ускорить внедрение AI-агентов в среднем бизнесе, где раньше стоимость мониторинга была сопоставима с зарплатой оператора.
Что пока неизвестно
Goodfire не раскрыла, на каких принципах точно основан «внутренний мониторинг» — требуется ли доступ к весам модели, работает ли техника на проприетарных моделях вроде GPT-4 или только на открытых. Также нет данных о точности обнаружения вредоносного поведения в процентах и о ложных срабатываниях. Информация о том, когда технология станет коммерчески доступна, отсутствует.