AI-агенты

Goodfire находит вредоносных AI-агентов в 4,5 раза дешевле традиционного мониторинга

Автор: AI-Sphere· обновлено 8 октября 2026 г. в 16:55· 6 мин чтения
Источники: techcrunch.com
Стартап Goodfire представил технологию «внутреннего мониторинга» AI-агентов, которая позволяет выявлять нежелательное или вредоносное поведение со значительно меньшими вычислительными затратами, чем традиционные методы. В тестах на модели Kimi K3 стоимость проверки 1500 сессий составила около $51, тогда как использование более дешёвой AI-модели для сплошного анализа обошлось бы в $233.

Стартап Goodfire представил технологию «внутреннего мониторинга» AI-агентов, которая позволяет выявлять нежелательное или вредоносное поведение со значительно меньшими вычислительными затратами, чем традиционные методы. В тестах на модели Kimi K3 стоимость проверки 1500 сессий составила около $51, тогда как использование более дешёвой AI-модели для сплошного анализа обошлось бы в $233.

Что произошло

Goodfire опубликовала результаты испытаний своего подхода, получившего название «inside-out monitors». Вместо того чтобы запускать отдельную дорогую модель для анализа каждого действия агента (что типично для внешнего мониторинга), новый метод анализирует внутренние состояния самой модели-агента. Это позволило снизить затраты в 4,57 раза при сохранении способности обнаруживать отклонения.

Тестирование проводилось на модели Kimi K3. При 1500 сессиях мониторинг через Goodfire стоил $51, а альтернативный подход с непрерывной проверкой каждой сессии — $233. Разница становится ещё более заметной при масштабировании: чем больше агентов работает в системе, тем значительнее экономия.

Как работает «внутренний мониторинг»

Традиционные системы безопасности для AI-агентов обычно используют внешний ИИ, который читает логи выходных данных агента и ищет признаки вредоносного поведения. Это эффективно, но требует постоянной работы второго ИИ, что приводит к высоким операционным расходам.

Goodfire предлагает другой подход: анализировать не то, что агент делает вовне, а то, как он принимает решения внутри своей нейросети. По сути, мониторинг встраивается в сам процесс генерации ответов, а не накладывается поверх. Это напоминает методологию интерпретируемости, когда исследователи изучают активации нейронов, чтобы понять, о чём «думает» модель.

Почему это важно

Рынок AI-агентов быстро растёт: компании автоматизируют клиентскую поддержку, обработку документов, финансовые операции. Однако каждый агент потенциально может выдать неверный результат, проигнорировать инструкции или поддаться атаке через промпт-инжиниринг. Без эффективного мониторинга внедрение таких систем рискованно.

Традиционный мониторинг стоит дорого, поэтому многие компании либо ограничивают число проверок, либо вовсе отказываются от глубокого контроля. Редакционный вывод: если Goodfire масштабирует своё решение, это может снизить барьер входа для использования агентов в чувствительных сферах. Однако пока неясно, насколько хорошо метод работает против всех видов угроз и подходит ли для любых архитектур моделей.

Что это даёт пользователю

Для разработчиков и компаний, внедряющих AI-агентов, технология Goodfire означает возможность:

  • Организовать непрерывный мониторинг без взрывного роста затрат на облачные вычисления.
  • Быстрее выявлять аномалии в поведении агентов, не дожидаясь дорогостоящего аудита.
  • Масштабировать число активных агентов, оставаясь в рамках бюджета на безопасность.

На практике это может ускорить внедрение AI-агентов в среднем бизнесе, где раньше стоимость мониторинга была сопоставима с зарплатой оператора.

Что пока неизвестно

Goodfire не раскрыла, на каких принципах точно основан «внутренний мониторинг» — требуется ли доступ к весам модели, работает ли техника на проприетарных моделях вроде GPT-4 или только на открытых. Также нет данных о точности обнаружения вредоносного поведения в процентах и о ложных срабатываниях. Информация о том, когда технология станет коммерчески доступна, отсутствует.

Источники

https://techcrunch.com/2026/10/08/goodfire-says-its-new-inside-out-monitors-catch-rogue-ai-agents-at-a-fraction-of-the-cost/

#Goodfire#мониторинг ИИ#безопасность ИИ#агенты ИИ

Читайте также

→ GoodfireНовости Goodfire

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат