FAR.AI представил стандарт защиты AI-моделей и бенчмарк безопасности
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
FAR.AI представил стандарт защиты AI-моделей и бенчмарк безопасности
Кратко: FAR.AI опубликовал Minimal Standard for Safeguards версии 1.0 — набор из 67 статических техник джейлбрейка и методологию тестирования. Бенчмарк оценил четыре флагманские модели: Claude Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro и Grok 4.5 на устойчивость к атакам по 360 сценариям в области CBRNE и киберугроз. Введена метрика cost-to-jailbreak.
Что произошло
Исследователи FAR.AI разработали стандарт для оценки защитных механизмов AI-моделей. Версия 1.0 включает таксономию из 67 легко доступных статических методов джейлбрейка и способ комбинировать их в огромное пространство атак. Для проверки флагманских моделей использовали два набора данных, охватывающих 360 целей атак: химические, биологические, радиологические, ядерные и взрывные угрозы (CBRNE), а также наступательные кибероперации. Применялась трёхэтапная воронка для выявления универсальных джейлбрейков — шаблонов, которые вызывают операционно пригодные ответы более чем на 75% целей в домене. Дополнительно предложена метрика cost-to-jailbreak, моделирующая расходы атакующего.
Что изменилось по сравнению с предыдущей версией
Это первая версия стандарта, поэтому прямое сравнение с предыдущей версией отсутствует. Однако сам подход — публичная, воспроизводимая методология оценки безопасности — является новым для отрасли.
Цены и доступность
Результаты исследования опубликованы в виде препринта на arXiv. Цены на протестированные модели не раскрываются в рамках данной работы. Бенчмарк и стандарт доступны для ознакомления всем желающим.
Почему это важно
Разработчики флагманских AI-моделей всё чаще полагаются на многоуровневые защитные механизмы, однако до сих пор было мало публичных доказательств того, насколько эффективна такая защита и насколько она единообразна у разных компаний. Предложенный стандарт и лидерборд создают объективную основу для сравнения безопасности моделей, а метрика cost-to-jailbreak позволяет оценить практическую сложность атаки. Это шаг к прозрачности и подотчётности в области AI-безопасности.
Для пользователей AI-Sphere
Если вы разрабатываете или используете AI-решения, этот бенчмарк помогает понять, насколько текущие флагманские модели защищены от целенаправленных атак. Обратите внимание на методологию — она может быть полезна для собственных тестов безопасности. Следите за обновлениями на ai-sphere.ru: мы будем добавлять карточки протестированных моделей с результатами.
Источники