Исследования

FAR.AI представил стандарт защиты AI-моделей и бенчмарк безопасности

Автор: AI-Sphere· обновлено 5 августа 2026 г. в 01:19· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

FAR.AI представил стандарт защиты AI-моделей и бенчмарк безопасности

Кратко: FAR.AI опубликовал Minimal Standard for Safeguards версии 1.0 — набор из 67 статических техник джейлбрейка и методологию тестирования. Бенчмарк оценил четыре флагманские модели: Claude Fable 5, GPT-5.6 Sol, Gemini 3.1 Pro и Grok 4.5 на устойчивость к атакам по 360 сценариям в области CBRNE и киберугроз. Введена метрика cost-to-jailbreak.

Что произошло

Исследователи FAR.AI разработали стандарт для оценки защитных механизмов AI-моделей. Версия 1.0 включает таксономию из 67 легко доступных статических методов джейлбрейка и способ комбинировать их в огромное пространство атак. Для проверки флагманских моделей использовали два набора данных, охватывающих 360 целей атак: химические, биологические, радиологические, ядерные и взрывные угрозы (CBRNE), а также наступательные кибероперации. Применялась трёхэтапная воронка для выявления универсальных джейлбрейков — шаблонов, которые вызывают операционно пригодные ответы более чем на 75% целей в домене. Дополнительно предложена метрика cost-to-jailbreak, моделирующая расходы атакующего.

Что изменилось по сравнению с предыдущей версией

Это первая версия стандарта, поэтому прямое сравнение с предыдущей версией отсутствует. Однако сам подход — публичная, воспроизводимая методология оценки безопасности — является новым для отрасли.

Цены и доступность

Результаты исследования опубликованы в виде препринта на arXiv. Цены на протестированные модели не раскрываются в рамках данной работы. Бенчмарк и стандарт доступны для ознакомления всем желающим.

Почему это важно

Разработчики флагманских AI-моделей всё чаще полагаются на многоуровневые защитные механизмы, однако до сих пор было мало публичных доказательств того, насколько эффективна такая защита и насколько она единообразна у разных компаний. Предложенный стандарт и лидерборд создают объективную основу для сравнения безопасности моделей, а метрика cost-to-jailbreak позволяет оценить практическую сложность атаки. Это шаг к прозрачности и подотчётности в области AI-безопасности.

Для пользователей AI-Sphere

Если вы разрабатываете или используете AI-решения, этот бенчмарк помогает понять, насколько текущие флагманские модели защищены от целенаправленных атак. Обратите внимание на методологию — она может быть полезна для собственных тестов безопасности. Следите за обновлениями на ai-sphere.ru: мы будем добавлять карточки протестированных моделей с результатами.

Источники

https://arxiv.org/abs/2608.03070v1

#безопасность ИИ#джейлбрейк#бенчмарк#FAR.AI

Читайте также

FAR.AIНовости FAR.AI

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат