Latent Space Refusal Anchoring: механическое восстановление безопасности моделей без дообучения
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Модели, обученные с инструкциями, часто отказывают на вредоносные запросы на английском, но выполняют те же запросы на йоруба, игбо, игала и хауса. Исследователи разработали Latent Space Refusal Anchoring (LSR-Anchoring) — метод, который извлекает направление отказа из английских промптов и закрепляет его в остаточном потоке на этапе инференса, не требуя дообучения или размеченных данных.
Что произошло: LSR-Anchoring позволяет восстановить механизм отказа для низкоресурсных африканских языков без сбора данных и переобучения. Основной вариант метода, Mean-Activation Steering (MAS), протестирован на четырёх архитектурах: Llama-3-8B, Llama-3.1-70B, Mistral-7B-Instruct и Qwen2.5-7B. На Mistral и Qwen метод восстанавливает безопасность с ухудшением качества ответов ниже 0.08. На Llama-3-8B наблюдается чрезмерная коррекция: показатель DPL (ухудшение производительности на легитимных запросах) достигает 1.00.
Что изменилось по сравнению с предыдущей версией: Ранее для восстановления отказов на низкоресурсных языках требовались размеченные данные на целевом языке и дообучение модели. LSR-Anchoring — первый тренировочно-свободный (training-free) подход, решающий эту задачу без дополнительных вычислительных затрат.
Цены и доступность: Исследование опубликовано в виде препринта на arXiv (arXiv:2608.18089v1). Метод является открытым; код и детали реализации не указаны в аннотации. Доступность в России: стандартная — препринт доступен для скачивания.
Почему это важно: Проблема языковой предвзятости в системах безопасности LLM давно известна. Англоцентричные модели могут корректно блокировать вредоносные запросы на английском, но пропускать их на других языках. LSR-Anchoring предлагает механическое решение, которое не требует дорогих датасетов и переобучения, что критически важно для сотен африканских языков с ограниченными ресурсами.
Для пользователей AI-Sphere: Метод открывает путь к более безопасному использованию больших языковых моделей на неродных для них языках без необходимости дообучать модель. Если вы работаете с низкоресурсными языками (не только африканскими), подобный подход может быть применён для повышения безопасности без затрат на обучение. На карточке модели в каталоге ai-sphere.ru появятся разделы о механизмах отказа и их восстановлении.
Источники: https://arxiv.org/abs/2608.18089v1