ScoreShield: как защитить similarity scores от утечки данных с помощью дифференциальной приватности
Что произошло
В arXiv опубликован препринт, представляющий метод ScoreShield. Он решает проблему утечки информации через API similarity scores — такие результаты могут использоваться для атак на членство (membership inference). Стандартное применение дифференциальной приватности (DP) — добавление независимого гауссова шума к векторным компонентам — приводит к чрезмерным искажениям, особенно при большом количестве выдаваемых scores. ScoreShield предлагает другой подход: сначала шум добавляется, исходя из глобальной чувствительности выбранного режима выдачи scores, а затем результат проецируется на допустимое множество (feasibility set of valid cosine objects).
Что изменилось по сравнению с предыдущей версией
Предыдущие DP-механизмы (например, добавление i.i.d. гауссова шума к векторным представлениям) показывали низкую полезность (utility) при заданных ограничениях приватности — масштаб искажений плохо масштабировался с числом выпускаемых scores. ScoreShield за счёт этапа проекции сохраняет геометрическую структуру косинусных объектов, снижая искажения.
Цены и доступность
ScoreShield — academic preprint, не является коммерческим продуктом. Исходный код, вероятно, будет опубликован авторами. Доступность для пользователей в России — как и любой arXiv-препринт, можно скачать свободно.
Почему это важно
Системы, возвращающие similarity scores, становятся всё более распространёнными: биометрическая аутентификация, поиск по векторным базам данных, retrieval-augmented generation (RAG). Утечка scores может раскрыть конфиденциальные данные пользователей. ScoreShield предлагает первый механизм, специально адаптированный для косинусного сходства, с формальными гарантиями DP и улучшенной полезностью.
Для пользователей AI-Sphere
Разработчикам RAG-пайплайнов и систем, работающих с векторными эмбеддингами, стоит обратить внимание на ScoreShield. Внедрение такого механизма позволит безопасно публиковать ранжированные результаты без риска атак на членство. Для AI-Sphere это означает, что карточки моделей, использующие similarity search, могут быть дополнены информацией о приватности — возможно, в будущем мы добавим в каталог сопоставление с подобными методами.
Объяснение технологии простыми словами
Косинусное сходство — это угол между двумя векторами, показывающий, насколько они похожи. Если сервис выдаёт пользователю similarity scores, злоумышленник может определить, есть ли конкретный вектор в обучающей выборке (атака членства). Дифференциальная приватность требует, чтобы результат не сильно зависел от одного элемента. Наивный способ — добавить шум ко всем векторам, но тогда scores становятся неточными. ScoreShield сначала добавляет шум к самим scores, а затем «выравнивает» их, чтобы они оставались возможными для косинусных объектов (например, значения от -1 до 1, углы согласованы). Это даёт лучшую точность при той же приватности.
Сравнение с аналогами
Существующие DP-механизмы для векторных баз (например, DPGaussian, DP-PCA) рассчитаны на выпуск целых векторов, а не отдельных scores. Они не используют специфику косинусного сходства и дают бо́льшие искажения. ScoreShield — первый целенаправленный метод для similarity scores, что делает его наиболее подходящим для RAG и биометрии.