Исследования

ScoreShield: как защитить similarity scores от утечки данных с помощью дифференциальной приватности

Автор: AI-Sphere· обновлено 29 июля 2026 г. в 11:56· 7 мин чтения
Источники: arxiv.org
<!-- NewsArticle JSON-LD { "@context": "https://schema.org", "@type": "ScholarlyArticle",\n "headline": "ScholarlyArticle", "description": "ScoreShield: как защитить similarity scores от утечки данных с помощью дифференциальной приватности", "datePublished": "Новый метод ScoreShield безопасно публикует косинусные similarity scores, применяя perturb-then-project с дифференциальной приватностью. Снижает искажения и защищает от атак членства.", "dateModified": "2026-07-29T14:56:53+03:00", "author": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru/about" }, "publisher": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru" }, "mainEntityOfPage": { "@type": "2026-07-29T14:56:53+03:00",\n "@id": "https://ai-sphere.ru/news/research/scoreshield-differential-privacy-similarity-scores" } } -->

Что произошло

В arXiv опубликован препринт, представляющий метод ScoreShield. Он решает проблему утечки информации через API similarity scores — такие результаты могут использоваться для атак на членство (membership inference). Стандартное применение дифференциальной приватности (DP) — добавление независимого гауссова шума к векторным компонентам — приводит к чрезмерным искажениям, особенно при большом количестве выдаваемых scores. ScoreShield предлагает другой подход: сначала шум добавляется, исходя из глобальной чувствительности выбранного режима выдачи scores, а затем результат проецируется на допустимое множество (feasibility set of valid cosine objects).

Что изменилось по сравнению с предыдущей версией

Предыдущие DP-механизмы (например, добавление i.i.d. гауссова шума к векторным представлениям) показывали низкую полезность (utility) при заданных ограничениях приватности — масштаб искажений плохо масштабировался с числом выпускаемых scores. ScoreShield за счёт этапа проекции сохраняет геометрическую структуру косинусных объектов, снижая искажения.

Цены и доступность

ScoreShield — academic preprint, не является коммерческим продуктом. Исходный код, вероятно, будет опубликован авторами. Доступность для пользователей в России — как и любой arXiv-препринт, можно скачать свободно.

Почему это важно

Системы, возвращающие similarity scores, становятся всё более распространёнными: биометрическая аутентификация, поиск по векторным базам данных, retrieval-augmented generation (RAG). Утечка scores может раскрыть конфиденциальные данные пользователей. ScoreShield предлагает первый механизм, специально адаптированный для косинусного сходства, с формальными гарантиями DP и улучшенной полезностью.

Для пользователей AI-Sphere

Разработчикам RAG-пайплайнов и систем, работающих с векторными эмбеддингами, стоит обратить внимание на ScoreShield. Внедрение такого механизма позволит безопасно публиковать ранжированные результаты без риска атак на членство. Для AI-Sphere это означает, что карточки моделей, использующие similarity search, могут быть дополнены информацией о приватности — возможно, в будущем мы добавим в каталог сопоставление с подобными методами.

Объяснение технологии простыми словами

Косинусное сходство — это угол между двумя векторами, показывающий, насколько они похожи. Если сервис выдаёт пользователю similarity scores, злоумышленник может определить, есть ли конкретный вектор в обучающей выборке (атака членства). Дифференциальная приватность требует, чтобы результат не сильно зависел от одного элемента. Наивный способ — добавить шум ко всем векторам, но тогда scores становятся неточными. ScoreShield сначала добавляет шум к самим scores, а затем «выравнивает» их, чтобы они оставались возможными для косинусных объектов (например, значения от -1 до 1, углы согласованы). Это даёт лучшую точность при той же приватности.

Сравнение с аналогами

Существующие DP-механизмы для векторных баз (например, DPGaussian, DP-PCA) рассчитаны на выпуск целых векторов, а не отдельных scores. Они не используют специфику косинусного сходства и дают бо́льшие искажения. ScoreShield — первый целенаправленный метод для similarity scores, что делает его наиболее подходящим для RAG и биометрии.

Источники

https://arxiv.org/abs/2607.25041

#ScoreShield#дифференциальная приватность#косинусное сходство#arXiv

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат