Смысловая идентичность предложений не заложена в векторных представлениях, а вычисляется при совместной обработке
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Группа авторов опубликовала на arXiv препринт «Computation Over Geometry: Meaning Identity Is Computed, Not Shipped in the Embeddings». В нём они провели эксперименты с замороженными (frozen) энкодерами — то есть заранее обученными и не меняющимися во время тестирования. Оказалось, что независимо закодированные представления предложений (например, BGE, E5, GTE, MiniLM, E5-Mistral-7B) на задаче PAWS-X (определение перефразирования) демонстрируют AUC всего 0,55–0,65, а при плотном поиске — до 0,70. Это лишь немногим лучше случайного угадывания.
Авторы также протестировали большие языковые модели (Llama 3, Mistral, Qwen) — их отдельно закодированные состояния последних токенов показали аналогично низкую точность. Даже поздняя конкатенация двух векторов не улучшила результат — AUC оставалась на уровне случайного.
Как проверяли гипотезу
Исследователи использовали простой линейный зонд (probe) — классификатор поверх скрытых состояний модели. Когда зонд применялся к совместному прямому проходу, в котором оба предложения подавались в одном контексте, AUC достигала 0,90–0,96 для моделей от 1,5 до 32 миллиардов параметров. Зонд работал на средних слоях, насыщался уже при размере модели 3B и рушился, если случайным образом перемешивались пары предложений. Интересно, что для GPT-2 XL результат был ниже (0,76), что указывает на неодинаковую способность к вычислению идентичности.
Почему это важно
Редакционный вывод: полученные данные означают, что в системах RAG и семантического поиска, которые сравнивают два по отдельности закодированных предложения, может теряться значительная часть информации о смысловом тождестве. Модели «знают», одинаковы ли фразы, только если видят их вместе. Это делает непрактичным использование простых косинусных мер или скалярных произведений между независимыми эмбеддингами для задач точного перефразирования. Возможно, разработчикам придётся пересмотреть архитектуру поисковых модулей в пользу встраивания совместного анализа.
Что это даёт пользователю
На практике результат подсказывает: если вы строите поиск по смыслу или чат-бота, который должен узнавать перефразированные вопросы, не стоит полагаться исключительно на предварительно закодированные векторные базы данных. Вероятно, потребуется двухэтапный процесс — сначала быстрое отсечение кандидатов по эмбеддингам, а затем уточнение через совместный проход с использованием небольшой языковой модели. Это может повысить точность, но потребует дополнительных вычислительных ресурсов на этапе второго прохода.
Что пока неизвестно
Препринт не даёт ответа, можно ли дообучить энкодеры так, чтобы смысловая идентичность стала свойством их эмбеддингов. Также остаётся открытым вопрос, насколько полученный вывод распространяется на другие типы семантических отношений (например, следствие, противоречие) и на языки, отличные от английского. Авторы не тестировали современные мультимодальные модели.