Исследования

EAR: новый подход к разбиению данных для RAG-систем

Автор: AI-Sphere· обновлено 14 сентября 2026 г. в 09:38· 6 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

На arXiv опубликован препринт, в котором представлен метод EAR для задач множественного выбора ответов (MCQA). Суть подхода заключается в трёх шагах:

  1. Из вопроса, вариантов ответа и корпуса текстов извлекаются нормализованные поверхностные якоря — ключевые слова и сущности.
  2. Вокруг совпадающих якорей в корпусе выделяются локальные окна текста.
  3. При необходимости к окну присоединяется более крупный родительский отрывок через извлекательное резюме.

Такой подход отличается от классической схемы, где текст режут на равные по длине куски. Авторы утверждают, что фиксированные фрагменты часто возвращают длинные пассажи, связь которых с вопросом лишь подразумевается.

Для оценки EAR использовался очищенный набор из 153 вопросов в стиле MMLS (Massive Multitask Language Understanding), отобранных по автоматическому критерию поддержки корпуса. Тестирование проводилось на дезактивированных текстах из публичных учебников с моделями Mistral, Gemma и DeepSeek при разных протоколах поиска (top-k = 3 и top-k = 8).

Как работает сущностная нарезка

Традиционный RAG (Retrieval-Augmented Generation) разбивает документы на чанки фиксированной длины. Это просто, но приводит к проблемам: нужная информация может оказаться разрезанной пополам, а фрагмент — содержать много постороннего текста.

EAR решает эту задачу иначе. Система сначала определяет, какие сущности важны для текущего вопроса и вариантов ответа. Затем в корпусе находятся места, где эти сущности встречаются, и вокруг них формируются окна. Такой подход позволяет извлекать компактные и релевантные фрагменты, а не произвольные куски текста.

Дополнительный механизм с родительским отрывком помогает сохранить широкий контекст: если локального окна недостаточно, система подключает более крупный фрагмент через краткое изложение.

Почему это важно

Проблема разбиения корпуса часто недооценивается при построении RAG-систем. Многие разработчики сосредотачиваются на выборе модели или векторного хранилища, забывая, что качество извлечения напрямую зависит от того, как организованы единицы поиска.

Редакционный вывод: если подход EAR подтвердит свою эффективность на более широких наборах данных, он может стать основой для нового класса инструментов предобработки знаний. На практике это означает, что RAG-системы смогут работать с меньшими по объёму, но более точными фрагментами, что потенциально снижает затраты на токены и улучшает качество ответов.

Важно отметить, что работа пока представлена как препринт и не прошла полноценное рецензирование. Однако сама постановка задачи — отказ от фиксированных чанков в пользу сущностно-ориентированной нарезки — выглядит перспективной.

Что это даёт пользователю

Для разработчиков RAG-систем практическая ценность EAR заключается в возможности сократить объём извлекаемых данных. Вместо того чтобы передавать модели длинные куски текста, можно отправлять компактные окна вокруг релевантных сущностей. Это особенно полезно в сценариях, где важна скорость ответа и экономия ресурсов.

Потенциальные сценарии применения:

  • Корпоративные базы знаний, где документы содержат много повторяющейся информации.
  • Образовательные платформы с учебными материалами, где требуется точный ответ на вопрос по конкретной теме.
  • Медицинские или юридические справочники, где точность извлечения критична.

Что пока неизвестно

В препринте не раскрыты точные численные результаты сравнения EAR с базовыми методами — указано лишь, что подход сокращает количество извлечённых слов. Также неясно, как метод поведёт себя на открытых вопросах без вариантов ответа и на корпусах с неструктурированными данными. Авторы не указаны в доступных метаданных.

Источники

#RAG#Entity-Aware Partitioning#MCQA#arXiv

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат