Исследования

Новый бенчмарк оценил устойчивость LLM к шуму OCR при извлечении данных из документов

Автор: AI-Sphere· обновлено 17 сентября 2026 г. в 02:37· 4 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В препринте на arXiv опубликовано исследование «From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings». Авторы провели оценку нескольких репрезентативных декодерных LLM (Gemma, Mistral, Qwen2.5, LLaMA 3 и DeepSeek) на наборах данных FUNSD, CORD и SROIE. Для моделирования шума использовались как «золотые» текстовые аннотации (Gold-text), так и результаты работы трёх OCR-систем: PaddleOCR, EasyOCR и Tesseract.

Как проводилось исследование

Для обеспечения сопоставимости результатов применялся единый протокол оценки, изолирующий влияние качества входных данных, архитектуры модели и метода промптинга. Это позволило отделить эффект шума OCR от других факторов. Модели тестировались на задаче извлечения пар ключ-значение — то есть на поиске в документе конкретных полей (например, «дата», «сумма», «адрес») и соответствующих им значений.

Почему это важно

Редакционный анализ: полученные данные подтверждают, что современные LLM являются сильными семантическими экстракторами при наличии качественного текста — в некоторых случаях они приближаются к специализированным системам, учитывающим разметку страницы. Однако при появлении шума OCR производительность существенно падает, а разрывы в точности между моделями растут. Это означает, что для практического применения LLM в обработке реальных документов (например, сканов счетов, накладных, чеков) необходимо либо обеспечивать высокое качество OCR, либо разрабатывать методы повышения устойчивости моделей к искажениям.

Что это даёт пользователю

Для разработчиков систем автоматической обработки документов результаты бенчмарка служат ориентиром при выборе модели и оценке ожидаемого качества. Они показывают, что даже лучшие открытые LLM могут терять точность при работе с неидеальными сканами. Пользователям, внедряющим такие решения, стоит учитывать необходимость предварительной очистки OCR-вывода или использования моделей, специально обученных на зашумлённых данных.

Что пока неизвестно

В препринте не раскрываются точные числовые показатели качества (например, метрики F1 или точности) — они, вероятно, приведены в полном тексте статьи. Также не указаны авторы исследования. Поскольку работа опубликована на arXiv и не прошла рецензирование, выводы следует рассматривать как предварительные.

Источники

#LLM#OCR#бенчмарк#извлечение данных

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат