Новый бенчмарк оценил устойчивость LLM к шуму OCR при извлечении данных из документов
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
В препринте на arXiv опубликовано исследование «From Pixels to Pairs: A Comprehensive Benchmark of LLM-Based Key-Value Extraction in Noisy Document Settings». Авторы провели оценку нескольких репрезентативных декодерных LLM (Gemma, Mistral, Qwen2.5, LLaMA 3 и DeepSeek) на наборах данных FUNSD, CORD и SROIE. Для моделирования шума использовались как «золотые» текстовые аннотации (Gold-text), так и результаты работы трёх OCR-систем: PaddleOCR, EasyOCR и Tesseract.
Как проводилось исследование
Для обеспечения сопоставимости результатов применялся единый протокол оценки, изолирующий влияние качества входных данных, архитектуры модели и метода промптинга. Это позволило отделить эффект шума OCR от других факторов. Модели тестировались на задаче извлечения пар ключ-значение — то есть на поиске в документе конкретных полей (например, «дата», «сумма», «адрес») и соответствующих им значений.
Почему это важно
Редакционный анализ: полученные данные подтверждают, что современные LLM являются сильными семантическими экстракторами при наличии качественного текста — в некоторых случаях они приближаются к специализированным системам, учитывающим разметку страницы. Однако при появлении шума OCR производительность существенно падает, а разрывы в точности между моделями растут. Это означает, что для практического применения LLM в обработке реальных документов (например, сканов счетов, накладных, чеков) необходимо либо обеспечивать высокое качество OCR, либо разрабатывать методы повышения устойчивости моделей к искажениям.
Что это даёт пользователю
Для разработчиков систем автоматической обработки документов результаты бенчмарка служат ориентиром при выборе модели и оценке ожидаемого качества. Они показывают, что даже лучшие открытые LLM могут терять точность при работе с неидеальными сканами. Пользователям, внедряющим такие решения, стоит учитывать необходимость предварительной очистки OCR-вывода или использования моделей, специально обученных на зашумлённых данных.
Что пока неизвестно
В препринте не раскрываются точные числовые показатели качества (например, метрики F1 или точности) — они, вероятно, приведены в полном тексте статьи. Также не указаны авторы исследования. Поскольку работа опубликована на arXiv и не прошла рецензирование, выводы следует рассматривать как предварительные.