LLM систематически завышают исторические температуры: исследование arXiv
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Группа исследователей сравнила разные способы извлечения индекса температуры Пфистера (Pfister temperature index) из немецких текстов XVI–XX веков. Этот индекс — способ оцифровки субъективных описаний погоды (например, «очень холодная зима», «умеренное лето») в числовые шкалы, которые климатологи используют для реконструкции климата до появления инструментальных измерений.
Учёные проверили три группы методов:
- Лексические методы — подсчёт частоты слов, связанных с теплом или холодом, по заранее составленным словарям.
- Трансформеры, fine-tuned на исторических текстах, в том числе модель, обученная с нуля на историческом немецком языке.
- Шесть больших языковых моделей (LLM), которые получали на вход фрагменты текста и должны были выдать числовую оценку температуры.
Результаты показали, что лексические методы дали наилучшую корреляцию с эталонными значениями. Fine-tuned трансформеры показали крайне низкую точность (коэффициент корреляции r = –0.016 у модели, обученной на историческом немецком).
Все шесть LLM показали систематическое смещение в сторону более тёплых оценок по сравнению с реальными историческими данными. Наклон смещения варьировался от +0.13 до +0.34 градуса за столетие (статистически значимо, p < 0.01). Это означает, что при анализе текстов более поздних веков модели склонны завышать температуру сильнее, чем при анализе более ранних.
Почему это важно
На первый взгляд, LLM могут показывать хорошую корреляцию с реальными данными при оценке отдельных текстов. Однако, как подчёркивают авторы, высокая корреляция не исключает систематической ошибки, которая становится критической при сравнении разных эпох. Если климатолог использует LLM для построения длинного временного ряда, такая ошибка может создать впечатление постепенного потепления там, где его на самом деле не было.
Редакционный вывод: исследование ставит под сомнение надёжность LLM в задачах, где требуется высокая точность межвековых сравнений. Систематический «тёплый» сдвиг может быть связан с тем, что модели обучались на современных текстах, где обсуждение климата часто окрашено в тревожные тона, что косвенно влияет на выводы при работе с историческими описаниями.
Что это даёт пользователю
Для климатологов и историков науки работа — предостережение: прямое применение современных LLM для извлечения длинных временных рядов из архивов может вести к артефактам. Простые лексические методы в данном случае оказались и точнее, и более интерпретируемыми.
Для разработчиков AI-систем — сигнал к тому, что fine-tuning на исторических данных не гарантирует устранения временнóго смещения. Необходимо отдельно тестировать модели на отсутствие трендовой ошибки (trend bias) перед использованием в научных задачах.
Что пока неизвестно
Исследователи не объясняют в препринте причины возникшего bias. Остаётся неясным, связано ли завышение с особенностями обучений LLM (например, oversampling современных новостей о климате), с тем, как модели интерпретируют архаичные лексические конструкции, или с эффектами температурного контекста в самих текстах. Также не проверено, проявляется ли аналогичный bias на других языках и других климатических индексах.
Источники
- arXiv: 2609.37499