Исследование: LLM и правила по-разному аннотируют нарративные признаки в турецком корпусе
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Исследователи взяли турецкий нарративный корпус, в котором каждая сцена содержит автоматически сгенерированные метки, полученные детектором на основе правил. Детектор анализирует шесть признаков: два запрета (эмоциональная маркировка и сравнение) и четыре положительные техники (материализованная метафора, микро-фокус, временной якорь и противоречие атмосферы).
Для проверки надёжности такой разметки проведено три эксперимента. Первый (Study 1, 120 сцен) сравнивал результат работы детектора с метками, которые вручную проставил автор схемы. Второй (Study 2, 100 сцен из другого набора) оценивал детектор, Gemini 2.5 Flash и Grok — их разметку сравнивали с метками независимого неэкспертного оценщика, которые были зафиксированы до запуска машин. Третий (Study 2b) повторил протокол с участием Claude Fable 5 (High) и ChatGPT 5.5.
Центральный результат, по словам авторов, касается одного из правил — материализованной метафоры. Каким именно оказалось расхождение или совпадение, в обнародованной части аннотации не раскрывается.
Почему это важно
Автоматическая разметка нарративных признаков — востребованная задача в анализе текстов, но её использование на практике требует уверенности в том, что метки отражают то, что увидел бы человек. Исследование напрямую проверяет эту уверенность для конкретного корпуса и набора моделей. Редакционный вывод: если согласованность оценщиков (inter-rater reliability) окажется низкой, это поставит под сомнение применимость таких автоматических аннотаций в научных и прикладных задачах без дополнительной калибровки.
Что это даёт пользователю
Разработчикам систем обработки естественного языка и исследователям турецкого языка исследование даёт первые бенчмарки того, как различные подходы (чисто правиловый против LLM разных поколений) соотносятся с человеческой оценкой. На практике это может помочь выбрать более надёжный метод для построения или валидации датасетов с тонкими нарративными признаками.
Что пока неизвестно
Полные численные значения согласованности (например, каппа Коэна или точность) для каждого эксперимента — в том числе конкретный результат по материализованной метафоре. Также нет данных о том, какая из моделей (Gemini, Grok, Claude, ChatGPT) показала наилучшее совпадение с человеком. Исследование находится в статусе препринта и прошло лишь частичную публичную проверку.