Исследователи выявили наследуемость правдивости в модельных семействах LLM и MLLM
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Кратко: Ученые обнаружили, что способность больших языковых моделей (LLM) и мультимодальных LLM (MLLM) давать контекстно-правдивые ответы сохраняется внутри модельных семейств, даже после дообучения. На основе этого открытия разработан метод TruthProbe, который выборочно усиливает работу «правдивых» голов внимания.
Что произошло
В новой научной работе, опубликованной на arXiv, исследователи изучили, сохраняется ли фундаментальная поведенческая связь между базовой LLM и ее специализированными вариантами. Они ввели метрику «оценки правдивости» (Truth Scores) на уровне отдельных голов внимания. Анализ проводился на нескольких модельных семействах: Vicuna, Qwen2.5, LLaMA2 и Mistral. Было установлено, что оценки правдивости сильно сохраняются внутри модельных семей, даже после применения инструктивного дообучения или мультимодальной адаптации. Ученые показали, что это наследование согласуется с сохранением весов голов внимания, и что «контекстно-правдивые» головы обрабатывают информацию, релевантную запросу.
Что изменилось по сравнению с предыдущими подходами
Ранее считалось, что дообучение может существенно изменить поведение модели, в том числе ее склонность к галлюцинациям. Новое исследование демонстрирует, что базовая способность различать правдивую и ложную информацию в контексте является наследуемым свойством, которое устойчиво к различным видам адаптации. Это меняет понимание того, как формируется поведение специализированных моделей.
Цены и доступность
Исследование опубликовано в виде препринта на arXiv и не является коммерческим продуктом. Предложенный метод TruthProbe — это исследовательская разработка, доступная для ознакомления в рамках научной работы.
Почему это важно
Результаты работы имеют прямое значение для повышения надежности LLM и MLLM. Понимание того, что «правдивость» является наследуемой характеристикой, позволяет разработчикам целенаправленно выбирать базовые модели с высокими показателями контекстной правдивости. Метод TruthProbe, в свою очередь, предлагает практический способ улучшить качество ответов без полного переобучения модели, что экономит вычислительные ресурсы.
Для пользователей AI-Sphere
Для тех, кто работает с открытыми моделями семейств LLaMA, Qwen или Mistral, это исследование дает инструмент для оценки и потенциального улучшения их надежности. При выборе базовой модели для дообучения стоит обращать внимание на ее «правдивость», так как это свойство, скорее всего, сохранится. Следите за обновлениями в карточках моделей на ai-sphere.ru — мы будем добавлять информацию о новых методах повышения качества.
Источники