Ученые систематически измерили влияние гиперпараметров на дообучение LLM
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
Группа исследователей (авторы не указаны) представила препринт под названием «Post-Training Science for Supervised Fine-Tuning». В работе они провели масштабный sweep (перебор) гиперпараметров, меняя по одному параметру за раз. Эксперименты охватили две семейства моделей — Qwen3 и Llama, как плотные (dense), так и смеси экспертов (mixture-of-experts). Для тестов использовались четыре реальных датасета от клиентов для supervised fine-tuning (SFT). Каждый датасет сопровождался собственной метрикой оценки, разработанной совместно с заказчиком. Обучающие данные для этих задач были получены итеративным SFT: модель генерировала ответы, которые затем уточнялись до тех пор, пока не проходили заданный критерий. Таким образом, целевые метки внутри датасета согласованы, а оценка, по которой отчитываются авторы, совпадает с тем критерием, под который собирались данные.
Исследователи задались вопросом, как меняются оптимальные learning rate и batch size при переходе от одной модели к другой, при использовании LoRA или полного дообучения, на разных датасетах.
Что удалось выяснить
Хотя полные результаты ещё предстоит изучить, сам подход уже представляет интерес. Вместо разрозненных экспериментов авторы предлагают единую методологию: фиксировать все параметры, кроме одного, и измерять влияние на итоговое качество. Это позволяет отделить эффект каждого гиперпараметра от случайных взаимодействий. Использование нескольких семейств моделей и реальных бизнес-задач повышает практическую значимость выводов.
Почему это важно
На практике большинство команд, дообучающих LLM, полагаются на эвристики или прошлый опыт. Новое исследование (редакционный анализ) может дать более надёжные ориентиры: например, показать, что оптимальный learning rate для LoRA систематически отличается от full fine-tuning, или что batch size влияет на сходимость сильнее, чем принято считать. Если такие закономерности подтвердятся, инженеры смогут быстрее настраивать модели под конкретные задачи, экономя вычислительные ресурсы и время.
Что это даёт пользователю
Для тех, кто занимается дообучением моделей, результаты означают появление более осознанного подхода к выбору гиперпараметров. Вместо слепого копирования чужих конфигураций можно будет опираться на данные, полученные в контролируемых условиях на схожих задачах. Это особенно ценно для небольших компаний и исследователей, у которых нет ресурсов на собственные масштабные sweep-эксперименты.
Что пока неизвестно
Препринт ещё не прошёл рецензирование, поэтому к выводам стоит относиться с осторожностью. Конкретные численные результаты (например, оптимальные значения learning rate для каждой модели) пока не опубликованы в открытом доступе — в аннотации приведены лишь общие вопросы исследования. Кроме того, эксперименты проводились на четырёх датасетах, и неизвестно, насколько результаты обобщаются на другие типы задач и модели.