Исследования

Ученые систематически измерили влияние гиперпараметров на дообучение LLM

Автор: AI-Sphere· обновлено 2 сентября 2026 г. в 11:02· 5 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

Группа исследователей (авторы не указаны) представила препринт под названием «Post-Training Science for Supervised Fine-Tuning». В работе они провели масштабный sweep (перебор) гиперпараметров, меняя по одному параметру за раз. Эксперименты охватили две семейства моделей — Qwen3 и Llama, как плотные (dense), так и смеси экспертов (mixture-of-experts). Для тестов использовались четыре реальных датасета от клиентов для supervised fine-tuning (SFT). Каждый датасет сопровождался собственной метрикой оценки, разработанной совместно с заказчиком. Обучающие данные для этих задач были получены итеративным SFT: модель генерировала ответы, которые затем уточнялись до тех пор, пока не проходили заданный критерий. Таким образом, целевые метки внутри датасета согласованы, а оценка, по которой отчитываются авторы, совпадает с тем критерием, под который собирались данные.

Исследователи задались вопросом, как меняются оптимальные learning rate и batch size при переходе от одной модели к другой, при использовании LoRA или полного дообучения, на разных датасетах.

Что удалось выяснить

Хотя полные результаты ещё предстоит изучить, сам подход уже представляет интерес. Вместо разрозненных экспериментов авторы предлагают единую методологию: фиксировать все параметры, кроме одного, и измерять влияние на итоговое качество. Это позволяет отделить эффект каждого гиперпараметра от случайных взаимодействий. Использование нескольких семейств моделей и реальных бизнес-задач повышает практическую значимость выводов.

Почему это важно

На практике большинство команд, дообучающих LLM, полагаются на эвристики или прошлый опыт. Новое исследование (редакционный анализ) может дать более надёжные ориентиры: например, показать, что оптимальный learning rate для LoRA систематически отличается от full fine-tuning, или что batch size влияет на сходимость сильнее, чем принято считать. Если такие закономерности подтвердятся, инженеры смогут быстрее настраивать модели под конкретные задачи, экономя вычислительные ресурсы и время.

Что это даёт пользователю

Для тех, кто занимается дообучением моделей, результаты означают появление более осознанного подхода к выбору гиперпараметров. Вместо слепого копирования чужих конфигураций можно будет опираться на данные, полученные в контролируемых условиях на схожих задачах. Это особенно ценно для небольших компаний и исследователей, у которых нет ресурсов на собственные масштабные sweep-эксперименты.

Что пока неизвестно

Препринт ещё не прошёл рецензирование, поэтому к выводам стоит относиться с осторожностью. Конкретные численные результаты (например, оптимальные значения learning rate для каждой модели) пока не опубликованы в открытом доступе — в аннотации приведены лишь общие вопросы исследования. Кроме того, эксперименты проводились на четырёх датасетах, и неизвестно, насколько результаты обобщаются на другие типы задач и модели.

Источники

#post-training#supervised-fine-tuning#Qwen3#Llama

Читайте также

Qwen3Цены на AI-моделиLlamaЦены на AI-моделиAlibabaНовости AlibabaMetaНовости Meta

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат