MoARa: новый метод ускоряет обучение больших языковых моделей на 37%
**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.
Что произошло
В препринте на arXiv представлен метод MoARa, направленный на улучшение существующих техник низкоранговой проекции градиента (таких как GaLore). Эти техники снижают потребление памяти при обучении за счёт хранения не полных градиентов, а их проекций в пространство меньшей размерности. Однако авторы выявили два недостатка стандартного подхода:
- Ранговый бюджет (количество компонент проекции) распределяется равномерно по всем модулям Transformer, хотя чувствительность модулей к проекции различна.
- Проецирование сырого градиента одновременно ослабляет и его величину, и направление, что замедляет сходимость.
MoARa предлагает два ключевых улучшения:
- Распределение рангов по модулям (module-aware allocation) — с помощью статического профилирования определяется, каким модулям требуется больше рангов, а каким меньше, что повышает эффективность использования бюджета.
- Разделение величины и направления (magnitude-direction decomposition) — градиент разбивается на блоки (размер блока выбран близким к размерности головы внимания) и проекция применяется отдельно к направлению, а magnitude сохраняется без изменений. Это предотвращает затухание сигнала.
Метод протестирован на пяти архитектурах Transformer: Llama, Qwen и DeepSeek масштабом от 300 миллионов до 7 миллиардов параметров. В сравнении со стандартным GaLore на Llama 2 7B MoARa достиг финальной perplexity на 37% меньшем числе шагов и с 34% меньшим стенным временем при loss всего 0,2%.
Как это работает на практике
При обучении современной LLM основной объём памяти занимают состояния оптимизатора (например, Adam). Низкоранговое проецирование позволяет сократить этот объём в разы. MoARa делает это проецирование «умнее»: вместо того чтобы сжимать весь градиент одинаково, он адаптирует степень сжатия под конкретный модуль нейросети. Например, для слоёв self-attention может потребоваться больше рангов, чем для feed-forward, — и MoARa автоматически это учитывает.
Дополнительно, разделение градиента на direction и magnitude предотвращает ситуацию, когда проекция «съедает» часть амплитуды градиента, необходимую для быстрого обучения. Вместе эти две идеи дают выигрыш в скорости без значимого ущерба для точности.
Почему это важно
Редакционный анализ: снижение времени и затрат на предварительное обучение — одна из ключевых задач в области LLM. Если MoARa подтвердит свою эффективность на более широком наборе моделей и задач, он может стать стандартным приёмом для стартапов и исследовательских групп, не располагающих сотнями GPU. Экономия в 34% времени эквивалентна сокращению счёта за облачные вычисления почти на треть. Кроме того, метод не требует модификации архитектуры модели — он добавляется как прослойка в оптимизатор, что упрощает внедрение.
Что это даёт пользователю
Хотя MoARa направлен на разработчиков и исследователей, его косвенная польза для конечных пользователей велика:
- Ускорение выхода новых моделей — обучение может завершаться быстрее при тех же вычислительных ресурсах.
- Возможность обучать модели большего размера на доступном оборудовании — снижение требований к памяти позволяет расширить эксперименты.
- Потенциальное снижение стоимости API-доступа к LLM, если провайдеры внедрят подобные оптимизации.
Что пока неизвестно
- Насколько хорошо MoARa работает для моделей с архитектурой, отличной от исследованных (например, Mixture-of-Experts).
- Каково влияние метода на качество при обучении с нуля на очень больших датасетах (более триллиона токенов).
- Планируется ли выпуск открытой реализации или интеграция в популярные фреймворки (Hugging Face, PyTorch).