Исследования

MoARa: новый метод ускоряет обучение больших языковых моделей на 37%

Автор: AI-Sphere· обновлено 15 сентября 2026 г. в 04:27· 7 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В препринте на arXiv представлен метод MoARa, направленный на улучшение существующих техник низкоранговой проекции градиента (таких как GaLore). Эти техники снижают потребление памяти при обучении за счёт хранения не полных градиентов, а их проекций в пространство меньшей размерности. Однако авторы выявили два недостатка стандартного подхода:

  • Ранговый бюджет (количество компонент проекции) распределяется равномерно по всем модулям Transformer, хотя чувствительность модулей к проекции различна.
  • Проецирование сырого градиента одновременно ослабляет и его величину, и направление, что замедляет сходимость.

MoARa предлагает два ключевых улучшения:

  • Распределение рангов по модулям (module-aware allocation) — с помощью статического профилирования определяется, каким модулям требуется больше рангов, а каким меньше, что повышает эффективность использования бюджета.
  • Разделение величины и направления (magnitude-direction decomposition) — градиент разбивается на блоки (размер блока выбран близким к размерности головы внимания) и проекция применяется отдельно к направлению, а magnitude сохраняется без изменений. Это предотвращает затухание сигнала.

Метод протестирован на пяти архитектурах Transformer: Llama, Qwen и DeepSeek масштабом от 300 миллионов до 7 миллиардов параметров. В сравнении со стандартным GaLore на Llama 2 7B MoARa достиг финальной perplexity на 37% меньшем числе шагов и с 34% меньшим стенным временем при loss всего 0,2%.

Как это работает на практике

При обучении современной LLM основной объём памяти занимают состояния оптимизатора (например, Adam). Низкоранговое проецирование позволяет сократить этот объём в разы. MoARa делает это проецирование «умнее»: вместо того чтобы сжимать весь градиент одинаково, он адаптирует степень сжатия под конкретный модуль нейросети. Например, для слоёв self-attention может потребоваться больше рангов, чем для feed-forward, — и MoARa автоматически это учитывает.

Дополнительно, разделение градиента на direction и magnitude предотвращает ситуацию, когда проекция «съедает» часть амплитуды градиента, необходимую для быстрого обучения. Вместе эти две идеи дают выигрыш в скорости без значимого ущерба для точности.

Почему это важно

Редакционный анализ: снижение времени и затрат на предварительное обучение — одна из ключевых задач в области LLM. Если MoARa подтвердит свою эффективность на более широком наборе моделей и задач, он может стать стандартным приёмом для стартапов и исследовательских групп, не располагающих сотнями GPU. Экономия в 34% времени эквивалентна сокращению счёта за облачные вычисления почти на треть. Кроме того, метод не требует модификации архитектуры модели — он добавляется как прослойка в оптимизатор, что упрощает внедрение.

Что это даёт пользователю

Хотя MoARa направлен на разработчиков и исследователей, его косвенная польза для конечных пользователей велика:

  • Ускорение выхода новых моделей — обучение может завершаться быстрее при тех же вычислительных ресурсах.
  • Возможность обучать модели большего размера на доступном оборудовании — снижение требований к памяти позволяет расширить эксперименты.
  • Потенциальное снижение стоимости API-доступа к LLM, если провайдеры внедрят подобные оптимизации.

Что пока неизвестно

  • Насколько хорошо MoARa работает для моделей с архитектурой, отличной от исследованных (например, Mixture-of-Experts).
  • Каково влияние метода на качество при обучении с нуля на очень больших датасетах (более триллиона токенов).
  • Планируется ли выпуск открытой реализации или интеграция в популярные фреймворки (Hugging Face, PyTorch).

Источники

#MoARa#low-rank pretraining#LLM#memory optimization

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат