DeepSeek-V4: Полный посттренинг на Ascend NPU SuperPOD с MFU 34,22%
Что произошло
В arXiv-препринте (2607.20145, версия 2) описана система для полного посттренинга (full-parameter post-training) моделей семейства DeepSeek-V4 на Ascend NPU SuperPOD. Основные вызовы — давление на память, неперекрываемые накладные расходы на коммуникацию и неэффективное выполнение ядер. Предложен иерархический фреймворк оптимизации, охватывающий:
- параллелизм на уровне модели;
- оркестровку вычислений и коммуникаций;
- низкоуровневое выполнение ядер.
В результате MFU составил 34,22% — это в 2,93 раза выше, чем в открытой базовой конфигурации (baseline recipe). На базе этой инфраструктуры построен workflow для CPT и SFT сложных задач Operations Research (OR).
Что изменилось по сравнению с предыдущей версией
Работа является эволюционным улучшением открытой базовой конфигурации (baseline recipe). Улучшение MFU в 2,93 раза — ключевой показатель эффективности.
Цены и доступность
Информация о цене, дате выхода и регионах использования не предоставлена. Препринт опубликован на arXiv и не прошёл рецензирование.
Почему это важно
Это одна из первых публичных демонстраций масштабного посттренинга MoE-моделей на NPU (Ascend), а не на GPU. Достигнутые показатели MFU (34,22%) сопоставимы с лучшими практиками на GPU-кластерах, что может расширить выбор аппаратных платформ для крупных AI-моделей.
Для пользователей AI-Sphere
Если вы работаете с крупными языковыми моделями и ищете альтернативы GPU-инфраструктуре, результаты на Ascend NPU SuperPOD показывают, что NPU-кластеры способны эффективно выполнять полный посттренинг. При этом необходимо учитывать, что работа ещё не рецензирована, а доступность конкретных NPU-кластеров может быть ограничена.