Исследования

DeepSeek-V4: Полный посттренинг на Ascend NPU SuperPOD с MFU 34,22%

Автор: AI-Sphere· обновлено 31 июля 2026 г. в 04:13· 3 мин чтения
Источники: arxiv.org
> **⚠️ Status: preprint > This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

**⚠️ Status: preprint This article is based on a preprint published on arXiv. The work may not have undergone independent peer review. Conclusions reflect the authors' position.

Что произошло

В arXiv-препринте (2607.20145, версия 2) описана система для полного посттренинга (full-parameter post-training) моделей семейства DeepSeek-V4 на Ascend NPU SuperPOD. Основные вызовы — давление на память, неперекрываемые накладные расходы на коммуникацию и неэффективное выполнение ядер. Предложен иерархический фреймворк оптимизации, охватывающий:

  • параллелизм на уровне модели;
  • оркестровку вычислений и коммуникаций;
  • низкоуровневое выполнение ядер.

В результате MFU составил 34,22% — это в 2,93 раза выше, чем в открытой базовой конфигурации (baseline recipe). На базе этой инфраструктуры построен workflow для CPT и SFT сложных задач Operations Research (OR).

Что изменилось по сравнению с предыдущей версией

Работа является эволюционным улучшением открытой базовой конфигурации (baseline recipe). Улучшение MFU в 2,93 раза — ключевой показатель эффективности.

Цены и доступность

Информация о цене, дате выхода и регионах использования не предоставлена. Препринт опубликован на arXiv и не прошёл рецензирование.

Почему это важно

Это одна из первых публичных демонстраций масштабного посттренинга MoE-моделей на NPU (Ascend), а не на GPU. Достигнутые показатели MFU (34,22%) сопоставимы с лучшими практиками на GPU-кластерах, что может расширить выбор аппаратных платформ для крупных AI-моделей.

Для пользователей AI-Sphere

Если вы работаете с крупными языковыми моделями и ищете альтернативы GPU-инфраструктуре, результаты на Ascend NPU SuperPOD показывают, что NPU-кластеры способны эффективно выполнять полный посттренинг. При этом необходимо учитывать, что работа ещё не рецензирована, а доступность конкретных NPU-кластеров может быть ограничена.

Источники

#DeepSeek-V4#Ascend NPU#пост-тренинг#MoE

Читайте также

DeepSeek-V4Цены на AI-моделиDeepSeekDeepSeek — модели, возможности и новостиHuaweiНовости Huawei

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат