Исследования

DeepSeek-V4: Полный посттренинг на Ascend NPU SuperPOD с MFU 34,22%

Автор: AI-Sphere· обновлено 31 июля 2026 г. в 04:13· 4 мин чтения
Источники: arxiv.org
<!-- NewsArticle JSON-LD { "@context": "https://schema.org", "@type": "ScholarlyArticle",\n "headline": "ScholarlyArticle", "description": "DeepSeek-V4: Полный посттренинг на Ascend NPU SuperPOD с MFU 34,22%", "datePublished": "Оптимизация полного посттренинга MoE-моделей на Ascend NPU SuperPOD: MFU 34,22% (улучшение в 2,93x) для DeepSeek-V4. Результаты на arXiv.", "dateModified": "2026-07-31T07:13:15+03:00", "author": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru/about" }, "publisher": { "@type": "Organization", "name": "AI-Sphere", "url": "https://ai-sphere.ru" }, "mainEntityOfPage": { "@type": "2026-07-31T07:13:15+03:00",\n "@id": "https://ai-sphere.ru/news/research/deepseek-v4-post-training-ascend-npu" } } -->

Что произошло

В arXiv-препринте (2607.20145, версия 2) описана система для полного посттренинга (full-parameter post-training) моделей семейства DeepSeek-V4 на Ascend NPU SuperPOD. Основные вызовы — давление на память, неперекрываемые накладные расходы на коммуникацию и неэффективное выполнение ядер. Предложен иерархический фреймворк оптимизации, охватывающий:

  • параллелизм на уровне модели;
  • оркестровку вычислений и коммуникаций;
  • низкоуровневое выполнение ядер.

В результате MFU составил 34,22% — это в 2,93 раза выше, чем в открытой базовой конфигурации (baseline recipe). На базе этой инфраструктуры построен workflow для CPT и SFT сложных задач Operations Research (OR).

Что изменилось по сравнению с предыдущей версией

Работа является эволюционным улучшением открытой базовой конфигурации (baseline recipe). Улучшение MFU в 2,93 раза — ключевой показатель эффективности.

Цены и доступность

Информация о цене, дате выхода и регионах использования не предоставлена. Препринт опубликован на arXiv и не прошёл рецензирование.

Почему это важно

Это одна из первых публичных демонстраций масштабного посттренинга MoE-моделей на NPU (Ascend), а не на GPU. Достигнутые показатели MFU (34,22%) сопоставимы с лучшими практиками на GPU-кластерах, что может расширить выбор аппаратных платформ для крупных AI-моделей.

Для пользователей AI-Sphere

Если вы работаете с крупными языковыми моделями и ищете альтернативы GPU-инфраструктуре, результаты на Ascend NPU SuperPOD показывают, что NPU-кластеры способны эффективно выполнять полный посттренинг. При этом необходимо учитывать, что работа ещё не рецензирована, а доступность конкретных NPU-кластеров может быть ограничена.

Источники

#DeepSeek-V4#Ascend NPU#пост-тренинг#MoE

Читайте также

DeepSeek-V4Цены на AI-моделиDeepSeekНовости DeepSeekHuaweiНовости Huawei

Попробуйте сами

Задайте вопрос любой нейросети прямо сейчас — без VPN и иностранной карты

Начать чат