昇腾集群训出DeepSeek-V4全参数后训练
推荐指数 78.0 NO. 022 · 2026.07.24
upvotes43comments1
为什么值得看
华为昇腾NPU超算集群上完成了DeepSeek-V4系列MoE模型的全参数后训练,MFU达到34.22%。这是国产AI芯片首次在万亿参数MoE模型训练效率上给出可量化的工程实践,对考虑国产算力替代的团队有直接参考价值。
媒体预览
编辑判断
GPU集群训练MoE的通信瓶颈已有Megatron-LM、DeepSpeed等成熟方案,但昇腾NPU的通信拓扑和内存架构与GPU差异很大,直接迁移效率极低。这篇报告的关键价值在于给出了分层优化的具体路径:模型并行策略怎么切、通信计算怎么重叠、底层算子怎么调。
34%的MFU在GPU集群里不算顶尖(H100集群训GPT-4级别模型可达40-50%),但考虑到这是NPU首发的万亿参数MoE全参数训练结果,已经跨过了"能用"的门槛。如果后续代码或配置开源,做国产算力适配的团队可以直接省掉数月的调优周期。
一个值得跟踪的信号:DeepSeek-V4本身尚未正式发布,这篇论文提前泄露了模型存在且已在昇腾上跑通,可能暗示DeepSeek与华为在算力层面的合作深度超出公开信息。