AMAZINGINDEX.COM 日报快照
56.6
VOL. 2026.07
2026.07.24
← 返回 2026.07.24 日报
日报快照 · Daily Snapshot
NO. 022

昇腾集群训出DeepSeek-V4全参数后训练

#HF_PAPERS HuggingFace Papers 2026.07.24
推荐指数 78.0 NO. 022 · 2026.07.24
upvotes43comments1

华为昇腾NPU超算集群上完成了DeepSeek-V4系列MoE模型的全参数后训练,MFU达到34.22%。这是国产AI芯片首次在万亿参数MoE模型训练效率上给出可量化的工程实践,对考虑国产算力替代的团队有直接参考价值。

昇腾集群训出DeepSeek-V4全参数后训练

GPU集群训练MoE的通信瓶颈已有Megatron-LM、DeepSpeed等成熟方案,但昇腾NPU的通信拓扑和内存架构与GPU差异很大,直接迁移效率极低。这篇报告的关键价值在于给出了分层优化的具体路径:模型并行策略怎么切、通信计算怎么重叠、底层算子怎么调。

34%的MFU在GPU集群里不算顶尖(H100集群训GPT-4级别模型可达40-50%),但考虑到这是NPU首发的万亿参数MoE全参数训练结果,已经跨过了"能用"的门槛。如果后续代码或配置开源,做国产算力适配的团队可以直接省掉数月的调优周期。

一个值得跟踪的信号:DeepSeek-V4本身尚未正式发布,这篇论文提前泄露了模型存在且已在昇腾上跑通,可能暗示DeepSeek与华为在算力层面的合作深度超出公开信息。

查看原文 →