DeepSeek开源MoE通信库DeepEP
推荐指数 89.0 NO. 003 · 2026.04.25
Stars9,293
为什么值得看
DeepEP是专为MoE模型和专家并行设计的GPU通信库,提供高吞吐低延迟的all-to-all内核,支持FP8低精度运算和NVLink到RDMA的跨域转发。对训练大规模MoE模型和推理预填充场景有直接性能提升,尤其适合DeepSeek-V3架构的部署优化。
DeepEP: an efficient expert-parallel communication library
媒体预览
编辑判断
MoE训练的核心瓶颈从来不是计算而是通信——all-to-all的延迟直接决定GPU利用率。之前业界主流方案是NCCL或自研定制,但NCCL对MoE的不对称带宽场景优化不足,很多团队被迫写裸CUDA kernel维护成本极高。DeepEP的差异化在于原生支持NVLink域到RDMA域的转发优化,这恰好是千卡/万卡集群MoE的痛点,比Megatron-LM的通信方案更贴合DeepSeek-V3的group-limited gating设计。如果你正在用DeepSeek-V3做复现或基于其架构做预训练,这个库可以替代掉你现有的dispatch/combine手写kernel;如果用其他MoE架构如Mixtral,需要评估其gating算法是否匹配。
Star History