MoE推理加速:用专家预测智能调度请求
推荐指数 87.0 NO. 022 · 2026.07.03
upvotes19comments2
为什么值得看
ELDR通过预填充阶段预测请求将激活哪些专家,把请求路由到已缓存对应专家的解码节点,避免重复加载权重。PD分离架构下的MoE服务终于有了解决专家加载瓶颈的实用方案,部署成本可能显著降低。
媒体预览
编辑判断
现有PD分离方案如vLLM的Disaggregated Serving或Mooncake只解决预填充与解码的负载均衡,但MoE模型的核心瓶颈是专家权重的内存带宽——每次解码step加载不同专家, equally loaded的节点实际latency差距巨大。
ELDR的关键洞察是把路由决策从"负载均衡"变成"专家局部性最大化",这类似于缓存感知的任务调度。论文提到用prefill的expert activation pattern预测decode阶段的signature,准确率足够支撑调度决策。
工程落地要看预测开销和misprediction的fallback机制是否完善,以及是否兼容现有的PD分离infra如vLLM或SGLang。如果开源实现可用,做MoE模型API服务的团队应该优先测试。
相关内容
eMoE: Task-aware Memory Efficient Mixture-of-Experts 通过专家预测减少内存使用,优化MoE推理过程,核心方法论包含专家预测机制。 SMoE: 新型MoE LLM端侧推理加速方法 南京大学团队提出专家替换机制,解决边缘端MoE动态卸载高延迟问题,解码延迟缩短48%。 A Spatio-Temporal Expert Prefetching Framework for Efficient MoE-based LLM Inference 时空专家预取框架,针对MoE大语言模型推理效率优化,发表于arXiv硬件架构领域。 专家混合模型(MOE)推理优化技术全景 从模型到硬件深度解析MoE推理优化,涵盖动态激活机制与计算成本降低策略。