AMAZINGINDEX.COM 日报快照
51.6
VOL. 2026.07
2026.07.03
← 返回 2026.07.03 日报
日报快照 · Daily Snapshot
NO. 022

MoE推理加速:用专家预测智能调度请求

#HF_PAPERS HuggingFace Papers 2026.07.03
推荐指数 87.0 NO. 022 · 2026.07.03
upvotes19comments2

ELDR通过预填充阶段预测请求将激活哪些专家,把请求路由到已缓存对应专家的解码节点,避免重复加载权重。PD分离架构下的MoE服务终于有了解决专家加载瓶颈的实用方案,部署成本可能显著降低。

MoE推理加速:用专家预测智能调度请求

现有PD分离方案如vLLM的Disaggregated Serving或Mooncake只解决预填充与解码的负载均衡,但MoE模型的核心瓶颈是专家权重的内存带宽——每次解码step加载不同专家, equally loaded的节点实际latency差距巨大。

ELDR的关键洞察是把路由决策从"负载均衡"变成"专家局部性最大化",这类似于缓存感知的任务调度。论文提到用prefill的expert activation pattern预测decode阶段的signature,准确率足够支撑调度决策。

工程落地要看预测开销和misprediction的fallback机制是否完善,以及是否兼容现有的PD分离infra如vLLM或SGLang。如果开源实现可用,做MoE模型API服务的团队应该优先测试。

查看原文 →