MoE循环层:同算力下性能反超
推荐指数 81.0 NO. 021 · 2026.09.03
upvotes68comments1
为什么值得看
SMELT 在保持相同 FLOPs、参数量和 KV Cache 的前提下,将 MoE Transformer 中间层循环两次,训练效率和下游任务性能双双提升。对受限于推理预算又想压榨模型能力的团队有直接参考价值。
媒体预览
编辑判断
MoE 的痛点一直是激活参数量和推理成本的平衡,之前 DeepSeek-MoE 用细粒度专家+共享专家来解,SMELT 换了个角度:用循环层增加有效深度但不增加内存占用。关键是在 54B 规模上验证了 scaling 稳定性,说明这不是小模型 trick。
论文提到会开源代码,如果复现顺利,这相当于给 MoE 架构提供了一个零成本增益开关。做长上下文推理的团队尤其该关注——KV Cache 没涨意味着循环层不会加剧内存瓶颈。