AMAZINGINDEX.COM 日报快照
51.2
VOL. 2026.09
2026.09.03
← 返回 2026.09.03 日报
日报快照 · Daily Snapshot
NO. 021

MoE循环层:同算力下性能反超

#HF_PAPERS HuggingFace Papers 2026.09.03
推荐指数 81.0 NO. 021 · 2026.09.03
upvotes68comments1

SMELT 在保持相同 FLOPs、参数量和 KV Cache 的前提下,将 MoE Transformer 中间层循环两次,训练效率和下游任务性能双双提升。对受限于推理预算又想压榨模型能力的团队有直接参考价值。

MoE循环层:同算力下性能反超

MoE 的痛点一直是激活参数量和推理成本的平衡,之前 DeepSeek-MoE 用细粒度专家+共享专家来解,SMELT 换了个角度:用循环层增加有效深度但不增加内存占用。关键是在 54B 规模上验证了 scaling 稳定性,说明这不是小模型 trick。

论文提到会开源代码,如果复现顺利,这相当于给 MoE 架构提供了一个零成本增益开关。做长上下文推理的团队尤其该关注——KV Cache 没涨意味着循环层不会加剧内存瓶颈。

查看原文 →