单机8GB跑2.78T参数MoE模型
推荐指数 79.0 NO. 002 · 2026.08.03
Stars165创建1 天前Forks20Issues0
为什么值得看
用176KB纯C99代码实现Kimi K3推理,无需GPU/BLAS,通过动态加载1.45TB路由专家实现8GB内存峰值。这对端侧部署和边缘推理有颠覆性参考意义,证明超大规模MoE的内存效率天花板远超预期。
A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU.
媒体预览
编辑判断
这个项目真正的杀招不是"能跑",而是揭示了MoE架构的一个反直觉特性:1.45TB的专家参数几乎零常驻内存,靠4-bit打包+按需流式加载就能work。之前大家做MoE压缩集中在蒸馏和剪枝上,比如Mixtral 8x7B的部署方案普遍需要20GB+显存,这个项目把思路彻底换到了I/O带宽和内存管理的极致优化上。
对于做端侧大模型的团队,这意味着不要急着把模型做小,而是重新设计checkpoint的存储布局和加载策略。如果你正在用llama.cpp或mlc-llm做端侧部署,值得研究它的dense trunk常驻+expert流式机制,这套方法很可能迁移到你的场景里。
Star History
生态分析
Experimental
超大规模MoE模型端侧极限压缩推理的极端优化参考实现
独特价值:2.78T参数MoE单CPU 8GB内存推理,176KB代码零依赖极致便携
竞品: