AMAZINGINDEX.COM 日报快照
53.1
VOL. 2026.08
2026.08.03
← 返回 2026.08.03 日报
日报快照 · Daily Snapshot
NO. 002

单机8GB跑2.78T参数MoE模型

#REPO GitHub Search 2026.08.03
推荐指数 79.0 NO. 002 · 2026.08.03
Stars165创建1 天前Forks20Issues0

用176KB纯C99代码实现Kimi K3推理,无需GPU/BLAS,通过动态加载1.45TB路由专家实现8GB内存峰值。这对端侧部署和边缘推理有颠覆性参考意义,证明超大规模MoE的内存效率天花板远超预期。

A 2.78-trillion-parameter Kimi K3 running inference on a single CPU in 8.24 GB of RAM. Portable C99: no BLAS, no framework, no GPU.

单机8GB跑2.78T参数MoE模型

这个项目真正的杀招不是"能跑",而是揭示了MoE架构的一个反直觉特性:1.45TB的专家参数几乎零常驻内存,靠4-bit打包+按需流式加载就能work。之前大家做MoE压缩集中在蒸馏和剪枝上,比如Mixtral 8x7B的部署方案普遍需要20GB+显存,这个项目把思路彻底换到了I/O带宽和内存管理的极致优化上。

对于做端侧大模型的团队,这意味着不要急着把模型做小,而是重新设计checkpoint的存储布局和加载策略。如果你正在用llama.cpp或mlc-llm做端侧部署,值得研究它的dense trunk常驻+expert流式机制,这套方法很可能迁移到你的场景里。

Star History
Experimental

超大规模MoE模型端侧极限压缩推理的极端优化参考实现

独特价值:2.78T参数MoE单CPU 8GB内存推理,176KB代码零依赖极致便携

竞品:
mithraeums/hako ★ 3 同为C99 CPU推理引擎,但仅支持3B/7B小模型,无MoE支持
查看原文 →