AMAZINGINDEX.COM 日报快照
54.9
VOL. 2026.08
2026.08.01
← 返回 2026.08.01 日报
日报快照 · Daily Snapshot
NO. 008

MacBook 本地跑通 2.78T 参数 K3

#ARTICLE HackerNews 2026.08.01
推荐指数 81.0 NO. 008 · 2026.08.01
发布2026/07/31Score58Comments16

WASTE 引擎用磁盘流式加载专家网络+内存缓存,让完整版 Kimi K3 在 64GB MacBook 上以 0.5 tok/s 运行。这意味着万亿参数 MoE 模型首次脱离数据中心,为边缘部署和隐私场景开辟了新路径。

之前跑超大 MoE 的常规思路是量化蒸馏或剪枝到 70B 级别,比如 EXL2、GGUF 社区的做法,但代价是模型能力断层。WASTE 反其道而行,不碰权重本身,用 C 手写推理引擎砍掉 PyTorch 的内存膨胀,把专家网络当页缓存管理——这其实是把操作系统成熟的换页机制借来做神经网络推理。

对做私有化部署的团队来说,这个方案比 vLLM + 多卡 A100 便宜两个数量级,比 4-bit 量化模型的精度损失更可控。如果你在金融、医疗等强隐私场景,且延迟不敏感(比如离线批处理),这个架构值得深入研究。关键风险是 0.5 tok/s 的实用边界,以及 982GB 模型文件的存储和分发成本。

意见分歧 16 条评论

核心争论:LLM生成代码的透明度与可信度之争,以及边缘部署万亿参数模型的实用价值

cjbprime

Does it not use Metal, on macOS? Would it be faster if it did?

marcobambini

We tried to use Metal, but for that specific project it was slower than just using NEON ARM optimizations. It is all documented in the docs.

pja

That README hits all my “this is authored by an LLM” instincts. I presume the codebase is also written by an LLM?

查看原文 →