MacBook 本地跑通 2.78T 参数 K3
推荐指数 81.0 NO. 008 · 2026.08.01
发布2026/07/31Score58Comments16
为什么值得看
WASTE 引擎用磁盘流式加载专家网络+内存缓存,让完整版 Kimi K3 在 64GB MacBook 上以 0.5 tok/s 运行。这意味着万亿参数 MoE 模型首次脱离数据中心,为边缘部署和隐私场景开辟了新路径。
编辑判断
之前跑超大 MoE 的常规思路是量化蒸馏或剪枝到 70B 级别,比如 EXL2、GGUF 社区的做法,但代价是模型能力断层。WASTE 反其道而行,不碰权重本身,用 C 手写推理引擎砍掉 PyTorch 的内存膨胀,把专家网络当页缓存管理——这其实是把操作系统成熟的换页机制借来做神经网络推理。
对做私有化部署的团队来说,这个方案比 vLLM + 多卡 A100 便宜两个数量级,比 4-bit 量化模型的精度损失更可控。如果你在金融、医疗等强隐私场景,且延迟不敏感(比如离线批处理),这个架构值得深入研究。关键风险是 0.5 tok/s 的实用边界,以及 982GB 模型文件的存储和分发成本。
社区反馈
意见分歧 16 条评论
核心争论:LLM生成代码的透明度与可信度之争,以及边缘部署万亿参数模型的实用价值
相关内容
Kimi K3 釋出2.8 兆參數權重:原生MXFP4 已無壓縮餘裕 實測頂規工作站(雙 RTX PRO 6000 96GB、512GB DDR5)跑 K3 僅達每秒 0.41 token,揭示本地部署 2.8T 參數模型的硬體瓶頸。 Kimi K3 技術拆解:重新定義每單位算力能買到多少智力 分析 K3 三項架構創新:KDA 擴長度、AttnRes 擴深度、Stable LatentMoE 擴寬度,使每單位算力 scaling 效率較 K2 提升 2.5 倍。 Kimi K3 正式公布:2.8T 參數成最大開源模型 K3 總參數達 2.8T,激活參數 1042 億為上一代三倍,採多模態 MoE 架構並完整公開技術文件。 PipeNetwork/kimi-k3-mlx: MLX port of Kimi-K3 開源專案將 Kimi-K3 移植至 Apple MLX 框架,支援串流轉換、REAP 專家剪枝與語言專家重疊分析,實現 Mac 本地運行。
Does it not use Metal, on macOS? Would it be faster if it did?
We tried to use Metal, but for that specific project it was slower than just using NEON ARM optimizations. It is all documented in the docs.
That README hits all my “this is authored by an LLM” instincts. I presume the codebase is also written by an LLM?