单机跑2.8T参数MoE模型
Deltafin通过动态卸载专家层+MXFP4量化,在64GB M1 Max上跑通Kimi K3(2.8T参数),速度0.0687 token/s。证明了超大规模MoE本地推理的可行性,为边缘部署和隐私敏感场景开辟新路径。
Run Kimi K3, a 2.8T-parameter Mixture-of-Experts LLM, on a single Apple Silicon Mac. Streams MXFP4 experts on demand over HTTP into a local disk cache — fused NEON kernels, Metal/MPS compute, exact reproducible decoding, and an OpenAI-compatible API server for local chat and coding agents.
之前想把超大MoE模型塞到单机的方案主要是DeepSpeed-Inference和vLLM的pipeline并行,但都要多卡或高端GPU,消费级设备基本没戏。Deltafin的 trick 是把活跃专家常驻内存、非活跃专家量化后按需加载,配合MPS/Metal的内存统一架构绕过PCIe带宽瓶颈。
跟llama.cpp的CPU offload比,Deltafin专门针对MoE的稀疏激活做优化,不是简单层卸载;跟HuggingFace的accelerate比,它做了原生MXFP4 kernel而不是用FP16/BF16凑合。如果你有Apple Silicon设备且需要本地跑大模型(比如医疗、法律等隐私敏感场景),这是目前最值得试的方案。
关键限制:0.0687 token/s只是能跑,离可用还差两个数量级。建议关注其expert调度策略能否迁移到Llama 4 MoE或Qwen3-235B-A22B。
超大规模MoE模型边缘部署先驱,专注Apple Silicon本地推理可行性验证
独特价值:唯一实现2.8T参数MoE在单台Mac运行,MXFP4流式专家卸载+NEON/Metal定制内核