26B模型2GB内存跑,8GB Mac也能本地推理
推荐指数 75.0 NO. 003 · 2026.07.24
Stars137创建6 天前Forks2Issues4
为什么值得看
TurboFieldfare 用 Swift + Metal 为 Apple Silicon Mac 构建定制运行时,通过 SSD 流式加载专家模块实现 Gemma 4 26B-A4B 的极低内存推理。对受限于统一内存架构的 Mac 用户,这是目前唯一能在 8GB 设备上运行 26B MoE 模型的可行方案。
Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook
媒体预览
编辑判断
MoE 模型的内存瓶颈一直是端侧部署的死结,之前大家的解法要么是量化到 INT4 牺牲质量,要么是直接用 llama.cpp 的 CPU 回退放弃速度。这个项目的关键洞察是把专家层当流式资产而非常驻内存,和 llama.cpp 的 full model load 或 mlx-lm 的权重缓存策略形成本质差异。
它的代价是 token latency 会受 SSD 带宽约束,M1 的 3GB/s 顺序读取和 M3 Pro 的 7GB/s 体验会差距明显。如果你在做 macOS 原生 AI 应用且用户群大量持有入门款 MacBook Air,这个方案比云端推理更符合隐私合规叙事,值得 fork 后针对自己的 MoE 架构做专家分块策略调整。
Star History
生态分析
Experimental
Apple Silicon端侧MoE大模型推理的极限内存优化方案
独特价值:唯一实现8GB Mac运行26B MoE,SSD流式加载突破统一内存瓶颈
竞品:
BRVWL/sagetalk-macos 同为端侧Gemma4推理,但非开源库而是闭源应用,内存优化不及目标