AMAZINGINDEX.COM 日报快照
56.6
VOL. 2026.07
2026.07.24
← 返回 2026.07.24 日报
日报快照 · Daily Snapshot
NO. 003

26B模型2GB内存跑,8GB Mac也能本地推理

#REPO GitHub Search 2026.07.24
推荐指数 75.0 NO. 003 · 2026.07.24
Stars137创建6 天前Forks2Issues4

TurboFieldfare 用 Swift + Metal 为 Apple Silicon Mac 构建定制运行时,通过 SSD 流式加载专家模块实现 Gemma 4 26B-A4B 的极低内存推理。对受限于统一内存架构的 Mac 用户,这是目前唯一能在 8GB 设备上运行 26B MoE 模型的可行方案。

Gemma 4 26B-A4B inference in ~2 GB of RAM on any M-series MacBook

26B模型2GB内存跑,8GB Mac也能本地推理

MoE 模型的内存瓶颈一直是端侧部署的死结,之前大家的解法要么是量化到 INT4 牺牲质量,要么是直接用 llama.cpp 的 CPU 回退放弃速度。这个项目的关键洞察是把专家层当流式资产而非常驻内存,和 llama.cpp 的 full model load 或 mlx-lm 的权重缓存策略形成本质差异。

它的代价是 token latency 会受 SSD 带宽约束,M1 的 3GB/s 顺序读取和 M3 Pro 的 7GB/s 体验会差距明显。如果你在做 macOS 原生 AI 应用且用户群大量持有入门款 MacBook Air,这个方案比云端推理更符合隐私合规叙事,值得 fork 后针对自己的 MoE 架构做专家分块策略调整。

Star History
Experimental

Apple Silicon端侧MoE大模型推理的极限内存优化方案

独特价值:唯一实现8GB Mac运行26B MoE,SSD流式加载突破统一内存瓶颈

竞品:
BRVWL/sagetalk-macos 同为端侧Gemma4推理,但非开源库而是闭源应用,内存优化不及目标
查看原文 →