AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.07
2026.07.16
← 返回 2026.07.16 日报
日报快照 · Daily Snapshot
NO. 013

300美元废铁跑Gemma 4 26B

#ARTICLE HackerNews 2026.07.16
推荐指数 72.0 NO. 013 · 2026.07.16
发布2026/07/15Score139Comments74

一台13年前无GPU的双路Xeon服务器通过llama.cpp量化方案,以5 tok/s运行Gemma 4 26B MoE模型。这证明了边缘推理的硬件门槛被进一步击穿,对成本敏感的自托管和私有化部署场景有直接参考价值。

这个案例的真正价值不在"老机器能跑大模型"的猎奇感,而在Q8_0量化+llama.cpp对MoE架构的调度优化。Gemma 4 26B-A4B是稀疏激活的MoE,实际前向只跑4B参数,这是它能被CPU消化的关键前提——换同等参数的稠密模型会直接爆内存。

对读者的行动建议:如果你在做私有化部署方案,MoE模型的性价比正在重新被评估。之前大家默认MoE训练省、推理贵,但llama.cpp对稀疏路由的CPU优化+量化方案正在打破这个认知。需要关注你的推理框架是否支持MoE的expert并行调度,以及Q8_0精度在你的业务场景下是否可接受。

另一个隐藏信号:Google选择把Gemma 4做成开放权重的MoE,配合社区量化生态,可能是有意抢占"低成本自托管"这个Llama 3密集模型的优势阵地。

正面 72 条评论

核心争论:老旧无GPU服务器能否实用化运行26B MoE模型,以及量化方案对非AVX2架构的兼容性陷阱

neomindryan

Author here. The short version: a viral post ran Gemma 4 on a 2016 Xeon; my Xeons are 2013, and the fork it used assumes AVX2, which Ivy Bridge doesn't have. The build failure was easy. The fun bug was the silent one: two MoE graph ops with no dispatch case on non-AVX2 builds, so every expert FFN ou

otherjason

This reads as pretty clearly AI-generated text, which is against HN guidelines.

pkghost

Here's the thing: life also imitates art. If you invert your load-bearing assumption, it could be that he just reads too much slop. But my honest take? You might be right.

替代方案: ollamaLM Studio
查看原文 →