AMAZINGINDEX.COM 日报快照
53.3
VOL. 2026.09
2026.09.02
← 返回 2026.09.02 日报
日报快照 · Daily Snapshot
NO. 013

48GB Mac跑104GB大模型,12 tok/s

#ARTICLE HackerNews 2026.09.02
推荐指数 75.0 NO. 013 · 2026.09.02
发布2026/09/01Score91Comments62

slotstream用Swift写了一个纯二进制推理引擎,通过SSD流式加载让125B参数的MoE模型在内存不足的Mac上运行。现有Ollama/OpenAI API工具无需改动即可接入,8GB Mac也能跑,是端侧大模型部署的新解法。

之前想在消费级Mac跑超大模型,要么买满配192GB内存的M3 Ultra,要么用llama.cpp的CPU offload忍受慢到无法使用的速度。slotstream的 trick 在于利用Apple Silicon的统一内存架构和高速SSD,把权重当swap用但做了专门的预取优化,这比通用的操作系统swap更高效。

和Ollama比,它不是简单的封装而是替换了整个推理后端;和mlx-lm比,它突破了MLX的内存限制。最该关注的是做本地AI应用创业的团队——以前你的用户必须是有64GB+内存的极客,现在512GB硬盘的普通MacBook Pro也能成为目标用户,TAM直接扩大了一个数量级。

风险点:SSD持续高负载的寿命损耗、冷启动3秒对交互场景的容忍度、以及Qwen3.8-Flash-Next的实际能力是否值得这个折腾。建议先拿自己的主力工作流测一轮,别被参数规模数字迷惑。

意见分歧 53 条评论

核心争论:重复造轮子 vs 开源实验精神:社区质疑项目与现有方案重复,作者辩护为个人技术探索

AmazingTurtle

There are already a handful of repos doing essentially exactly this: `mlx-moe-offload`, `streamlx`, `mlx-moe`, `mlx-flash`, and `deepseek-v4-flash-mlx` - i.e. keep the resident parts of an MoE in unified memory and page/stream routed experts from SSD on Apple Silicon. At this point I'd much rat

api

> every implementation idea rediscovered five times and wrapped in a new README That's open source since forever, unfortunately.

docheinestages

It's what happens when you don't do market research.

替代方案: mlx-moe-offloadstreamlxmlx-moemlx-flashdeepseek-v4-flash-mlxMferenceSwiftLMOllama
查看原文 →