AMAZINGINDEX.COM 日报快照
53.8
VOL. 2026.08
2026.08.18
← 返回 2026.08.18 日报
日报快照 · Daily Snapshot
NO. 004

Mac 本地 LLM 推理的 KV 缓存分层方案

#REPO GitHub Trending 2026.08.18
推荐指数 68.0 NO. 004 · 2026.08.18
Stars18,916

oMLX 是一款专为 Mac 设计的本地 LLM 推理工具,支持从菜单栏管理连续批处理和分层 KV 缓存(热内存 + 冷 SSD),对话上下文变更时历史缓存仍可复用。对需要高频调用本地模型的开发者来说,这解决了模型常驻内存与显存/内存不足之间的核心矛盾。

LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar

Mac 本地 LLM 推理的 KV 缓存分层方案

目前 Mac 本地跑大模型的主流方案是 llama.cpp 和 Apple 官方的 MLX,但两者都缺乏精细的内存管理机制——要么模型全驻内存导致系统卡顿,要么每次切换模型重新加载。oMLX 的分层 KV 缓存设计借鉴了数据库的冷热分离思路,把不活跃的上下文压到 SSD,需要时秒级恢复,这比 llama.cpp 的 swap 机制更智能。

关键区别在于 oMLX 支持上下文变更后的缓存复用,这意味着你可以在一个长对话里反复修改 system prompt 或切换分支讨论,而不必重新计算全部 KV。对于用本地模型做代码 review、多文件重构的开发者,这能把有效吞吐量提升数倍。

最该试的人群:16GB-32GB 内存的 MacBook Pro 用户,之前因为内存压力被迫用云端 API 的,现在可以重新评估本地方案的可行性。建议直接跑它的 benchmark 对比自己现有方案的 TTFT(首 token 延迟)和吞吐量。

Star History
Production

Mac端MLX推理服务器中唯一集成SSD缓存与菜单栏管理的生产级工具

独特价值:分层KV缓存复用历史上下文,解决高频调用内存瓶颈

竞品:
waybarrios/vllm-mlx ★ 1.5k 同为推理服务器但无SSD缓存和菜单栏管理
raspoli/mlx-serve ★ 18 支持多模态但无连续批处理和SSD缓存
Pushkinist/rMLX ★ 6 Rust单二进制但无菜单栏和SSD缓存
GuLu9527/FlashMLX ★ 2 仅轻量管理无连续批处理和SSD缓存
查看原文 →