Mac 本地 LLM 推理的 KV 缓存分层方案
推荐指数 68.0 NO. 004 · 2026.08.18
Stars18,916
为什么值得看
oMLX 是一款专为 Mac 设计的本地 LLM 推理工具,支持从菜单栏管理连续批处理和分层 KV 缓存(热内存 + 冷 SSD),对话上下文变更时历史缓存仍可复用。对需要高频调用本地模型的开发者来说,这解决了模型常驻内存与显存/内存不足之间的核心矛盾。
LLM inference server with continuous batching & SSD caching for Apple Silicon — managed from the macOS menu bar
媒体预览
编辑判断
目前 Mac 本地跑大模型的主流方案是 llama.cpp 和 Apple 官方的 MLX,但两者都缺乏精细的内存管理机制——要么模型全驻内存导致系统卡顿,要么每次切换模型重新加载。oMLX 的分层 KV 缓存设计借鉴了数据库的冷热分离思路,把不活跃的上下文压到 SSD,需要时秒级恢复,这比 llama.cpp 的 swap 机制更智能。
关键区别在于 oMLX 支持上下文变更后的缓存复用,这意味着你可以在一个长对话里反复修改 system prompt 或切换分支讨论,而不必重新计算全部 KV。对于用本地模型做代码 review、多文件重构的开发者,这能把有效吞吐量提升数倍。
最该试的人群:16GB-32GB 内存的 MacBook Pro 用户,之前因为内存压力被迫用云端 API 的,现在可以重新评估本地方案的可行性。建议直接跑它的 benchmark 对比自己现有方案的 TTFT(首 token 延迟)和吞吐量。
Star History
生态分析
Production
Mac端MLX推理服务器中唯一集成SSD缓存与菜单栏管理的生产级工具
独特价值:分层KV缓存复用历史上下文,解决高频调用内存瓶颈
竞品: