AMAZINGINDEX.COM 日报快照
55.3
VOL. 2026.04
2026.04.25
← 返回 2026.04.25 日报
日报快照 · Daily Snapshot
NO. 004

vLLM 纯 Swift/Metal 后端提速 2.6x

#REPO GitHub Search 2026.04.25
推荐指数 76.0 NO. 004 · 2026.04.25
Stars141创建1 天前Forks4Issues1

vllm-swift 用原生 Swift/Metal 重写了 vLLM 的推理热路径,彻底移除 Python。在 M5 Max 上低并发场景吞吐量提升 2.6 倍,且保持与原版 vLLM 的 API 和启动参数完全兼容。

vLLM Metal plugin powered by mlx-swift — high-performance LLM inference on Apple Silicon

vLLM 纯 Swift/Metal 后端提速 2.6x

苹果生态做 LLM 推理的团队长期面临一个尴尬:MLX 性能不错但生态孤立,vLLM 生态完善却绕不过 Python GIL 和内存开销。这个项目走了一条中间路线——不改 vLLM 的上层调度,只把计算密集部分换成 Swift/Metal,既保留生态兼容又吃到原生性能红利。

对比纯 MLX 路线,它的优势是零迁移成本:所有 vLLM 的量化格式、分页注意力、连续批处理都直接可用。对比原版 vLLM+Python,低并发时 Python 解释器开销占比极高,这正是 Swift 能拉开差距的场景。

手上有 M 系列芯片且已经在跑 vLLM 的团队,这个几乎是 drop-in 的升级,半小时验证即可。做端侧部署或私有 API 服务的创业者尤其值得关注,128GB 统一内存+无 Python 开销的组合,可能是目前 Mac Studio 跑小模型的最优解。

Star History
查看原文 →