从零手写 Apple Silicon 推理引擎
一门基于习题的实战课程,每道题都指向在 Apple Silicon 上构建完整的 LLM 推理引擎,要求每个算子同时实现 Swift CPU 版本和 Metal GPU 版本。对想深入理解端侧推理而非只会调 API 的工程师是稀缺资源。
A hands-on Swift and Metal course for building LLM inference from first principles on Apple silicon, with 48 guided lessons, runnable exercises, a native macOS Studio, and a complete companion book.
市面上教 LLM 推理的课程大多围绕 CUDA 和 NVIDIA GPU,Apple Silicon 的 Metal 生态长期缺乏系统性学习材料。这个项目的独特之处在于强制双轨实现:先用 Swift 写 CPU 版保证正确性,再手写 Metal shader 优化性能,这种"可验证的底层优化"思路比直接看 MLX 源码更友好。
与 PyTorch 或 MLX 这类高层框架不同,这里没有自动算子融合和内存管理,你必须自己决定 tile size、threadgroup 布局和寄存器分配。如果你在做 iOS/Mac 端侧部署且发现 MLX 性能不够满意,或者想面试 Apple、Anthropic 等公司的推理优化岗,这是极少数能让你拿出"我写过 attention 的 Metal kernel"这种硬证据的项目。
端侧LLM推理教育领域的稀缺深度课程,填补Apple Silicon全栈推理教学空白
独特价值:唯一要求同时手写Swift CPU与Metal GPU双版本算子的系统推理课程