手写 LLM 推理核心算子教程
推荐指数 80.0 NO. 005 · 2026.05.26
Stars107创建5 天前Forks0Issues0
为什么值得看
用 Triton/PyTorch/CUDA 从零实现 Softmax、GEMM、FlashAttention 等 LLM 推理关键 kernel,附带可复现的本地 benchmark 框架。适合想深入理解 GPU 性能瓶颈、而非只会调 PyTorch API 的工程师。
编辑判断
市面上讲 LLM 推理优化的资料要么太浅(只讲模型结构),要么太深(直接读 CUTLASS 源码),中间层极度稀缺。这个 repo 的定位很精准:用可读性优先的代码帮你跨过"会用 PyTorch"到"能写 kernel"的门槛。
跟 triton-lang/tutorials 相比,它更聚焦 LLM 场景(特别是 attention 和 GEMM),而且强调本地 benchmark 的可复现性——这一点很务实,因为 GPU 型号和驱动版本对性能数据影响极大。跟 FlashAttention 官方 repo 相比,代码量更小、注释更友好,适合作为读官方实现前的热身。
如果你正在做模型部署优化、或者准备面试 LLM Infra 岗位,建议把三个 kernel 逐行跑一遍,重点关注 block tiling 策略和 online softmax 的数值稳定性处理。
Star History
生态分析
Experimental
LLM推理Kernel教学型实验库,填补Triton手写算子学习资源空白
独特价值:从零实现+本地benchmark,聚焦GPU性能瓶颈理解而非工具调用