Moonshot 开源高性能线性注意力核
FlashKDA 是 Moonshot AI 基于 CUTLASS 构建的高性能 Kimi Delta Attention (KDA) CUDA 内核,专为 SM90+ 架构优化,已集成到 flash-linear-attention 框架作为后端自动调度。对于在 H100/B200 上跑长序列线性注意力的团队,这可能是目前性能最优的底层实现选择。
FlashKDA: high-performance Kimi Delta Attention kernels
线性注意力(如 Mamba、RWKV、Kimi 的 KDA)的痛点从来不是理论,而是 CUDA kernel 效率打不过 FlashAttention。Moonshot 亲自下场写 CUTLASS kernel 且要求 SM90+,说明他们在赌 Hopper 架构的 TMA 和 WGMMA 指令是线性注意力反超 Transformer 的关键硬件拐点。
对比 FlashAttention-3 同样强绑定 Hopper,FlashKDA 的差异化在于把 Delta Rule 的递归计算也塞进了 warp-group 级别的高效流水线。做长文本推理 infra 的团队要注意:你的硬件采购决策现在和算法选型强绑定了,买 A100 还是 H100 不再是单纯的价格问题。
已经在用 fla-org/flash-linear-attention 的用户可以零成本切换后端测吞吐,建议优先对比 32K+ 序列长度下的显存占用和时延。
Moonshot AI 自研的 KDA 专用 CUDA 内核,填补长序列线性注意力高性能后端空白
独特价值:SM90+ 架构深度优化,flash-linear-attention 框架官方后端,H100/B200 性能最优