AMAZINGINDEX.COM 日报快照
54.8
VOL. 2026.07
2026.07.30
← 返回 2026.07.30 日报
日报快照 · Daily Snapshot
NO. 005

Moonshot 开源高性能线性注意力核

#REPO GitHub Trending 2026.07.30
推荐指数 69.0 NO. 005 · 2026.07.30
Stars953

FlashKDA 是 Moonshot AI 基于 CUTLASS 构建的高性能 Kimi Delta Attention (KDA) CUDA 内核,专为 SM90+ 架构优化,已集成到 flash-linear-attention 框架作为后端自动调度。对于在 H100/B200 上跑长序列线性注意力的团队,这可能是目前性能最优的底层实现选择。

FlashKDA: high-performance Kimi Delta Attention kernels

线性注意力(如 Mamba、RWKV、Kimi 的 KDA)的痛点从来不是理论,而是 CUDA kernel 效率打不过 FlashAttention。Moonshot 亲自下场写 CUTLASS kernel 且要求 SM90+,说明他们在赌 Hopper 架构的 TMA 和 WGMMA 指令是线性注意力反超 Transformer 的关键硬件拐点。

对比 FlashAttention-3 同样强绑定 Hopper,FlashKDA 的差异化在于把 Delta Rule 的递归计算也塞进了 warp-group 级别的高效流水线。做长文本推理 infra 的团队要注意:你的硬件采购决策现在和算法选型强绑定了,买 A100 还是 H100 不再是单纯的价格问题。

已经在用 fla-org/flash-linear-attention 的用户可以零成本切换后端测吞吐,建议优先对比 32K+ 序列长度下的显存占用和时延。

Star History
Production

Moonshot AI 自研的 KDA 专用 CUDA 内核,填补长序列线性注意力高性能后端空白

独特价值:SM90+ 架构深度优化,flash-linear-attention 框架官方后端,H100/B200 性能最优

查看原文 →