DeltaNet线性注意力原理拆解
推荐指数 72.0 NO. 010 · 2026.07.29
发布2026/07/28Score245Comments101
为什么值得看
用量子力学bra-ket符号重新推导DeltaNet系列线性注意力变体,揭示其设计目标与数学本质。适合被复杂公式劝退、想抓核心直觉的工程师快速补课。
编辑判断
线性注意力领域论文公式越来越繁复,但工程落地时真正关键的是状态压缩效率和梯度稳定性。这篇推导把DeltaNet的key归一化和状态映射拆得很透,实际上是在回答一个工程问题:为什么Kimi选这个方案而不是Mamba或RWKV。
如果你在做长上下文推理优化,建议直接跳到状态维度分析部分。DeltaNet的key空间到value空间的映射设计,和最近Google Titan的内存机制有共通思路,但实现更轻量。代码层面可以对比着看,选适合你的序列长度的方案。
社区反馈
意见分歧 96 条评论
核心争论:"you could have"式标题引发数学沟通方式与读者实际理解鸿沟的争论
after a cursory read, I can confidently say I could not, in fact, have come up with Kimi Delta Attention.
Not even close for me too.
I thought I was the only one.