月之暗面发布2.8T参数Kimi K3
推荐指数 78.0 NO. 018 · 2026.07.29
upvotes250comments4
为什么值得看
Kimi K3是2.8T参数MoE模型,激活104B参数,支持百万token上下文和原生视觉。通过Delta Attention和Stable LatentMoE将缩放效率提升2.5倍,在agent和coding领域强化学习后训练。
媒体预览
编辑判断
Delta Attention加Attention Residuals的组合值得关注,它试图解决的是长序列Transformer中信息逐层衰减的老问题,之前DeepSeek-V3用MLA压缩KV cache是另一条路。K3的做法更像是在attention机制内部做残差连接重构,让远距离信息绕过部分层直接传递。
Stable LatentMoE只激活16/896专家,这个极稀疏比例比Mixtral的8/8更激进,对推理infra的负载均衡挑战很大。月之暗面没开源,但技术报告里的训练稳定性细节值得做MoE训推的团队仔细读,尤其是expert dropout和负载均衡损失的联合设计。
百万token上下文加agentic RL的组合,明显是冲着手动操作复杂工作流的企业场景去的,和OpenAI的Operator、Anthropic的Computer Use在同一个赛道竞争。
相关内容
Kimi K3发布:拥有2.8万亿参数和100万Token上下文窗口 Kimi K3拥有2.8万亿参数,融合原生视觉理解、100万token上下文窗口,面向软件工程、知识工作等场景优化,标志中国开放模型生态快速扩张。 月之暗面推新AI模型,跑分仅次于两大美企龙头 Kimi K3基于KDA混合线性注意力机制和注意力残差技术构建,是目前全球参数最大的开源模型,性能仅次于两大美国企业龙头。 中国AI公司月之暗面发布全球最大规模开源模型 德国之声报道,Kimi K3性能已接近国际顶尖AI模型水准,是中国在全球AI主导地位争夺战中的新里程碑。 月之暗面发布2.8万亿参数模型Kimi K3 Kimi K3参数规模超越DeepSeek V4(1.6万亿)和文心大模型5.0(2.4万亿),是全球首个开源的3万亿级别模型。