Kimi K2.6 编程竞赛击败 GPT-5.5
推荐指数 73.0 NO. 011 · 2026.05.04
发布2026/05/03Score344Comments205
为什么值得看
Moonshot AI 的开源模型 Kimi K2.6 在实时编程挑战中战胜 GPT-5.5、Claude Opus 4.7 和 Gemini,小米 MiMo V2-Pro 获第二。西方前沿实验室模型全部跌出前两名,中国开源模型在代码能力上的追赶速度超出预期。
编辑判断
这个竞赛用的是实时对抗+客观计分机制,不是刷榜常见的 pass@k 或静态 benchmark,更能反映模型在动态约束下的真实编码能力。Word Gem Puzzle 涉及搜索算法优化和边界条件处理,对模型的长程规划和调试迭代能力要求很高。
值得警惕的是评分机制细节:比赛规则是否对中文模型更友好、是否有 overfitting 到特定题型的风险,目前信息不足。建议等 SWE-bench Verified 或 LiveCodeBench 的独立复现再下结论。如果你在做代码模型选型,可以先在内部 holdout 数据集上跑对比,不要因单次竞赛结果切换主模型。