SWE-Bench 被曝 60% 测试用例有缺陷
推荐指数 71.0 NO. 024 · 2026.08.12
upvotes115comments1
为什么值得看
SWE-Bench ProMax 是多语言大规模代码重构基准测试,专门暴露当前 AI 编程 agent 在长程复杂任务中的未解决挑战。对做代码智能体评估和落地的团队有直接参考价值,现有基准的可信度问题比想象中更严重。
媒体预览
编辑判断
现有 SWE-Bench 的饱和速度比社区预期更快,60% 未解决实例含测试缺陷这个数据很刺眼——意味着很多模型排名可能是噪声驱动的。ProMax 选择代码重构而非 bug 修复作为新战场很聪明:重构需要跨文件协调、保持语义等价、处理多语言混编,这些正是当前 agent 从 demo 走向生产的核心瓶颈。
如果你在做 coding agent 的评估体系,建议直接对比自己模型在 ProMax 和原版 SWE-Bench 上的 gap 分布,如果差距集中在多语言和跨模块重构上,说明你的 agent 还缺长期依赖追踪能力。论文尚未确认是否开源完整数据集,但 HuggingFace 上的讨论值得跟进。