长程终端任务基准测试发布
推荐指数 71.0 NO. 021 · 2026.07.14
upvotes43comments1
为什么值得看
Long-Horizon-Terminal-Bench 推出 46 个长程终端任务,覆盖实验复现、软件工程、科学计算等 9 类场景,首次用密集奖励信号替代传统稀疏评估。对 AI Agent 开发者而言,这意味着可以精确定位 agent 在哪一步失败,而非只看最终结果。
媒体预览
编辑判断
当前主流终端基准如 SWE-bench、Terminal-Bench 都只判最终对错,agent 花了 50 步最后报错和第一步就报错得分一样,这对长程任务优化极不友好。这个基准把密集奖励机制引入终端评估,本质上是在模仿人类调试时的渐进反馈。
不过 46 个任务量还偏小,且长程任务平均耗时和成本未知——如果单次评估要跑几小时、烧几十美元 API,实际采用率会受限。建议做 Agent 框架的团队先跑自己模型的错误热力图,看失败模式是规划崩坏还是工具调用细节出错,这比刷榜更有价值。
相关内容
Terminal-Bench:AI 代理终端任务基准测试框架正式发布 Terminal-Bench 是专门测试 AI 代理在终端环境完成复杂任务能力的基准框架,提供评测工具和数据集。 手机AGI助手还有多远?移动智能体复合长程任务测试基准与调度系统发布 介绍移动端智能体复合长程任务基准 Atomic-to-Compositional Generalization,含新评测基准与调度系统。 Terminal-Bench 2.1:终端环境下的AI代理评测基准 Stanford 与 Laude Institute 合作开发的 Terminal-Bench 2.1 版本,基于 Z.ai 的 2.0 Verified 优化。