AMAZINGINDEX.COM 日报快照
50.5
VOL. 2026.07
2026.07.14
← 返回 2026.07.14 日报
日报快照 · Daily Snapshot
NO. 021

长程终端任务基准测试发布

#HF_PAPERS HuggingFace Papers 2026.07.14
推荐指数 71.0 NO. 021 · 2026.07.14
upvotes43comments1

Long-Horizon-Terminal-Bench 推出 46 个长程终端任务,覆盖实验复现、软件工程、科学计算等 9 类场景,首次用密集奖励信号替代传统稀疏评估。对 AI Agent 开发者而言,这意味着可以精确定位 agent 在哪一步失败,而非只看最终结果。

长程终端任务基准测试发布

当前主流终端基准如 SWE-bench、Terminal-Bench 都只判最终对错,agent 花了 50 步最后报错和第一步就报错得分一样,这对长程任务优化极不友好。这个基准把密集奖励机制引入终端评估,本质上是在模仿人类调试时的渐进反馈。

不过 46 个任务量还偏小,且长程任务平均耗时和成本未知——如果单次评估要跑几小时、烧几十美元 API,实际采用率会受限。建议做 Agent 框架的团队先跑自己模型的错误热力图,看失败模式是规划崩坏还是工具调用细节出错,这比刷榜更有价值。

查看原文 →