AMAZINGINDEX.COM 日报快照
55.0
VOL. 2026.09
2026.09.05
← 返回 2026.09.05 日报
日报快照 · Daily Snapshot
NO. 021

从Agent历史记录自动重建可执行训练环境

#HF_PAPERS HuggingFace Papers 2026.09.05
推荐指数 81.0 NO. 021 · 2026.09.05
upvotes209comments0

Terminal-Universe 能从现有 agent 轨迹中的工具执行历史,反向重建出可执行的终端工作空间,并据此合成多样化训练任务。对做代码 agent 后训练的团队来说,这解决了真实可执行环境稀缺的瓶颈,让一条轨迹能被重新查询为多个可验证任务。

从Agent历史记录自动重建可执行训练环境

当前代码 agent 的后训练普遍面临两难:要么直接用 frozen trajectory 做 SFT(无法交互、无法验证),要么花大量成本从零构建仿真环境(如 SWE-bench 的 Docker 实例)。这篇工作的取巧之处在于发现 trajectory 里的 bash/python 执行历史本身就泄露了环境结构——文件系统状态、依赖版本、甚至网络配置都能被逆向推断出来。

相比 SWE-bench 或 AgentBench 这类需要人工维护的环境库,Terminal-Universe 的扩展成本接近零,理论上能把开源社区积累的数百万条 trajectory 全部激活为训练资源。论文提到用了 20K 条重建环境做 SFT,在 LiveCodeBench 上提升了 12%,但关键问题是重建成功率和对复杂外部依赖(数据库、API key)的处理能力未公开。如果开源代码的重建 pipeline 足够鲁棒,这会是比单纯堆 trajectory 数据更高效的 post-training 路线。

查看原文 →