AMAZINGINDEX.COM 日报快照
50.7
VOL. 2026.08
2026.08.07
← 返回 2026.08.07 日报
日报快照 · Daily Snapshot
NO. 022

RL训练搜索Agent的信用分配新解法

#HF_PAPERS HuggingFace Papers 2026.08.07
推荐指数 86.0 NO. 022 · 2026.08.07
upvotes54comments1

ABSeeker提出Answer-Backtracked Credit Assignment(ABC)框架,将稀疏的轨迹级奖励转化为细粒度的步骤级监督,能在失败轨迹中识别并奖励有用动作。这对训练需要多步搜索、验证、整合证据的长程Agent意义重大,解决了现有SFT/RL方法"一视同仁"导致训练低效的核心痛点。

RL训练搜索Agent的信用分配新解法

现有训练搜索Agent的方法,无论是SFT还是RL,本质上都是在做' trajectory-level 的粗暴打分'——搜对了全奖,搜错了全罚,中间哪步有功哪步有过完全不管。ABC的巧妙之处在于用最终答案反向回溯,给每一步动作打上细粒度标签,相当于给RL装了'黑匣子'。

这跟去年Google DeepMind的STaR、以及OpenAI的process supervision思路有呼应,但ABC专门针对搜索场景设计了回溯机制,在HotpotQA上的实验显示同样数据量下收敛速度快了约40%。论文提到代码将开源,如果属实,做深度研究Agent的团队可以直接替换现有的PPO/GRPO训练管线,不需要改模型架构。

查看原文 →