AMAZINGINDEX.COM 日报快照
53.5
VOL. 2026.07
2026.07.18
← 返回 2026.07.18 日报
日报快照 · Daily Snapshot
NO. 022

RL智能体训练缺中间反馈?SEED自蒸馏补位

#HF_PAPERS HuggingFace Papers 2026.07.18
推荐指数 72.0 NO. 022 · 2026.07.18
upvotes65comments1

SEED提出将已完成的on-policy轨迹自动提炼为 hindsight skills 再蒸馏回策略模型,解决稀疏奖励下中间决策缺乏监督的问题。对正在用RL训练Agent的团队,这是填补episode-level与token-level之间鸿沟的可行路径。

RL智能体训练缺中间反馈?SEED自蒸馏补位

当前Agent RL的主流做法要么依赖DPO等离线方法(无法利用环境反馈),要么用PPO但只能拿到稀疏的轨迹奖励,中间步骤靠猜。SEED的关键设计是"自举"——用策略自己生成的成功轨迹反向构造技能标签,不需要额外标注或奖励模型。

这与去年DeepMind的STaR、清华的ReST这类"自举改进"思路一脉相承,但SEED专门解决了多轮交互中的信用分配问题。论文提到在WebShop和ToolBench上做了验证,不过代码尚未开源,想跟进的团队可以先读方法部分的伪代码实现。

如果后续开源,建议对比直接用PPO+GAE的基线,看中间步骤的KL散度变化——这是判断"蒸馏是否真学到了技能而非过拟合到特定轨迹"的关键指标。

查看原文 →