AMAZINGINDEX.COM 日报快照
55.7
VOL. 2026.06
2026.06.28
← 返回 2026.06.28 日报
日报快照 · Daily Snapshot
NO. 022

强化学习智能体训练提速新范式

#HF_PAPERS HuggingFace Papers 2026.06.28
推荐指数 73.0 NO. 022 · 2026.06.28
upvotes40comments1

OPID 提出在线策略技能蒸馏框架,从已完成轨迹中提取密集 hindsight 监督信号,解决语言智能体基于结果强化学习中稀疏奖励难以指导中间决策的问题。相比依赖外部技能库或检索上下文的现有方法,OPID 避免了状态分布不匹配和维护成本,对需要多轮交互的 Agent 训练效率提升有直接价值。

强化学习智能体训练提速新范式

当前语言 Agent 的 RL 训练普遍面临一个尴尬:ReAct、Reflexion 这些框架靠最终任务成败给奖励,但智能体在中间步骤犯了错往往要到结尾才知道,信用分配效率极低。OPID 的 trick 在于用当前策略自己生成的轨迹做 hindsight 蒸馏,把整条轨迹的成败转化为 token 级别的密集梯度,这和 GAIL 里用当前策略样本训练判别器的思路有相通之处,但避免了对抗训练的不稳定性。

论文提到在 WebShop 和 ALFWorld 上做了验证,但 40 upvotes 和 1 条评论说明社区还在观望。关键问题是代码是否开源、以及这种 on-policy 蒸馏在大模型上的算力开销——如果每次更新都需要采样大量完整轨迹,7B 以上模型的训练成本可能让中小团队望而却步。建议等开源后先看 WebShop 上的具体收敛曲线和 wall-clock time 对比。

查看原文 →