RL训练Agent时用自蒸馏修正token级奖励
推荐指数 73.0 NO. 022 · 2026.05.16
upvotes64comments0
为什么值得看
SDAR提出用sigmoid门控自蒸馏机制,在RL多轮Agent训练中给token级正负反馈做精细化加权,解决轨迹级奖励信号太粗的问题。对正在用RLHF/RLAIF做Agent后训练的团队有直接参考价值,可能降低训练不稳定和负样本浪费。
媒体预览
编辑判断
OPSD这类自蒸馏思路之前多在单轮生成里用,这篇的关键是把on-policy self-distillation嵌进了多轮交互的RL流程,用sigmoid门控动态决定多大程度跟老策略学、多大程度接受新策略的探索结果。这比PPO+KL散度的硬约束更灵活,理论上能缓解Agent训练里常见的"探索到好轨迹但KL惩罚太重不敢跟"的问题。
不过论文没给具体的环境和模型规模,64个upvote零评论也说明社区还在观望。如果你在用GRPO或PPO训Agent,建议等代码放出来直接看门控系数的实际分布,这比看ablation更有信息量。