AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.08
2026.08.08
← 返回 2026.08.08 日报
日报快照 · Daily Snapshot
NO. 023

无Critic的Agent信用分配新范式

#HF_PAPERS HuggingFace Papers 2026.08.08
推荐指数 74.0 NO. 023 · 2026.08.08
upvotes64comments1

AgentOPSD提出递归自蒸馏方法,将token级log-prob差距聚合为turn级证据,在log-odds空间更新贝叶斯信念状态,实现长程多轮任务中的细粒度信用分配。对做Agent RL的工程师来说,这意味着可以摆脱critic网络的设计负担,同时获得比传统轨迹级优势估计更精确的局部监督信号。

无Critic的Agent信用分配新范式

当前Agent RL的主流做法要么用PPO+GAE做轨迹级优化(粗粒度),要么像RAPTOR或V-STaR那样引入外部critic或过程奖励模型(增加系统复杂度)。AgentOPSD的巧妙之处在于把privileged self-distillation变成了递归贝叶斯更新,本质上是用teacher model的置信度变化作为隐式过程奖励,省了单独训练PRM的算力和数据成本。

论文提到在SWE-bench和WebArena上做了验证,但具体数字摘要里没给,这是关键缺失——如果最终性能没超过OpenAI的Deep Research或Anthropic的Claude with computer use那套critic-based方案,方法再优雅也难落地。建议等代码开源后重点看ablation里recursive update vs. simple aggregation的差异有多大,这决定了贝叶斯框架是不是真有必要还是学术包装。

查看原文 →