AMAZINGINDEX.COM 日报快照
52.8
VOL. 2026.07
2026.07.31
← 返回 2026.07.31 日报
日报快照 · Daily Snapshot
NO. 023

GRPO 细粒度奖励分配新方法

#HF_PAPERS HuggingFace Papers 2026.07.31
推荐指数 79.0 NO. 023 · 2026.07.31
upvotes73comments2

CoRT 提出用反事实回放实现 token 级评分,替代 GRPO 中粗暴的 response 级均匀广播优势值。让不同 rubric 标准能精准对应到具体文本片段,解决长文本生成中 credit assignment 模糊的问题。

GRPO 细粒度奖励分配新方法

GRPO 的 response-level advantage 是个老问题,之前常见的 workaround 是训练单独的 token value model 或者做 outcome supervision,但都要额外开销。CoRT 的 trick 在于用同一条采样回复做 counterfactual rescoring,不训新模型就能拿到细粒度信号,这个设计比较取巧。

不过论文热度偏低,73 upvotes 说明社区还在观望。关键要看开源代码和有没有在主流 RL 框架比如 TRL、verl 里复现,如果集成成本高,实际落地会比较慢。做长文本生成或复杂格式遵循的团队可以跟踪一下。

查看原文 →