GRPO 细粒度奖励分配新方法
推荐指数 79.0 NO. 023 · 2026.07.31
upvotes73comments2
为什么值得看
CoRT 提出用反事实回放实现 token 级评分,替代 GRPO 中粗暴的 response 级均匀广播优势值。让不同 rubric 标准能精准对应到具体文本片段,解决长文本生成中 credit assignment 模糊的问题。
媒体预览
编辑判断
GRPO 的 response-level advantage 是个老问题,之前常见的 workaround 是训练单独的 token value model 或者做 outcome supervision,但都要额外开销。CoRT 的 trick 在于用同一条采样回复做 counterfactual rescoring,不训新模型就能拿到细粒度信号,这个设计比较取巧。
不过论文热度偏低,73 upvotes 说明社区还在观望。关键要看开源代码和有没有在主流 RL 框架比如 TRL、verl 里复现,如果集成成本高,实际落地会比较慢。做长文本生成或复杂格式遵循的团队可以跟踪一下。
相关内容
Rewarding the Unlikely: Lifting GRPO Beyond Distribution Sharpening 提出改进GRPO方法,解决分布锐化问题,扩展GRPO在更广泛场景的应用能力。 ShapE-GRPO: Shapley-Enhanced Reward Allocation for Multi-Candidate LLM Training 引入Shapley值增强GRPO奖励分配,针对多候选LLM训练优化细粒度奖励机制。 GRPO is Secretly a Process Reward Model 揭示GRPO本质上是过程奖励模型,重新理解GRPO的奖励分配内在机制。 GRANULAR GRPO FOR PRECISE REWARD IN FLOW Flow-GRPO方法在扩散模型中实现精确奖励分配,通过SDE采样引入随机性优化图像生成。 Group Relative Policy Optimization (GRPO) 详解GRPO核心机制:通过采样多组完成结果估计优势函数,简化PPO的奖励计算流程。