RLVR 训练噪声削减新方法
推荐指数 78.0 NO. 019 · 2026.05.23
upvotes124comments1
为什么值得看
DelTA 提出判别式 token 信用分配机制,通过放大差异化梯度方向、抑制共享模式噪声来优化可验证奖励的强化学习。对正在做 RLVR 后训练的团队,这可能是提升模型推理稳定性的关键补丁。
媒体预览
编辑判断
当前 RLVR 的主流做法如 GRPO、PPO 把整条 response 的 reward 平摊到每个 token,导致「正确答案里的废话 token」和「错误答案里的关键 token」被同等对待,梯度方向互相抵消。DelTA 的核心判别器本质上是在做 token 级别的梯度信噪比过滤,这和去年 DeepSeek 在 GRPO 里加 KL 散度约束的思路是同一方向,但粒度更细。
实验显示在数学推理任务上训练效率提升约 30%,但论文没给完整的消融实验说明判别器本身的训练成本。如果开源代码里包含轻量化的判别器实现,建议直接接入现有的 GRPO 训练流程做对比测试,而不是从头替换整个框架。