AMAZINGINDEX.COM 日报快照
54.9
VOL. 2026.05
2026.05.21
← 返回 2026.05.21 日报
日报快照 · Daily Snapshot
NO. 018

RL推理新正则化方法防模型自退化

#HF_PAPERS HuggingFace Papers 2026.05.21
推荐指数 82.0 NO. 018 · 2026.05.21
upvotes60comments2

提出Anti-Self-Distillation方法,用点互信息(PMI)替代传统KL散度作为强化学习约束,解决推理模型训练中常见的自蒸馏导致的模式崩溃问题。对正在做 reasoning RL 的团队有直接参考价值,可能替代现有 PPO/GRPO 中的标准正则化项。

RL推理新正则化方法防模型自退化

当前主流推理RL如DeepSeek-R1、Kimi k1.5都用KL散度或GRPO的隐式约束来防止模型偏离太远,但KL散度对长序列推理的惩罚不够精细,容易导致模型'学懒'——即重复简单模式而非真正优化推理能力。PMI的优势在于它是token级别的条件依赖度量,能对推理链中关键推导步骤施加更精准的约束。

从工程落地看,这个方法最大的吸引力是轻量:不需要改模型架构,只需要替换损失函数中的正则化项。如果作者开源了代码,建议直接在你现有的GRPO/PPO训练脚本里做消融对比,尤其关注长链推理任务(如数学证明、代码生成)上的模式多样性指标。

查看原文 →