RLVR蒸馏真相:老师噪声大,学生靠自己
推荐指数 71.0 NO. 024 · 2026.09.02
upvotes90comments2
为什么值得看
研究揭示On-Policy Distillation的teacher supervision存在大量噪声,学生提升主要来自抑制低概率token而非teacher指导。基于此发现提出无监督的熵自适应方法,推理性能显著提升。
媒体预览
编辑判断
这篇论文戳破了一个行业幻觉:大家以为OPD是靠teacher的高质量信号提升学生,实际上teacher在学生生成的off-policy轨迹上打分很不可靠,真正起作用的是训练过程中对低概率token的抑制机制。这个发现和当年知识蒸馏领域"soft label未必比hard label好"的争议形成呼应。
作者顺势扔掉teacher,做了一个纯靠学生自身熵调节的无监督方法,效果反而更好。这对正在做RLVR pipeline的团队有直接影响——如果你还在花大量算力训一个强teacher来做蒸馏,可能需要重新评估ROI。代码是否开源摘要未提及,建议跟进原文确认复现条件。