简单扩展策略拿下奥赛金牌级推理
推荐指数 77.0 NO. 021 · 2026.05.16
upvotes122comments1
为什么值得看
通过反向困惑度课程学习和两阶段强化学习,将后训练推理模型系统性地提升到数学物理奥赛金牌水平。对做复杂推理任务的团队有直接参考价值,测试时扩展策略可能降低对超大模型的依赖。
媒体预览
编辑判断
这篇论文的关键在于"统一"——之前奥赛级推理要么靠超大模型暴力堆,要么靠针对特定竞赛的复杂手工设计,而这个方法用同一套流程同时搞定数学和物理两大赛道。反向困惑度课程是个值得关注的技巧,它让模型先从"容易验证但难生成"的问题学起,比直接上难度更稳定。
两阶段 RL 的设计也很务实:第一阶段用 outcome reward 快速收敛,第二阶段用 process reward 精细打磨,避免了单一 reward 的信号稀疏问题。如果代码和训练数据后续开源,这套流程很可能成为推理模型 post-training 的新基线,做科学计算或教育 AI 的团队可以优先跟进。