AMAZINGINDEX.COM 日报快照
50.0
VOL. 2026.07
2026.07.15
← 返回 2026.07.15 日报
日报快照 · Daily Snapshot
NO. 022

RL训练大模型太贵?用小模型代跑

#HF_PAPERS HuggingFace Papers 2026.07.15
推荐指数 81.0 NO. 022 · 2026.07.15
upvotes91comments2

Direct On-Policy Distillation 让小模型先跑RL,再把策略偏移作为隐式奖励信号迁移给大模型,避免重复昂贵的RL训练。对需要频繁迭代后训练的团队,这能直接砍掉大模型RL阶段的算力成本。

RL训练大模型太贵?用小模型代跑

这篇论文的聪明之处在于没走传统的监督蒸馏路线,而是把RL过程中产生的策略偏移本身当成信号来传递——这比复刻弱模型的输出分布更能保留探索价值。之前DeepSeek-R1的蒸馏版本被诟病推理深度不够,部分原因就是只蒸馏了结果没蒸馏过程。

实验显示在GSM8K和MATH上,7B模型代跑后蒸馏到32B的效果接近直接RL,但rollout成本降到1/5以下。如果后续能验证到70B+规模,这几乎会成为后训练的标准流程。

代码和训练脚本是否开源是落地关键,目前论文提到会release但还没放链接,建议先mark住等artifact。

查看原文 →