RL训练大模型太贵?用小模型代跑
推荐指数 81.0 NO. 022 · 2026.07.15
upvotes91comments2
为什么值得看
Direct On-Policy Distillation 让小模型先跑RL,再把策略偏移作为隐式奖励信号迁移给大模型,避免重复昂贵的RL训练。对需要频繁迭代后训练的团队,这能直接砍掉大模型RL阶段的算力成本。
媒体预览
编辑判断
这篇论文的聪明之处在于没走传统的监督蒸馏路线,而是把RL过程中产生的策略偏移本身当成信号来传递——这比复刻弱模型的输出分布更能保留探索价值。之前DeepSeek-R1的蒸馏版本被诟病推理深度不够,部分原因就是只蒸馏了结果没蒸馏过程。
实验显示在GSM8K和MATH上,7B模型代跑后蒸馏到32B的效果接近直接RL,但rollout成本降到1/5以下。如果后续能验证到70B+规模,这几乎会成为后训练的标准流程。
代码和训练脚本是否开源是落地关键,目前论文提到会release但还没放链接,建议先mark住等artifact。
相关内容
从0.5B 到72B:揭秘RL Post-Training 中的计算、数据与模型 LightReasoner:利用小模型引导大模型推理的对比学习框架,WeiBo AI推出1.5B小模型实现SOTA级推理,Meta FAIR推出HERO集成稀疏与LLM强化。 最高提升20倍吞吐量,豆包大模型团队发布全新RLHF框架 字节跳动HybridFlow框架采用混合编程模型,融合单控制器灵活性与多控制器高效性,显著提升RL训练吞吐量,降低开发维护复杂度。 大模型训练为什么这么贵?从FLOPs、batch size到RL后训练 大模型训练贵不仅是GPU贵,而是整条训练链路:总FLOPs、batch size、并行策略、通信、显存、后训练、检查点等未优化导致。 Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning 进化策略(ES)可扩展至现代模型规模,挑战RL主导的后训练范式,为LLM微调提供替代方案。