RL让多任务不打架,SFT却互相拖后腿
推荐指数 75.0 NO. 022 · 2026.08.11
upvotes30comments1
为什么值得看
研究发现SFT在多任务训练中梯度冲突严重,而RL的更新稀疏且近似正交,能稳定共存。这意味着多任务LLM训练策略可能需要从SFT转向RL为主。
媒体预览
编辑判断
这个发现解释了为什么很多团队做多任务SFT时模型会'练废'——不是数据问题,是梯度在参数空间互相抵消的结构性缺陷。RL的稀疏更新本质上是一种隐式的任务路由,跟MoE的思路有异曲同工之处。
实际落地角度,如果你在做领域适配或多技能模型,可以考虑减少SFT阶段的多任务混合,改用分阶段SFT单任务+RL统一对齐的pipeline。论文有理论证明但实验规模不大,大厂应该已经在验证这个结论的扩展性了。
相关内容
SFT-then-RL Outperforms Mixed-Policy Methods for LLM Reasoning 探讨SFT与RL分阶段训练优于混合策略,支持原文SFT与RL效果差异的核心观点。 SFT Memorizes, RL Generalizes: A Comparative Study SFT记忆、RL泛化的对比研究,指出SFT稳定输出格式、RL获得可泛化知识,与原文多任务冲突分析互补。 Bridging SFT and RL: Dynamic Policy Optimization 分析SFT低方差高偏差、RL的权衡困境,为理解多任务学习中SFT冲突提供理论背景。 Reinforcement Fine-Tuning Naturally Mitigates Forgetting 实证显示SFT在持续学习中遗忘严重(-10.4%),RL缓解遗忘,直接支持RL多任务共存的优势。