AMAZINGINDEX.COM 日报快照
55.1
VOL. 2026.08
2026.08.11
← 返回 2026.08.11 日报
日报快照 · Daily Snapshot
NO. 022

RL让多任务不打架,SFT却互相拖后腿

#HF_PAPERS HuggingFace Papers 2026.08.11
推荐指数 75.0 NO. 022 · 2026.08.11
upvotes30comments1

研究发现SFT在多任务训练中梯度冲突严重,而RL的更新稀疏且近似正交,能稳定共存。这意味着多任务LLM训练策略可能需要从SFT转向RL为主。

RL让多任务不打架,SFT却互相拖后腿

这个发现解释了为什么很多团队做多任务SFT时模型会'练废'——不是数据问题,是梯度在参数空间互相抵消的结构性缺陷。RL的稀疏更新本质上是一种隐式的任务路由,跟MoE的思路有异曲同工之处。

实际落地角度,如果你在做领域适配或多技能模型,可以考虑减少SFT阶段的多任务混合,改用分阶段SFT单任务+RL统一对齐的pipeline。论文有理论证明但实验规模不大,大厂应该已经在验证这个结论的扩展性了。

查看原文 →