PRISM:SFT到RL之间加道对齐关卡
推荐指数 59.0 NO. 025 · 2026.05.07
upvotes35comments2
为什么值得看
PRISM 在 SFT 和 RLVR 之间插入分布对齐阶段,用策略与 MoE 判别器的对抗博弈解决多模态模型的分布漂移。对做 LMM 后训练的团队来说,这可能是减少 SFT 副作用的标准化新步骤。
媒体预览
编辑判断
当前工业界做 LMM 后训练基本是 SFT 完直接上 RLHF/RLVR,SFT 带来的分布偏移靠 RL 阶段硬扛,效果不稳定。PRISM 的关键洞察是把对齐拆成显式阶段,用黑盒对抗蒸馏替代传统 KL 约束,让策略和判别器互相博弈产生纠错信号。
从实验设计看,MoE 判别器的引入是为了解耦不同错误类型的梯度信号,这比 PPO 里单一的 value function 更精细。不过论文没透露训练开销,对抗博弈的收敛稳定性在更大 scale 上是否成立还需要验证。
如果你团队正在用 Qwen2.5-VL 或 InternVL 做后训练,建议等代码开源后对比下 PRISM 和直接 DPO 的 cost-benefit,特别是长序列多模态任务上的分布保持效果。