Flow Matching对齐的跷跷板难题有解了
推荐指数 74.0 NO. 024 · 2026.05.12
upvotes73comments1
为什么值得看
Flow-OPD提出两阶段对齐策略,用在线策略蒸馏+流形锚点正则化解决多任务奖励稀疏和梯度干扰问题。对正在微调文生图模型的团队,这是比直接RLHF更稳定的替代方案。
媒体预览
编辑判断
当前文生图模型的对齐主流做法是用DPO或RLHF直接优化,但多个奖励函数一起训时经常出现'提升美学就牺牲指令遵循'的跷跷板现象。这篇的核心 trick 是把蒸馏拆成两阶段:先用 on-policy 采样生成高质量锚点,再用流形正则化把模型拉回到这些锚点周围,本质是约束优化空间来减少梯度冲突。
实验显示在HPSv2和ImageReward上同时提升,说明不是牺牲一个换另一个。不过论文没给训练成本数据,73个upvotes热度一般,建议等开源代码出来再评估复现难度。如果你团队正在用SD3或Flux做垂直场景微调,可以重点关注这个方法能不能替代现有的多奖励加权方案。