AMAZINGINDEX.COM 日报快照
47.6
VOL. 2026.06
2026.06.30
← 返回 2026.06.30 日报
日报快照 · Daily Snapshot
NO. 023

阿里用RLHF让文生图模型学会听话

#HF_PAPERS HuggingFace Papers 2026.06.30
推荐指数 82.0 NO. 023 · 2026.06.30
upvotes26comments3

Qwen-Image-2.0-RL 将 RLHF 和在线策略蒸馏引入扩散模型后训练,用带思维链的 VLM 评分器分别优化文生图的对齐度、美学和肖像保真度,以及图像编辑任务的指令遵循能力。这是大厂首次系统性地把 RLHF pipeline 完整搬到图像生成领域,做 AIGC 产品的团队可以直接参考其奖励模型设计。

阿里用RLHF让文生图模型学会听话

之前文生图模型的后训练主要依赖人工标注的偏好对做 DPO 或 RLHF,但图像评价的模糊性导致奖励信号噪声极大,很多团队干脆放弃这步直接用预训练权重。阿里这套方案的关键创新是用 pointwise 评分 + CoT 推理把 VLM 改造成可解释的维度化评分器,而不是端到端打个总分,这降低了奖励黑客的风险。

从工程角度看,论文提到的 OPD 在线蒸馏能把推理阶段的模型能力压缩回训练效率,对需要实时编辑的产品很关键。不过 26 个 upvote 的热度说明社区还在观望,核心问题是开源权重和训练代码是否完整释放——如果只有技术报告,复现门槛会很高。

查看原文 →