AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.07
2026.07.16
← 返回 2026.07.16 日报
日报快照 · Daily Snapshot
NO. 019

MLLM零成本变图像生成奖励模型

#HF_PAPERS HuggingFace Papers 2026.07.16
推荐指数 73.0 NO. 019 · 2026.07.16
upvotes40comments2

SpectraReward 让预训练多模态大模型无需微调就能当奖励模型用,通过"图像还原 prompt 的难易程度"打分。省去偏好数据和 RLHF 训练成本,对文生图模型的低成本优化有直接价值。

MLLM零成本变图像生成奖励模型

之前文生图的奖励模型要么靠人工标注偏好数据训专门的 RM,要么用 CLIP 做粗粒度对齐,成本高或信号弱。这个方法巧妙在于把 MLLM 已有的 image-to-text 能力逆向利用——让模型"读图写 prompt",写得越准说明图和 prompt 越对齐,完全绕过了偏好学习。

不过 teacher-forced 的 log-likelihood 和真实人类审美是否一致还没验证,且论文里没开源代码。如果你在用 Stable Diffusion 或自研模型做业务优化,可以先拿 Qwen-VL 或 InternVL 快速验证这个思路,比训一个 Reward Model 便宜得多。

查看原文 →