VLM评委靠不靠谱?终于有了标尺
推荐指数 72.0 NO. 025 · 2026.08.08
upvotes48comments1
为什么值得看
OSReward 是首个专门评测视觉语言模型作为计算机使用代理(CUA)轨迹评判者可靠性的基准测试。对做 Agent 评估和 RLHF 数据筛选的工程师来说,终于不用盲信 GPT-4V 的打分了。
媒体预览
编辑判断
目前业内做 CUA 评估普遍直接用 GPT-4V 或 Claude 当裁判,但没人系统验证过这些 VLM 的打分和人类一致性到底有多高,OSReward 填补了这个空白。它覆盖了跨平台真实场景,能直接暴露 VLM 在判断任务完成度时的偏见和盲区。
如果你在用 VLM 做 Agent 轨迹的自动标注或 RL 奖励信号,建议先用这个 benchmark 测一下你选的模型,避免用了一个本身就有系统性偏差的裁判来训练你的 Agent。