AMAZINGINDEX.COM 日报快照
60.6
VOL. 2026.08
2026.08.08
← 返回 2026.08.08 日报
日报快照 · Daily Snapshot
NO. 025

VLM评委靠不靠谱?终于有了标尺

#HF_PAPERS HuggingFace Papers 2026.08.08
推荐指数 72.0 NO. 025 · 2026.08.08
upvotes48comments1

OSReward 是首个专门评测视觉语言模型作为计算机使用代理(CUA)轨迹评判者可靠性的基准测试。对做 Agent 评估和 RLHF 数据筛选的工程师来说,终于不用盲信 GPT-4V 的打分了。

VLM评委靠不靠谱?终于有了标尺

目前业内做 CUA 评估普遍直接用 GPT-4V 或 Claude 当裁判,但没人系统验证过这些 VLM 的打分和人类一致性到底有多高,OSReward 填补了这个空白。它覆盖了跨平台真实场景,能直接暴露 VLM 在判断任务完成度时的偏见和盲区。

如果你在用 VLM 做 Agent 轨迹的自动标注或 RL 奖励信号,建议先用这个 benchmark 测一下你选的模型,避免用了一个本身就有系统性偏差的裁判来训练你的 Agent。

查看原文 →