AMAZINGINDEX.COM 日报快照
51.6
VOL. 2026.07
2026.07.03
← 返回 2026.07.03 日报
日报快照 · Daily Snapshot
NO. 023

多模态评测终于对齐人类感知

#HF_PAPERS HuggingFace Papers 2026.07.03
推荐指数 77.0 NO. 023 · 2026.07.03
upvotes32comments2

PerceptionRubrics 提出基于细粒度原子审计的评测框架,用 1038 张高密度图像和 12000+ 条实例级评分规则,替代传统整体语义匹配。对苦于 benchmark 分数虚高、模型上线后频繁翻车的团队,这是可直接落地的评测工具。

多模态评测终于对齐人类感知

当前多模态评测的普遍做法是打整体分,比如 COCO Captions 的 BLEU/SPICE,但模型在这些指标上饱和后,实际使用中仍会在细粒度属性(颜色、数量、空间关系)上出错。PerceptionRubrics 的 Must-Right/E 双轨设计,本质是把评测从「作文打分」变成「填空题判卷」,每个原子事实独立可追踪。

与 MM-Vet、MME 等现有 benchmark 相比,它的优势不是覆盖更多任务,而是建立了「人类感知 ←→ 模型输出」的可解释映射,方便定位 failure mode。Circular Peer-Review 的共识机制也值得关注,这比单纯用 GPT-4 做 judge 更抗偏置。

代码和 12K rubrics 已随论文发布,做多模态产品落地的团队可以直接接入作为回归测试集,尤其适合视觉问答、图像描述生成等需要高可靠性的场景。

查看原文 →