多模态评测终于对齐人类感知
推荐指数 77.0 NO. 023 · 2026.07.03
upvotes32comments2
为什么值得看
PerceptionRubrics 提出基于细粒度原子审计的评测框架,用 1038 张高密度图像和 12000+ 条实例级评分规则,替代传统整体语义匹配。对苦于 benchmark 分数虚高、模型上线后频繁翻车的团队,这是可直接落地的评测工具。
媒体预览
编辑判断
当前多模态评测的普遍做法是打整体分,比如 COCO Captions 的 BLEU/SPICE,但模型在这些指标上饱和后,实际使用中仍会在细粒度属性(颜色、数量、空间关系)上出错。PerceptionRubrics 的 Must-Right/E 双轨设计,本质是把评测从「作文打分」变成「填空题判卷」,每个原子事实独立可追踪。
与 MM-Vet、MME 等现有 benchmark 相比,它的优势不是覆盖更多任务,而是建立了「人类感知 ←→ 模型输出」的可解释映射,方便定位 failure mode。Circular Peer-Review 的共识机制也值得关注,这比单纯用 GPT-4 做 judge 更抗偏置。
代码和 12K rubrics 已随论文发布,做多模态产品落地的团队可以直接接入作为回归测试集,尤其适合视觉问答、图像描述生成等需要高可靠性的场景。
相关内容
Aligning Multimodal LLM with Human Preference: A Survey 系统性综述多模态大语言模型与人类偏好对齐的算法,涵盖四个关键方面的对齐方法研究。 多模态大模型前瞻报告:人类价值观视角,230个案例揭示14项发现 上海AI实验室从人类价值观角度分析多模态大模型,通过大量案例揭示评测与对齐的关键发现。 从多模态预训练到多模态大模型:架构、训练、评测、趋势概览 全面梳理多模态大模型的架构设计、训练方法、评测体系及发展趋势,包含评测对齐相关研究。 多模态大模型推动AI迈向"通感"时代 上海AI实验室书生多模态大模型在80多项评测中领先,体现多模态感知能力与人类级对齐进展。