AI 盲测基准:人类觉得简单、模型频频翻车
推荐指数 51.0 NO. 021 · 2026.07.16
upvotes18comments1
为什么值得看
Blind-Spots-Bench 收集了 235 个学生设计的「弱智吧」级别题目,专挑多模态模型的常识漏洞。它用自动化评分流水线批量测试了主流开源和闭源模型,暴露出现有基准测不出来的系统性缺陷。
媒体预览
编辑判断
这个基准最狠的设计是「学生出题」——不是研究员设计的对抗样本,而是未经训练的直觉陷阱,恰好命中模型训练分布的盲区。当前多模态评估过度追求复杂任务(图表推理、多轮对话),反而对「数狗腿」「字符串翻转」这类基础能力失焦。
自动化评分流水线已经跑完主流模型,结果大概率会很难看,建议直接看论文附录里的失败案例,比读指标更有体感。如果你在做模型选型或产品上线前的安全测试,可以把这 235 题加进自己的评估集,成本极低但拦截率可能很高。
相关内容
人类最后一次考试,AI惨败正确率<10%!数百顶级专家联手出题 Scale AI和CAIS公布新基准「人类最后一次考试」,顶尖LLM通过率不足10%,模型过度自信暴露能力边界。 Base Models Look Human To AI Detectors 研究发现基础模型生成文本常被AI检测器判定为人类,而指令微调模型则不然,揭示评估基准的隐蔽偏差。 人类基准测试大翻车:样本不足、方法不透明,AI性能结论可信 批判人类基准测试存在样本量小、方法不透明等问题,质疑当前AI超人类水平结论的可靠性。 AI 模型的基准测试 介绍GLUE、SuperGLUE、HELM等主流基准测试体系,强调单一指标无法全面评估模型能力。