MLLM人格推理:只会猜分数不会讲道理
推荐指数 40.0 NO. 021 · 2026.05.23
upvotes130comments1
为什么值得看
研究者发现多模态大模型虽能预测人格分数,但推理过程与真实依据脱节。这暴露了现有人机交互场景中的安全隐患:模型可能在用偏见而非事实做判断。
媒体预览
编辑判断
现有基准只测分数准确率,相当于让面试官只看简历打分却不追问为什么——这正是招聘 AI 被投诉歧视的根源。这篇论文的拆解方法值得借鉴:把"预测对了但理由错了"的 case 单独拎出来量化,比单纯追 SOTA 分数更有工程价值。
方法上不需要额外算力,纯数据标注工作,适合直接集成到产品风控流程。如果做 AI 面试、客服质检、社交推荐,建议用这套框架审计自家模型的推理链路,监管合规层面会少踩很多坑。