AMAZINGINDEX.COM 日报快照
58.4
VOL. 2026.05
2026.05.12
← 返回 2026.05.12 日报
日报快照 · Daily Snapshot
NO. 025

数学家出题,主流LLM集体翻车

#HF_PAPERS HuggingFace Papers 2026.05.12
推荐指数 65.0 NO. 025 · 2026.05.12
upvotes17comments1

数学家团队发布439道研究级数学题基准测试Soohak,发现前沿大模型在识别题目本身是否成立(ill-posed)上存在明显盲区。IMO金牌之后,这是检验LLM从"解题"到"辨题"能力跃迁的关键标尺。

数学家出题,主流LLM集体翻车

这个基准最狠的设计是埋了'假题'——题目本身条件矛盾或证明方向错误,模型要识别出来而不是硬解。GPT-4o和Gemini在这类题上的失败率超过60%,说明当前RLHF训练过度优化了'给出答案'而不是'质疑前提'。

做Agent或科研辅助工具的团队可以直接拿Soohak测自家系统的'批判性思维',这比刷GSM8K更有区分度。代码和题目已开源,HuggingFace上可下载。

查看原文 →