数学家出题,主流LLM集体翻车
推荐指数 65.0 NO. 025 · 2026.05.12
upvotes17comments1
为什么值得看
数学家团队发布439道研究级数学题基准测试Soohak,发现前沿大模型在识别题目本身是否成立(ill-posed)上存在明显盲区。IMO金牌之后,这是检验LLM从"解题"到"辨题"能力跃迁的关键标尺。
媒体预览
编辑判断
这个基准最狠的设计是埋了'假题'——题目本身条件矛盾或证明方向错误,模型要识别出来而不是硬解。GPT-4o和Gemini在这类题上的失败率超过60%,说明当前RLHF训练过度优化了'给出答案'而不是'质疑前提'。
做Agent或科研辅助工具的团队可以直接拿Soohak测自家系统的'批判性思维',这比刷GSM8K更有区分度。代码和题目已开源,HuggingFace上可下载。