AI 推理能力新基准:λ演算
推荐指数 69.0 NO. 011 · 2026.04.26
发布2026/04/25Score94Comments31
为什么值得看
LamBench 用 λ 演算题目测试 AI 的符号推理与问题分解能力,避开被污染的训练数据。对评估模型真实智能水平比传统编程题更干净。
编辑判断
现有代码评测如 HumanEval、LiveCodeBench 已被大量泄露到训练集中,分数通胀严重。LamBench 的巧妙之处在于 λ 演算的极度简洁性——题目可以极短却需要深层递归推理,且社区数据极少,天然抗污染。
相比 SWE-bench 测工程能力、AIME 测数学,LamBench 填补的是"纯符号操作+组合爆炸"这一维度。目前 GPT-4o 和 Claude 3.5 在此表现并不突出,说明这确实是未被充分优化的盲区。
如果你在训练推理模型或做 post-training 数据筛选,这个 benchmark 的错题分布比分数本身更有价值——它能精准定位模型在哪层抽象会崩溃。