1.5亿参数模型逼近ARC-AGI-1新前沿
推荐指数 64.0 NO. 025 · 2026.08.12
upvotes227comments1
为什么值得看
BDH-CQ用循环潜空间推理替代显式思维链,150M参数在ARC-AGI-1达到29.5% pass@2。对追求极致推理成本比的团队有参考价值,小参数+无 verbalized reasoning 可能开辟新范式。
媒体预览
编辑判断
ARC-AGI-1 长期被视作纯 LLM scaling 的照妖镜,GPT-4 也只有个位数表现。这篇的关键不是 29.5% 绝对值,而是证明小模型靠推理时计算动态更新记忆就能逼近甚至超越大模型的样本效率,这对"买卡堆参数"的主流叙事是个直接挑战。
之前类似思路有 DeepMind 的 Adaptive Computation Time 和更多近期的 test-time compute 工作,但 BDH-CQ 把 recurrent state 和 in-context learning 绑在一起,意味着每个新样本都能实时改写推理策略,不需要微调。如果开源代码和训练细节完整放出,做边缘部署或低延迟推理的团队可以优先复现,150M 参数意味着消费级 CPU 就能跑。
潜在风险是 ARC-AGI-1 的评测集较小,29.5% pass@2 的方差需要更多独立验证,且潜空间推理的不可解释性在需要审计的场景会是落地障碍。
相关内容
The ARC of Progress towards AGI: A Living Survey of Abstraction and Reasoning ARC-AGI作为诊断工具揭示当前AI与人类智能的差异:ARC-AGI-1测试基础抽象提取,ARC-AGI-2测试更深层的组合推理。 Tiny Recursive Models on ARC-AGI-1: Inductive Biases, Identity Conditioning, and Test-Time Compute 研究小型递归模型在ARC-AGI-1上的表现,探讨归纳偏置、身份条件化和测试时计算,与1.5亿参数模型的高效方法直接相关。 On the "ARC-AGI" $1 Million Reasoning Challenge 分析ARC-AGI百万美元挑战赛,讨论生成大量Python程序并修订最有希望方案的策略,涉及搜索与抽象类比思维。