首个ASI基准测试:AI能自主科研了吗
推荐指数 68.0 NO. 023 · 2026.08.20
upvotes51comments4
为什么值得看
ASI-Bench 是第一个同时评估 AI 创新探索与自主科研执行能力的基准测试,特点是逐步撤除人类方法指导。它试图回答一个关键问题:当前 AI 是只会复现已知知识,还是真能独立发现新知。
媒体预览
编辑判断
这个基准的设计意图很尖锐:现有测试如 MMLU、GSM8K 本质都是'开卷考试',测的是知识压缩效率而非知识创造能力。ASI-Bench 的渐进式撤人机制(progressive withdrawal)借鉴了强化学习的 curriculum design,但难点在于如何自动验证'未知领域'的结果正确性——论文摘要没提验证机制,这是落地最大的工程黑洞。
热度偏低(51 upvotes)反而说明问题:学术圈对'ASI'这个词有审美疲劳,太多论文喊口号。但如果代码开源且包含可复现的自动化验证管线,这个工作值得跟踪——它可能成为区分'真科研Agent'和'高级RAG'的分水岭。
相关内容
让AI无提示裸考,十余所机构联合发布全新基准:自主科研能力还有多远? 清华大学陈勇超团队联合MIT、哈佛等机构发布ASI-Bench,衡量AI无人类方法论指导下的科学自主性,测试其在真实科研中的自主发现能力。 ResearchClawBench: A Benchmark for End-to-End Autonomous Scientific Research 针对OpenClaw、Claude Code等编码智能体声称的'自主科研'能力,建立端到端自主科研基准测试。 Can AI Evaluate AI Scientists? A Benchmarking Study of Autonomous Research Generation Systems 首个AI科研系统量化基准,采用多模型LLM评估框架,建立FARS全自动评估体系衡量自主研究质量。 EXP-Bench: Can AI conduct AI research experiments? 测试AI能否独立开展AI研究实验,评估智能体在机器学习实验设计与执行中的自主能力。