AI编程智能体能否做出真发现?
推荐指数 56.0 NO. 026 · 2026.06.25
upvotes47comments1
为什么值得看
NatureBench 从90篇Nature论文提取任务,测试AI编码智能体能否超越复现实现科学发现。结果显示当前智能体主要靠方法迁移,缺乏真正的科学创新能力。
媒体预览
编辑判断
这个基准的杀伤力在于它把'复现'和'发现'拆开了——之前大家测的是智能体能不能跑通论文代码,NatureBench测的是面对同样问题能否独立想出解法。90个任务跨学科且带容器化环境,意味着可以自动化大规模评估,这对筛选真正有研究潜力的智能体很关键。
NatureGym的自动化流水线值得关注:从PDF提取方法、构建环境、到标准化评测,这套 infra 本身可能比 benchmark 更有工程价值。做科研智能体或自动化实验平台的团队,可以直接借鉴其环境构建思路。目前47个upvote但评论极少,说明社区还在消化,先发评论的人能定调子。
相关内容