NatureBench: Can Coding Agents Match the Published SOTA of Nature-Family Papers?

TL;DR

NatureBench基于NatureGym,评估AI编码代理在90个科学任务中的发现能力,SOTA仅超17.8%。

cs.CL 🔴 高级 2026-06-23 68 次浏览
Yuru Wang Lejun Cheng Yuxin Zuo Sihang Zeng Bingxiang He Che Jiang Junlin Yang Yuchong Wang Kaikai Zhao Weifeng Huang Kai Tian Zhenzhao Yuan Jincheng Zhong Weizhi Wang Ning Ding Bowen Zhou Kaiyan Zhang
AI科研 自动化评估 跨学科 科学发现 基准测试

核心发现

方法论

本研究构建了NatureBench,基于NatureGym自动化管线,将自然科学论文转化为标准化、容器化任务环境。通过过滤、数据验证和任务封装三阶段,确保任务的可复现性和公平性。评估涵盖十余种前沿模型,采用严格禁用网页搜索的协议,重点考察模型的科学发现能力。模型成功主要依赖方法转化,将科学任务转化为监督学习问题,而非真正的科学创新。失败多因方法选择错误或计算资源不足。引入SOTA归一化指标,衡量模型在任务中的超越程度。

关键结果

  • 最强模型Claude Opus 4.7在90个任务中仅超越17.8%的任务,达成47.8%的匹配水平。模型成功率受方法转化影响最大,约占45.5%。失败原因主要为方法选择错误(45.1%)和计算预算不足(24.4%)。模型在跨学科任务中的表现显示,科学发现仍受限于方法迁移和资源配置。
  • 分析显示,模型多通过将任务转化为已熟悉的预测问题实现成功,而非自主创新。环境碎片化和环境构建的自动化显著提升了评估的可信度。实验还验证了环境封装的有效性,确保不同模型在相同条件下公平竞争。
  • 本研究强调,当前AI代理在科学任务中的表现仍偏重技术迁移,缺乏真正的科学发明能力。未来应加强模型的跨领域推理和创新能力,优化计算资源配置,推动AI在科学发现中的应用。

研究意义

本研究为AI在科学研究中的自主发现能力提供了新的评估平台,突破了传统仅重复制的局限。通过自动化环境构建和严格评估指标,揭示了模型在科学任务中的实际能力,推动AI从工具向合作伙伴转变。该基准有助于识别模型的局限,指导未来算法创新,促进跨学科科研的智能化发展。研究强调,科学发现不仅依赖技术迁移,更需模型具备创新思维和跨领域推理能力,为AI科研赋予更深层次的价值。

技术贡献

本文提出了NatureGym自动化管线,有效解决环境碎片化问题,实现论文到任务的标准化转化。构建了涵盖六大科学领域的90个任务,采用SOTA归一化指标进行评价,结合自动评估和环境封装,确保公平性和可复现性。引入严格的禁网页搜索协议,强调模型的自主发现能力。实验结果显示,模型主要通过方法迁移实现成功,未能展现出真正的科学创新,为未来模型设计提供了新方向。

新颖性

本研究首次系统性构建跨学科、科学驱动的自动化评估平台,结合论文筛选、环境封装和自动评估,突破了以往仅关注复制或工程优化的局限。引入Discovery导向的评价体系,强调模型的创新能力,而非仅仅重现已知结果。该方法在科学AI领域具有开创性,为未来自主科研代理提供了新的评估标准。

局限性

  • 模型成功主要依赖方法转化,缺乏自主创新能力,未能实现真正的科学发明。
  • 计算资源不足仍是限制因素,导致部分任务未能充分探索潜在解决方案。
  • 环境封装虽提升了公平性,但对复杂科学任务的适应性仍有限,未来需增强模型的跨领域推理能力。

未来方向

未来应加强模型的跨学科推理和创新能力,推动自主科学发现。优化环境封装技术,提升模型在复杂任务中的适应性。探索结合大规模预训练和强化学习的多模态模型,以实现更深层次的科学创新。同时,扩展基准任务规模,涵盖更多科学领域,推动AI科研的全面发展。

AI 总览摘要

在科学研究逐渐迈向自动化的背景下,评估AI编码代理的科学发现能力成为关键。传统基准多偏重于复制已发表方法,难以衡量模型的创新潜力。为此,本文提出了NatureBench,一个基于Nature论文的跨学科科学任务基准,结合NatureGym自动化管线,将论文转化为标准化、容器化的任务环境。通过严格筛选和验证,确保任务的真实性和公平性,涵盖细胞组学、蛋白质生物学、医学建模、物理模拟、分子设计和关系推理六大领域。评估采用SOTA归一化指标,结合自动评分和环境封装,避免环境碎片化带来的偏差。实验结果显示,最强模型在90个任务中仅超越17.8%,主要通过方法迁移而非创新实现成功。分析揭示,当前模型在科学任务中的表现仍偏重技术迁移,缺乏自主创新能力。研究强调,未来应加强模型的跨领域推理和创新能力,推动AI在科学发现中的深度应用。该基准为科研AI提供了新的评估标准,有助于引导算法向真正的科学创新迈进。

深度分析

研究背景

近年来,AI在科学研究中的应用不断深化,从论文重现到自动化实验设计。代表性工作如AutoML、AlphaFold、ProteinMPNN等推动了模型在特定任务中的突破。然而,现有评估多集中在重现或工程优化,缺乏对模型自主发现新科学知识的考察。随着AI逐步迈向自主科研,建立科学驱动的评估平台成为迫切需求。此前的基准多偏重于单一任务或环境碎片化,难以全面衡量模型的创新能力。

核心问题

核心问题在于如何设计一个跨学科、科学导向的评估平台,既能保证任务的真实性,又能有效衡量模型的发现能力。传统方法多依赖人工重现,缺乏自动化和公平性。环境碎片化导致模型在不同任务间难以公平比较。此外,模型在科学任务中的成功多依赖迁移技巧,缺乏自主创新的验证机制。这些问题限制了AI在科学探索中的潜力。

核心创新

本研究的创新点包括:1)开发NatureGym自动化管线,实现论文到任务的标准化转化,解决环境碎片化问题;2)构建涵盖六大科学领域的90个任务,强调科学发现而非复制;3)引入Discovery导向的评价指标,衡量模型超越已知SOTA的能力;4)采用严格的环境封装和自动评分,确保评估的公平性和可复现性。这些创新推动了科学AI评估体系的升级。

方法详解

  • �� 论文筛选:利用多级过滤确保任务的科学性和自动评估可行性。
  • �� 数据验证:下载并验证数据完整性,确保与论文一致。
  • �� 任务封装:构建容器化任务包,隔离原始方法,促使模型自主发现。
  • �� 评估协议:采用SOTA归一化指标,结合自动评分和环境封装,确保公平。
  • �� 模型评估:测试十余模型,分析成功路径和失败原因,重点关注方法迁移与创新差异。

实验设计

实验在多种科学任务上进行,包括细胞组学、蛋白质结构、医学建模等。使用公开数据集,设定不同计算预算,比较模型在超越SOTA、匹配和失败的表现。采用多轮验证确保结果的稳定性,同时进行消融分析,验证环境封装和指标的有效性。实验还评估模型在跨领域任务中的泛化能力,旨在揭示当前模型的潜力与局限。

结果分析

最强模型Claude Opus 4.7在90个任务中仅超越17.8%,在47.8%任务中达到SOTA水平。成功主要依赖方法转化,约占45.5%,而非自主创新。失败多因方法选择错误(45.1%)和计算资源不足(24.4%)。分析显示,模型偏重技术迁移,缺乏深层次的科学创新能力。环境封装和自动评估提升了评测的可信度,为未来改进提供方向。

应用场景

该基准可用于评估未来科研AI模型的创新潜力,推动自动化科学探索。行业中,可辅助药物设计、材料发现、基因分析等领域的创新研究。学术界可借助此平台优化模型架构,提升自主发现能力,促进跨学科合作。未来,结合大模型和强化学习,有望实现更深层次的科学创新。

局限与展望

当前模型主要通过迁移实现成功,缺乏真正的自主创新。环境封装虽提升公平性,但对复杂任务的适应性仍有限。计算成本较高,限制了大规模应用。未来需增强模型的跨领域推理和创新能力,改善环境设计,降低成本,推动AI在科学中的深度应用。

通俗解读 非专业人士也能看懂

想象一个工厂里生产各种商品,工人们按照说明书操作,但说明书都是别人写的。现在,你希望工厂自己能想出新商品,而不是只照着说明书做。科学研究也是一样,科学家写论文,告诉别人怎么做,但真正的创新是自己想出新方法。这个研究就像让AI变成工厂的“聪明工人”,让它自己发现新方法,而不是只复制已有的。通过设计一套标准的“生产线”,让AI在没有告诉它具体怎么做的情况下,自己探索出新科学知识。结果显示,AI大部分时候只是把任务变成它熟悉的题型,真正的创新还不够。未来,我们希望让它像真正的“发明家”一样,自己想出新点子,而不是只会模仿。

原文摘要

We introduce NatureBench, a cross-discipline benchmark of 90 tasks distilled from peer-reviewed Nature-family publications, designed to evaluate whether AI coding agents can move beyond reproduction toward discovery on real scientific problems. NatureBench is built on NatureGym, an automated pipeline that constructs a standardized, per-task containerized environment from a source paper, addressing the environment-fragmentation problem that has limited the credibility of prior agent-on-research benchmarks. Evaluating ten frontier agent configurations under a strict web-search-disabled protocol, we find that the strongest model surpasses SOTA on only 17.8% of tasks under the g>0.1 criterion. Analysis of method pathways reveals that agents succeed primarily through methodological translation, converting scientific tasks into familiar supervised prediction problems, rather than through genuine scientific invention. Failures are dominated by wrong method choice and insufficient compute budget, not by task misunderstanding. We release the benchmark, the NatureGym pipeline, and a public leaderboard with maintainer-side reproduction. Code: https://github.com/FrontisAI/NatureBench

cs.CL