PaperBench: Evaluating AI's Ability to Replicate AI Research

TL;DR

PaperBench评估AI自主复制ICML 2024论文的能力,最高模型得分21%。

cs.AI 🔴 高级 2025-04-02 58 次浏览
Giulio Starace Oliver Jaffe Dane Sherburn James Aung Jun Shern Chan Leon Maksin Rachel Dias Evan Mays Benjamin Kinsella Wyatt Thompson Johannes Heidecke Amelia Glaese Tejal Patwardhan
AI评估 研究复制 大规模基准 大语言模型 自动评分

核心发现

方法论

PaperBench采用层级细化的评分机制,将每篇论文的复制任务拆解为8,316个子任务,涵盖理解、代码开发和实验执行。由论文作者共同制定评分标准,确保评估的准确性。利用LLM(如o3-mini-high)作为自动评分工具,评估模型在完整复制任务中的表现。模型需从零构建代码库,理解论文贡献,执行实验并监控结果。评估指标为平均复制得分,最高模型Claude 3.5 Sonnet(开源辅助)达21%。同时,邀请顶级ML博士进行人类基准测试,发现模型尚未超越人类水平。

关键结果

  • 在20篇ICML 2024论文中,最优模型Claude 3.5 Sonnet的平均得分为21.0%,远低于人类ML博士的41.4%。其他模型如GPT-4、o1-mini表现更差,得分均在10%以下。模型在长远任务中的策略规划和工具使用能力不足,导致早期中断或失败。自动评分系统的F1值达0.83,验证其评估可靠性。整体显示AI在复杂科研复制任务中仍存在显著差距。
  • 模型在理解论文贡献、开发完整代码和成功执行实验方面表现出一定能力,但缺乏长时间规划和多步骤行动能力。评估结果表明,当前模型在多层次、多任务的科研复制中仍未达到人类水平,尤其在调试、故障排查和创新方面存在不足。
  • 通过引入层级评分和自动化评判,PaperBench有效量化了AI在科研复制中的潜力与局限,为未来AI自主科研能力的提升提供了量化基准。模型表现的差异反映出当前技术在复杂任务中的瓶颈,强调了多模态工具整合和长远规划的重要性。

研究意义

该研究为AI自主科研能力提供了系统性评估框架,突破了传统单一指标的限制,强调模型在理解、编码和实验执行的全流程能力。推动了AI在科学研究自动化、加速创新方面的应用潜力,同时也揭示了模型在复杂任务中尚未成熟的瓶颈。此工作有助于引导未来AI研发朝着更具自主性和可靠性的方向发展,为科研自动化和AI安全提供重要参考。

技术贡献

论文提出了层级化评分体系和自动化评判机制,结合专家合作制定的高质量评分标准,实现了大规模科研复制任务的自动化评估。引入LLM作为判定工具,显著降低了评估成本,提高了效率。模型架构方面,采用开源的Claude 3.5 Sonnet,结合自定义脚手架,展现出在复杂科研任务中的潜力。该框架为未来AI科研工具的设计提供了技术基础,推动了AI在科研自动化中的应用创新。

新颖性

首次系统性构建了面向科研论文复制的多层次自动评估基准,结合专家合作制定的详细评分标准和LLM自动判定技术。区别于以往仅评估模型生成文本或基础任务的研究,PaperBench聚焦于完整科研流程的自主复制,强调从理解到执行的全链路能力。这一创新为AI科研自动化提供了新的评估维度和技术路径。

局限性

  • 模型在长时间、多步骤任务中的策略规划和工具使用能力不足,导致早期中断或失败,反映出当前模型在复杂任务中的局限。
  • 评估主要依赖于自动判定和有限的硬件环境,可能未能完全覆盖真实科研场景中的多样性和复杂性,存在一定偏差。
  • 模型在理解论文深层次贡献和创新点方面仍有限,缺乏真正的科研创新能力,未来需结合多模态信息和更复杂的推理机制。

未来方向

未来将聚焦于增强模型的长远规划和多步骤行动能力,结合多模态信息(如图表、代码片段)提升理解深度。探索更复杂的评估指标和多模型协作机制,推动模型自主科研的全面突破。同时,扩大数据集规模,涵盖更多学科和研究类型,以提升模型泛化能力。

AI 总览摘要

随着人工智能技术的快速发展,研究者开始探索AI在科学研究中的自主能力。PaperBench作为首个系统性评估AI复制前沿科研论文的基准,旨在衡量模型从理解论文内容到自主开发代码、执行复杂实验的全过程能力。该基准选取了20篇ICML 2024的代表性论文,结合专家合作制定的详细评分标准,将每个复制任务拆解为8,316个细粒度子任务,涵盖理解、编码、调试和结果验证环节。

利用LLM(如o3-mini-high)作为自动评分工具,PaperBench实现了大规模、客观、公正的评估流程。实验结果显示,当前最优模型Claude 3.5 Sonnet(开源辅助)在全部任务中的平均得分为21%,远低于人类ML博士的41.4%。模型在理解论文贡献、开发完整代码和成功执行实验方面表现出一定潜力,但在长远规划和多步骤行动方面仍存在明显不足。这反映出AI在科研自动化方面尚处于探索阶段,距离真正的自主科研仍有较大差距。

此项工作不仅为未来AI科研工具的设计提供了评估框架,也揭示了模型在复杂科研任务中的瓶颈。通过层级化评分和自动化判定机制,PaperBench为推动AI在科研自动化、加速创新提供了重要技术基础。未来,结合多模态信息、增强策略规划能力,将是提升AI科研自主性的关键方向。该研究为AI在科学探索中的应用奠定了基础,也为科研自动化的安全性和可靠性提出了新要求。

深度分析

研究背景

近年来,人工智能在自然语言处理、图像识别等领域取得突破,推动了科研自动化的发展。早期工作如AutoML、AutoDL等强调自动化模型设计,但在科研论文的完整复制方面仍面临巨大挑战。传统评估多集中于生成文本或特定任务的性能,缺乏对科研全过程的系统衡量。ICML、NeurIPS等会议不断推出创新算法,推动深度学习、强化学习、概率模型等方向,但模型在理解论文贡献、开发代码和执行复杂实验方面仍显不足。现有研究多依赖人类专家评审,难以实现大规模自动化评估。

核心问题

核心问题在于如何让AI模型具备从理解科研论文到自主开发、调试和执行实验的能力。科研任务具有高度复杂性,包括理解论文贡献、设计实验方案、编写调试代码、运行实验、分析结果等多个环节。现有模型缺乏长远规划和多步骤行动能力,导致在复杂科研复制任务中表现不佳。此外,缺乏统一的评估标准和自动判定机制,使得模型性能难以量化和比较。解决这一问题对于推动科研自动化、加速创新具有重要意义。

核心创新

本研究的主要创新在于:1)构建了层级化的科研复制评分体系,将任务拆解为8,316个子任务,细粒度评估模型能力;2)与论文作者合作制定高质量评分标准,确保评估的科学性和真实性;3)引入LLM作为自动评分工具,显著降低评估成本,提高效率;4)提出自动化判定机制,实现大规模、客观的科研复制评估。这些创新结合专家知识和先进的AI技术,为科研自动化提供了全新的评估框架。

方法详解

  • �� 任务定义:模型需从论文内容和补充说明中自主构建完整代码库,执行所有实验。
  • �� 评分体系:采用层级树结构,将任务拆解为理解、代码开发、实验执行等子任务,设定明确的成功标准。
  • �� 评估流程:模型提交代码后,在干净环境中运行reproduce.sh脚本,验证实验结果。
  • �� 自动评分:利用LLM(如o3-mini-high)对每个子任务进行自动判定,结合专家合作制定的评分标准。
  • �� 训练与调优:通过专家标注的样本训练自动判定模型,优化其准确性。
  • �� 反馈机制:模型根据评分结果调整策略,逐步提升复制能力。

实验设计

采用20篇ICML 2024论文作为测试集,模型在配备有限时间(12小时)内完成复制任务。评估指标为平均复制得分,最高模型Claude 3.5 Sonnet达21%。对比人类ML博士的表现(41.4%),模型表现仍有差距。实验还包括不同模型(GPT-4、o1-mini等)在相同任务中的表现分析。通过自动评分系统验证模型在理解、编码和执行方面的能力,结合专家评审确保评估的科学性。实验还探索了模型在调试、工具使用和长远规划中的不足。

结果分析

模型在理解论文贡献、开发代码和执行实验方面表现出一定能力,但整体得分远低于人类。Claude 3.5 Sonnet的平均得分为21%,而人类最高达41.4%。模型在长时间规划和多步骤行动方面表现欠佳,频繁中断或失败。自动评分系统的F1值为0.83,验证了其评估的可靠性。结果显示,当前模型在科研复制任务中仍有巨大提升空间,特别是在复杂调试和创新方面。

应用场景

该框架可用于自动评估科研AI模型的能力,为科研自动化工具的开发提供标准。未来可扩展到不同学科、研究类型,辅助科研人员快速验证新算法。行业中,自动化科研复制有助于加速新技术的验证和应用,减少人力成本。教育领域也可借助此技术培养学生的科研能力,推动科学普及。

局限与展望

模型在长远规划和多步骤行动中表现不足,缺乏策略性思考能力。评估依赖于自动判定,可能无法完全覆盖科研复杂性。硬件环境有限,未能模拟真实科研场景中的多样性。未来需结合多模态信息和更复杂的推理机制,提升模型的自主科研能力。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师要做一道复杂的菜肴。首先,他需要理解菜谱上的每个步骤和用料,然后自己准备所有食材,写好菜谱,最后一步步按照指示做出菜。这个过程很复杂,需要厨师既懂得食材、调料,也要会操作厨具,还要在过程中不断调整。现在,想象一台机器人厨师,它能自己看菜谱,准备食材,调配调料,还能自己试味,甚至改良菜谱。虽然还不完美,但它已经能完成很多步骤,甚至比人类厨师还快。这就是PaperBench试图让AI像厨师一样,自己理解科研论文,写代码,跑实验,最终复制出科研成果的过程。

简单解释 像给14岁少年讲一样

想象你在学校里做一个科学项目,你得先读懂老师给的说明书,理解这个实验的目的和步骤,然后自己写程序或者搭建设备,最后运行实验,看结果是不是和老师说的一样。这个过程很复杂,要理解很多内容,还要自己动手调试。有时候,遇到问题你得自己想办法解决。现在,假如有个超级智能机器人,它可以自己读懂说明书,写出所有需要的程序,调试设备,还能自己决定下一步怎么做,直到完成整个实验。虽然它还不完美,但已经可以帮你做很多繁琐的工作。PaperBench就是在测试这样的AI:它能不能自己理解科研论文,写代码,跑实验,最后复制出论文里的结果。这个研究让我们看到,未来的AI可能会像科学家一样自主工作,帮我们加快科研速度,但现在还差得远呢。

原文摘要

We introduce PaperBench, a benchmark evaluating the ability of AI agents to replicate state-of-the-art AI research. Agents must replicate 20 ICML 2024 Spotlight and Oral papers from scratch, including understanding paper contributions, developing a codebase, and successfully executing experiments. For objective evaluation, we develop rubrics that hierarchically decompose each replication task into smaller sub-tasks with clear grading criteria. In total, PaperBench contains 8,316 individually gradable tasks. Rubrics are co-developed with the author(s) of each ICML paper for accuracy and realism. To enable scalable evaluation, we also develop an LLM-based judge to automatically grade replication attempts against rubrics, and assess our judge's performance by creating a separate benchmark for judges. We evaluate several frontier models on PaperBench, finding that the best-performing tested agent, Claude 3.5 Sonnet (New) with open-source scaffolding, achieves an average replication score of 21.0%. Finally, we recruit top ML PhDs to attempt a subset of PaperBench, finding that models do not yet outperform the human baseline. We open-source our code (https://github.com/openai/preparedness) to facilitate future research in understanding the AI engineering capabilities of AI agents.

cs.AI cs.CL