核心发现
方法论
本研究采用大规模AI论文语料库,结合专家筛选与LLM生成,构建784个高质量科研问题。平台支持多模态解析、上下文检索和程序化计算,评估多工具协作能力。通过引入多任务、多工具的复杂场景,测试LLM在跨论文信息整合中的表现。实验中,采用Gemini 2.5 Pro等模型,结合多轮推理和工具调用,评估准确率及推理轨迹。利用IRT模型分析模型潜在能力与难度匹配,揭示性能瓶颈。平台设计支持单/多智能体,涵盖多模态、跨论文、数据库接口等关键特征。
关键结果
- 最优模型Gemini 2.5 Pro在平均任务中的准确率为38.78%,在难度较高子集仅18.47%,远低于人类专家的83.5%。模型在多工具调用中表现出工具使用不平衡,过度依赖通用工具如网页搜索和代码执行,导致效率低下。推理轨迹分析显示,模型在复杂任务中工具调用频繁,且边际收益递减。多智能体架构相较单智能体在复杂任务中表现更优,验证了集中式管理的优势。
- 模型的推理能力与任务难度呈正相关,但在高难度任务中表现出明显的性能瓶颈。模型在多步骤推理和跨论文整合方面存在明显不足,工具调用不够精准,导致推理链条冗长且效率低。IRT分析显示,模型潜在能力与任务难度存在偏差,模型在特定类型问题上表现不稳定。实验还表明,模型在多模态理解和跨论文信息融合方面仍有较大提升空间。
研究意义
该研究填补了科学文献跨论文推理的评估空白,为未来智能科研助手提供了标准化测试平台。通过系统分析模型在复杂科研场景中的表现,揭示了当前大语言模型在多工具、多任务协作中的局限性。平台的多模态和跨论文能力,有助推动AI在科学发现、文献综述、自动化研究等领域的应用。研究结果强调了多工具协调、推理轨迹可解释性的重要性,为AI科研工具的设计提供了理论基础和实践指南,促进科研自动化的长远发展。
技术贡献
本研究提出了PaperArena基准,首次系统性评估大语言模型在跨论文、多工具科研推理中的能力。平台支持多模态解析、上下文检索和程序化计算,结合IRT模型实现潜在能力诊断。模型在复杂多步骤、多工具场景中的表现显著低于人类专家,揭示了模型推理链的效率瓶颈。研究还提出多智能体架构,验证其在复杂任务中的优越性,为未来科研智能系统设计提供了新思路。
新颖性
这是首个针对跨论文科研推理的多工具评估基准,突破了以往只关注单论文、单任务的限制。通过结合多模态理解、跨论文整合和数据库接口,全面模拟真实科研场景。采用专家筛选与LLM合成相结合的高质量问题集,确保挑战性和多样性。引入IRT模型进行潜在能力分析,为模型性能诊断提供新工具。这些创新使PaperArena成为科研AI领域的重要里程碑。
局限性
- 模型在多工具调用中的效率仍不理想,工具使用不平衡导致推理链冗长,影响整体性能。模型在复杂推理任务中的表现受限,难以实现高精度跨论文信息整合,存在一定的局限性。
- 平台设计主要依赖于现有LLM和工具集,未来需引入更丰富的工具和优化推理策略以提升效率。实验中模型多依赖通用工具,缺乏对专业化工具的深度整合。
- 当前评估主要基于静态任务,未来应考虑动态科研场景中的连续推理和交互能力,增强模型的实际应用能力。
未来方向
未来将引入更丰富的工具集,优化推理策略,提升模型效率。计划扩展多模态能力,结合图像、视频等多源信息。推动模型在真实科研环境中的应用测试,结合用户反馈持续改进。加强多智能体协作机制,探索更高效的任务分配与信息融合策略。最终目标是实现具有自主科研能力的智能系统,助力科学创新。
AI 总览摘要
在科学研究中,理解和推理大量文献一直是科研人员面临的核心挑战。随着文献数量的爆炸式增长,传统的人工筛选和分析已难以应对复杂的科研问题。现有的评估基准多局限于单篇论文的内容理解,缺乏跨论文、多工具协作的能力测试。为此,PaperArena应运而生,旨在构建一个具有挑战性的科研推理基准,评估大语言模型在多论文信息整合、多模态理解和复杂推理中的表现。
该平台采集了超过一万四千篇AI论文,结合专家筛选和LLM生成,设计了784个高难度科研问题,涵盖多步骤推理、图表理解、跨论文整合和数据库接口等多项核心能力。平台支持多模态解析、上下文检索和程序化计算,模拟真实科研场景中的复杂任务。实验中,最优模型Gemini 2.5 Pro在平均准确率仅为38.78%,在难度较高任务中更是降至18.47%,远低于人类专家的83.5%。模型在多工具调用中表现出明显的不平衡,过度依赖通用工具,导致效率低下,推理链条冗长。
分析显示,当前模型在多步骤推理和跨论文整合方面存在明显瓶颈,工具调用不够精准,影响整体性能。引入IRT模型后,发现模型潜在能力与任务难度匹配不足,表现出较大差异。多智能体架构在复杂任务中表现优越,验证了集中式管理的优势。该研究不仅揭示了现有模型的局限,也为未来科研智能助手的设计提供了重要参考。平台的开放和标准化,有望推动AI在科学发现中的广泛应用,加快科研自动化进程。
深度分析
研究背景
近年来,科学文献的快速增长推动了自动化理解与推理技术的发展。早期工作主要集中在单篇论文的内容提取与概念解释,如PubMedQA和CharXiv等,解决了基础的问答和信息抽取问题。随着大模型的崛起,研究逐步转向知识密集型任务,包括结构化图表理解、科学推理和文献综述。现有评估多偏重单一任务,缺乏跨论文、多模态和多工具协作的综合能力测试。科研场景的复杂性要求模型不仅理解文本,还能整合图像、表格、引用关系,进行多步骤推理,推动了多模态理解和跨论文整合技术的发展。
核心问题
当前大模型在科研文献理解中的表现仍有限,尤其是在跨论文信息整合、多工具协作和复杂推理方面。现有基准多局限于单一任务或单一内容理解,难以反映真实科研场景的复杂性。模型在多模态信息融合、长文本推理和多步骤计划方面存在明显瓶颈,导致在复杂科研问题上的表现远低于人类专家。缺乏系统性评估工具限制了模型改进的方向,也阻碍了科研自动化的实现。因此,亟需构建一个涵盖多模态、多任务、多工具的综合性评估平台,推动模型能力的全面提升。
核心创新
本研究的核心创新在于提出PaperArena基准,首次系统性评估大语言模型在跨论文、多工具科研推理中的能力。具体包括:
- �� 跨论文信息整合:设计多论文问题,要求模型在不同论文间进行信息匹配与推理。
- �� 多模态理解:结合图表、表格等多源信息,提升模型对科研数据的理解能力。
- �� 多工具协作:支持多种工具调用,如PDF解析、图表分析、数据库查询,模拟科研工作流程。
- �� 采用专家筛选与LLM合成的高难度问题集,确保挑战性。
- �� 引入IRT模型,诊断模型潜在能力与任务难度匹配,提供性能分析工具。这些创新突破了以往只关注单一任务或内容理解的局限,为科研AI提供了更真实、更复杂的评估环境。
方法详解
- �� 构建大规模论文语料库,筛选代表性论文,采用K-Medoids和FPS采样确保多样性。
- �� 利用MinerU将PDF转为结构化markdown,结合多模型生成候选问题。
- �� 专家筛选、重写并标注问题,确保难度和真实性。
- �� 设计多模态解析、上下文检索、程序化计算等工具集,支持复杂推理。
- �� 构建多任务、多工具推理流程,模型需制定计划、调用工具、整合信息。
- �� 采用多轮推理、工具调用和结果整合,模拟科研场景。
- �� 评估指标包括准确率、推理步骤数、工具调用效率和IRT潜在能力分析。
实验设计
在包含九个主流大模型的单/多智能体架构上进行评估,使用784个高难度科研问题。指标包括模型准确率、推理步骤数、工具调用效率和IRT能力。实验设置涵盖不同任务类型(多选、简答、开放式)和难度(易、中、难),对比人类专家表现。通过 ablation 研究分析工具使用偏差和推理链长度,验证多智能体架构的优势。模型参数和训练细节遵循公开配置,确保结果的可复现性。实验还结合专家评审验证模型答案的正确性,确保评估的严谨性。
结果分析
最优模型Gemini 2.5 Pro在平均任务中的准确率为38.78%,难度高任务仅18.47%,远低于人类83.5%。模型在多工具调用中表现出明显偏差,工具使用不平衡,效率低下。多智能体架构在复杂任务中表现优于单智能体,验证了集中管理的优势。IRT分析显示模型潜在能力与任务难度存在偏差,模型在多步骤推理和跨论文整合方面仍有明显不足。实验还揭示模型在多模态理解和信息融合方面的潜力和短板,为未来优化提供方向。
应用场景
该平台可应用于科研文献自动化理解、智能文献综述、科研辅助决策等场景。研究人员可以借助模型快速筛选关键信息,辅助论文写作和数据分析。行业中,可用于自动化科研报告生成、专利检索和学术推荐系统。未来,结合多模态和多工具能力,有望实现全流程科研自动化,提升科研效率,推动科学创新。
局限与展望
模型在多工具调用中的效率仍待提升,偏好通用工具导致信息冗余。复杂推理任务中,模型对专业工具的依赖不足,影响准确性。平台设计主要依赖现有模型和工具,未来需引入更丰富的工具集和优化策略。评估场景偏静态,难以反映动态科研环境中的连续推理能力。未来需解决工具调用的精细化和推理链的优化问题,以实现更高效、更精准的科研自动化。
通俗解读 非专业人士也能看懂
想象你在一个大型工厂工作,工厂里有很多不同的机器,每台机器都有自己的专长。有时候,你需要用不同的机器合作完成一项复杂的任务,比如制造一辆汽车。你必须先制定一个计划,知道每台机器该做什么,然后逐步操作,确保每个步骤都正确。这个过程就像科研人员阅读很多论文,理解不同的图表和数据,结合多个工具(比如搜索引擎、数据库、计算机程序)来解决一个难题。就像工厂里的工人需要协调合作,科研AI也需要合理调用各种工具,逐步推理,最终得出答案。这个基准测试就是让AI像工厂工人一样,学会用不同的机器合作,解决科学上的复杂问题。
简单解释 像给14岁少年讲一样
你知道在学校里,有时候老师会出一道很难的题,要用很多知识点和步骤才能解出来吗?想象你在玩一个超级复杂的拼图游戏,你需要找到很多不同的线索,把它们拼在一起,才能看到完整的图像。科研论文就像这些拼图,每一篇论文都提供一部分信息,你需要把它们拼在一起,才能理解一个大问题。现在的AI就像一个聪明的助手,它可以帮你找资料、分析图表、写代码,但它还不够聪明,不能总是知道什么时候用哪个工具,也容易走弯路。这个研究就是在教AI怎么像一个聪明的拼图大师一样,合理调用各种工具,逐步拼出科学的答案。虽然还不完美,但这是让AI变得更聪明、帮人类做科研的重要一步。
原文摘要
Understanding and reasoning on the large-scale scientific literature is a crucial touchstone for large language model (LLM) based agents. However, existing works are mainly restricted to tool-free tasks within single papers, largely due to the lack of a benchmark that evaluates cross-paper reasoning and multi-tool orchestration in authentic research scenarios. In this work, we propose PaperArena, a benchmark to evaluate LLM-based agents on questions that require integrating information across multiple papers with the assistance of external tools. Given a research question, agents should formulate a reasoning plan, interact with multiple papers, and invoke appropriate tools to produce a well-grounded answer. To support standardized evaluation, we provide a platform for agent execution, offering a modular tool environment including multimodal parsing, context retrieval, and programmatic computation. Experiments reveal that even the leading LLM powering a well-established agentic workflow achieves merely 38.78% average accuracy, while on the hard subset, accuracy drops to only 18.47%. We also analyze reasoning traces and diagnose agent behavior, providing the community with insights to develop and evaluate more capable scientific agents.