SciAgentGym: Benchmarking Multi-Step Scientific Tool-use in LLM Agents

TL;DR

SciAgentGym通过SciForge提升科学工具使用能力,SciAgent-8B超越Qwen3-VL-235B-Instruct。

cs.CL 🔴 高级 2026-02-13 9 次浏览
Yujiong Shen Yajie Yang Zhiheng Xi Binze Hu Huayu Sha Jiazheng Zhang Qiyuan Peng Junlin Shang Jixuan Huang Yutao Fan Jingqi Tong Shihan Dou Ming Zhang Lei Bai Zhenfei Yin Tao Gui Xingjun Ma Qi Zhang Xuanjing Huang Yu-Gang Jiang
科学推理 工具使用 多步交互 数据合成 跨领域

核心发现

方法论

SciAgentGym是一个包含1,780种领域特定工具的交互环境,支持多学科的科学推理。SciAgentBench评估套件用于测试从基本操作到长时程工作流的能力。SciForge通过依赖图生成逻辑感知的训练轨迹,提升模型的工具使用能力。

关键结果

  • SciAgent-8B在跨领域工具使用能力上超越了Qwen3-VL-235B-Instruct,表现提升了6.7%。
  • GPT-5在长时程任务中的成功率从58.8%降至34.6%,显示出工具使用的瓶颈。
  • SciAgent-8B在多领域任务中表现出正向的跨领域迁移能力。

研究意义

该研究为科学推理的自动化提供了新的视角,填补了现有基准测试在工具使用能力评估上的空白。通过SciAgentGym,研究者能够更好地理解和提升模型在复杂科学任务中的表现。

技术贡献

SciAgentGym提供了一个可扩展的环境,支持多学科的工具使用。SciForge通过数据合成生成逻辑感知的训练数据,提升了模型的科学工具使用能力。SciAgent-8B在性能上超越了更大规模的模型。

新颖性

这是首次在多学科环境中系统性地评估科学工具使用能力,SciForge通过依赖图生成训练数据,提升了模型的逻辑推理能力。

局限性

  • 当前模型在长时程任务中表现不佳,尤其是在复杂的工具使用场景中。
  • SciAgentGym的工具集虽然广泛,但仍可能无法涵盖所有科学领域的需求。

未来方向

未来工作将集中在扩展工具集的多样性和复杂性,以及提升模型在长时程任务中的表现。

AI 总览摘要

科学推理需要复杂工具的整合,而现有基准测试往往忽略了这一点。SciAgentGym通过提供一个包含1,780种领域特定工具的交互环境,填补了这一空白。SciAgentBench评估套件用于测试从基本操作到长时程工作流的能力。我们的研究发现,当前最先进的模型在复杂科学工具使用上仍存在瓶颈,尤其是在长时程任务中表现不佳。为了解决这一问题,我们提出了SciForge,这是一种通过依赖图生成逻辑感知训练轨迹的数据合成方法。通过在这些轨迹上进行微调,SciAgent-8B在跨领域工具使用能力上超越了Qwen3-VL-235B-Instruct。我们的结果表明,下一代自主科学代理具有巨大的潜力。

深度分析

研究背景

科学推理越来越依赖于工具辅助的工作流,从分子模拟到大规模数据分析。解决这些科学问题需要部署工具,因为解决方案很少直接从推理中出现,而是通过广泛的试错过程得出。

核心问题

现有的科学基准测试主要针对静态问答,未能捕捉实际科学工作流中交互式、工具介导的特性。随着对开发能力强大的科学代理的兴趣激增,迫切需要一个能够反映真实科学推理的评估框架。

核心创新

我们引入了SciAgentGym,一个分层的交互环境,旨在将LLM代理固定在多回合工具使用的科学推理任务中。该框架无缝集成了1,780种领域特定工具,支持物理学、化学、生物学和材料科学。

方法详解

  • �� SciAgentGym提供了一个交互环境,集成了1,780种工具。
  • �� SciAgentBench评估套件用于测试从基本操作到长时程工作流的能力。
  • �� SciForge通过依赖图生成逻辑感知的训练轨迹。

实验设计

我们在SciAgentBench上评估了多个模型,发现即使是最先进的模型在长时程任务中的成功率也显著下降。实验使用了多种数据集和基准测试,重点考察了工具使用的效率和准确性。

结果分析

SciAgent-8B在跨领域工具使用能力上超越了Qwen3-VL-235B-Instruct,表现提升了6.7%。GPT-5在长时程任务中的成功率从58.8%降至34.6%。

应用场景

SciAgentGym可以用于评估和提升科学代理在复杂任务中的表现,特别是在需要多步推理和工具使用的场景中。

局限与展望

当前模型在长时程任务中表现不佳,尤其是在复杂的工具使用场景中。SciAgentGym的工具集虽然广泛,但仍可能无法涵盖所有科学领域的需求。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,SciAgentGym就像一个拥有各种厨具和食材的厨房。你需要根据食谱(科学任务)选择合适的工具(科学工具)来完成一道菜(解决问题)。SciForge就像一个智能助手,它会告诉你每一步该用哪个工具,帮助你更快更好地完成菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,需要用不同的道具来解决谜题。SciAgentGym就像游戏中的一个大仓库,里面有各种道具。SciForge就像一个超级攻略,告诉你怎么用这些道具来通关。你可以用这些工具来完成任务,就像在游戏中打败大Boss一样!

术语表

SciAgentGym (科学代理健身房)

一个交互环境,包含1,780种领域特定工具,用于科学推理任务。

用于评估和提升模型在复杂科学任务中的表现。

SciAgentBench (科学代理基准)

一个评估套件,用于测试从基本操作到长时程工作流的能力。

用于量化工具可用性与掌握之间的差距。

SciForge (科学锻造)

一种数据合成方法,通过依赖图生成逻辑感知的训练轨迹。

用于提升模型在科学工具使用中的表现。

长时程任务

需要多步推理和工具使用的复杂任务。

在SciAgentBench中用于测试模型的能力。

工具使用能力

模型在科学任务中有效调用和组合工具的能力。

SciAgentGym和SciForge的核心评估指标。

开放问题 这项研究留下的未解疑问

  • 1 如何提升模型在长时程任务中的表现,尤其是在复杂的工具使用场景中。
  • 2 SciAgentGym的工具集是否足够广泛以涵盖所有科学领域的需求。

应用场景

近期应用

科学研究

研究人员可以使用SciAgentGym来评估和提升模型在复杂科学任务中的表现。

远期愿景

自动化科学发现

SciAgentGym可以推动科学发现的自动化,实现更复杂的科学推理和工具使用。

原文摘要

Scientific reasoning inherently demands integrating sophisticated toolkits to navigate domain-specific knowledge. Yet, current benchmarks largely overlook agents' ability to orchestrate tools for such rigorous workflows. To bridge this gap, we introduce SciAgentGym, a scalable interactive environment featuring 1,780 domain-specific tools across four natural science disciplines, supported by a robust execution infrastructure. Complementing this, we present SciAgentBench, a tiered evaluation suite designed to stress-test agentic capabilities from elementary actions to long-horizon workflows. Our evaluation identifies a critical bottleneck: state-of-the-art models still struggle with complex scientific tool-use, and their performance degrades substantially as interaction horizons extend. To address this, we propose SciForge, a data synthesis method that models the tool action space as a dependency graph to generate logic-aware training trajectories. By fine-tuning on these trajectories, our SciAgent-8B outperforms the significantly larger Qwen3-VL-235B-Instruct while exhibiting positive cross-domain transfer of scientific tool-use capabilities. These results underscore the promising potential of next-generation autonomous scientific agents.

cs.CL