InfiniteScienceGym: An Unbounded, Procedurally-Generated Benchmark for Scientific Analysis

TL;DR

提出InfiniteScienceGym,基于种子生成可验证的科学问答基准,评估模型推理能力。

cs.CL 🔴 高级 2026-04-15 47 次浏览
Oliver Bentham Vivek Srikumar
科学推理 基准测试 生成模型 知识验证 工具使用

核心发现

方法论

该方法通过确定性模拟器,从随机种子生成完整科学仓库,包括目录结构、文件和表格数据。利用特权QA生成器,构建可验证的问答对,涵盖可回答与不可回答问题。问答对经过模板化和自然化处理,确保多样性与可验证性。模型在模拟环境中通过工具调用和证据推理进行评估,避免存储大规模静态数据集。实验涵盖多种模型,发现最优模型准确率仅达49.2%,识别不可回答问题仍是主要弱点。模型表现随着工具调用次数增加而提升,强调工具的有效利用。

关键结果

  • 所有模型准确率均未超过50%,其中GPT-5.4最高达49.2%。识别不可回答问题能力不足,许多模型在缺乏证据时依然自信作答。模型通过工具调用次数增加,准确率明显提升,表明交互策略优于单纯增加Token数。强模型倾向于程序化分析而非大量Token输入,显示工具使用效率的重要性。
  • 在不同问题类别中,模型在元数据和双变量统计表现较好,但在文件目录遍历和单变量统计中表现较差,反映复杂推理和代码生成的难度。模型错误主要集中在过滤和导航环节,错误逐步累积,影响最终表现。
  • 识别不可回答问题的能力中,GPT-5.4和Claude Opus 4.6达到80%以上的精确率,但仍有提升空间。模型在面对未提供充分证据的问题时,易出现自信错误,显示出推理中的不确定性处理不足。

研究意义

该研究突破了传统静态数据集的局限,提出可控、可验证、无限扩展的科学推理评估框架。通过模拟环境,有效规避发表偏差、知识偏差和标签噪声,提供更真实的模型能力检测平台。这对于推动AI在科学研究中的应用具有深远意义,尤其在模型推理、工具利用和不确定性识别方面填补了重要空白。

技术贡献

创新点在于提出基于种子模拟的可重复科学仓库生成流程,结合模板化与自然化问答生成,确保问答的可验证性与多样性。引入工具调用机制,评估模型在证据推理和操作能力上的表现。实验验证了模型在复杂推理和不确定性识别中的不足,为未来模型优化提供了明确方向。

新颖性

首次实现基于可重复种子模拟的无限扩展科学推理基准,结合结构化仓库、工具交互和可验证问答,突破静态数据集限制,系统性评估模型在科学数据推理中的表现。相较于DiscoveryBench等,强调模型的证据推理和不确定性识别能力,具有重要创新意义。

局限性

  • 模拟环境虽逼真,但仍难完全覆盖真实科研场景中的复杂性和多样性,存在一定偏差。
  • 模型在识别不可回答问题方面表现不足,未来需加强不确定性估计与拒绝策略。
  • 实验主要集中在特定模型和任务类型,泛化能力和实际应用场景仍需验证。

未来方向

未来将扩展模拟场景的多样性,加入更复杂的科研任务和多模态数据,提升模型在真实环境中的适应性。同时,探索更高效的工具调用策略和不确定性估计方法,推动模型自主推理和证据管理能力的提升。

AI 总览摘要

在科学研究中,评估人工智能模型的推理能力一直面临挑战。传统基准依赖于已发表的研究或人类标注,存在偏差、标签噪声和存储成本高等问题。为解决这一难题,Bentham和Srikumar提出了InfiniteScienceGym,一种基于随机种子生成的可验证、无限扩展的科学仓库模拟平台。

该平台由三部分组成:模拟器、问答生成器和自然化模块。模拟器根据种子生成完整的科研仓库,包括目录结构、文件和表格数据,确保可重复性。问答生成器利用特权访问,生成涵盖可回答与不可回答问题的问答对,保证 ground truth 的真实性。自然化模块将模板化问答转化为自然语言,增强实际应用的鲁棒性。

实验中,评估了多种模型,包括OpenAI的GPT-5.4和Claude Opus 4.6,发现最高准确率仅为49.2%。模型在识别不可回答问题方面表现不足,许多模型在缺乏证据时仍自信作答。研究还表明,模型通过增加工具调用次数,显著提升推理表现,强调工具利用的重要性。

该工作突破了静态数据集的局限,为科学AI模型提供了一个可控、可验证、无限扩展的评估平台。未来,平台将支持更复杂的科研场景和多模态数据,推动AI在科学研究中的应用迈向更高水平。

深度分析

研究背景

科学推理一直是人工智能的重要研究方向。早期工作如DiscoveryBench和ScienceAgentBench,主要基于真实科研数据,评估模型的发现和推理能力。然而,这些方法受限于数据偏差、标签噪声和存储成本,难以全面检测模型在证据推理和不确定性识别方面的能力。近年来,结构化数据推理和工具交互成为热点,但缺乏可控、可验证的评估环境,限制了模型性能的深入分析。本文提出的InfiniteScienceGym,结合模拟环境、结构化仓库和工具调用,为科学AI模型提供了全新评估平台,弥补了现有方法的不足。

核心问题

现有科学推理评估多依赖静态数据集,存在偏差、标签噪声和存储成本高的问题。此外,模型在识别不可回答问题和不确定性方面表现不足,导致实际应用中风险较大。如何设计一个可控、可验证、无限扩展的评估环境,成为亟待解决的核心难题。该问题关系到模型在科研中的可靠性和自主性,影响其推广和应用。

核心创新

本研究提出了基于随机种子模拟的科学仓库生成方法,确保环境的可重复性和无限扩展性。引入模板化与自然化问答,增强问答的多样性和真实性。结合工具调用机制,评估模型在证据推理和操作能力上的表现,突破了传统静态数据集的限制。这些创新使得模型评估更加科学、全面,具有较强的可控性和扩展性。

方法详解

  • �� 通过随机种子生成科学仓库,包括科学领域、项目描述、目录结构和表格数据。• 利用特权访问,生成涵盖可回答与不可回答问题的问答对,确保ground truth的真实性。• 将模板化问答转化为自然语言,增强实际应用中的鲁棒性。• 模型在模拟环境中调用工具,进行数据检索和推理,评估其证据推理和不确定性识别能力。• 采用多轮交互策略,分析模型在不同任务中的表现差异。• 通过实验验证模型在不同问题类别和交互次数下的性能变化。

实验设计

使用Qwen3 4B Instruct生成仓库,评估GPT-5.4、Claude Opus 4.6等模型。问答样本涵盖answerable与unanswerable问题,检测模型在证据推理和不确定性识别中的能力。指标包括准确率、不可回答识别率和工具调用次数。采用人工标注分析错误类型,验证模型在复杂推理中的表现。实验还评估模板与自然化问答的鲁棒性,确保多样性和真实性。

结果分析

模型准确率最高为49.2%,在不可回答问题识别方面,GPT-5.4和Claude表现优异,达80%以上。模型在复杂推理任务中,工具调用次数增加显著提升性能,表明交互策略优于Token堆积。错误分析显示,过滤和导航是主要难点,模型逐步累积错误。模拟环境有效揭示模型在证据推理和不确定性方面的不足,为未来优化提供依据。

应用场景

该平台可用于评估科研AI助手的推理能力,指导模型在证据管理和工具利用上的改进。未来可扩展到多模态数据和更复杂科研任务,推动AI在自动化科研、数据分析和知识发现中的应用。

局限与展望

模拟环境虽逼真,但仍难完全还原真实科研场景中的复杂性。模型在识别不可回答问题方面仍有不足,未来需增强不确定性估计能力。此外,工具调用策略和推理深度有限,需进一步优化以适应更复杂任务。

通俗解读 非专业人士也能看懂

想象你在一个大型图书馆里找资料。每次你来,图书馆会根据一个秘密的编号(种子)自动整理出一套书架和资料。这些资料包括文件夹、表格和数据,都是由系统提前设计好的。你可以问系统问题,比如“这个数据的平均值是多少?”,系统会根据资料给出答案。如果资料不完整或没有相关信息,系统会告诉你“无法回答”。这个过程就像一个智能助手在帮你查资料,但它的答案都可以被验证,因为每次资料都是由编号控制、可重复生成的。这样可以测试它在面对不同问题时的表现,特别是在缺乏证据时是否会拒绝回答。

简单解释 像给14岁少年讲一样

想象你在一个超级智能的图书馆里找资料。每次你来的时候,图书馆会根据一个神秘的数字(就像游戏里的密码)自动布置出一套书架和资料。这些资料包括各种文件和表格,都是提前设计好的。你可以问它一些问题,比如“这个表格里最高的温度是多少?”,它会根据资料给你答案。如果资料里没有相关信息,它会告诉你“我不知道”。每次布置都由那个神秘数字决定,所以无论你什么时候来,资料都一样,方便验证答案的正确性。这个系统可以帮助我们测试人工智能在科学推理中的能力,特别是在面对没有足够证据的问题时,是否会勇敢地说“我不知道”或者错误地给出答案。

术语表

Verifiable Ground Truth (可验证的真实答案)

指在模拟环境中通过算法计算得出的准确答案,确保每个问题的答案都可以被验证。InfiniteScienceGym利用模拟器生成的资料保证答案的真实性。

用于确保问答任务中的答案具有绝对的正确性和可验证性,避免标签噪声。

Tool-mediated Reasoning (工具辅助推理)

模型通过调用外部工具(如数据分析脚本)进行信息检索和计算,从而增强推理能力。该方法提升模型处理复杂任务的效率。

在实验中,模型通过工具调用实现对仓库数据的深度分析。

Procedurally-Generated Benchmark (程序生成基准)

通过算法根据随机种子自动生成测试环境和任务,确保环境的多样性和可控性。避免静态数据集的局限。

InfiniteScienceGym利用该技术生成无限多的科学仓库,用于模型评估。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在识别不可回答问题中的不确定性估计能力,仍是未来研究的关键。当前模型在缺乏证据时,仍倾向于自信作答,影响应用的可靠性。
  • 2 模拟环境虽逼真,但难以完全覆盖真实科研场景中的复杂性。未来需要结合真实数据和模拟环境,提升评估的代表性和实用性。

应用场景

近期应用

科学研究辅助工具

该平台可用于评估和改进科研AI助手的推理能力,帮助科研人员验证模型在数据推理和工具使用中的表现,提升科研效率。

模型性能诊断与优化

通过模拟环境中的详细错误分析,指导模型在过滤、导航和推理环节的优化,推动AI模型在科学推理中的应用落地。

远期愿景

自动化科学发现

未来可结合多模态数据和复杂科研任务,推动AI实现自主假设生成、实验设计和数据分析,极大加速科学创新。

原文摘要

Large language models are emerging as scientific assistants, but evaluating their ability to reason from empirical data remains challenging. Benchmarks derived from published studies and human annotations inherit publication bias, known-knowledge bias, label noise, and substantial storage requirements. We present InfiniteScienceGym, a procedurally generated benchmark of scientific repositories paired with a verifiable question-answering task. From a seed, the simulator deterministically generates a self-contained repository with realistic directory structure, files, and tabular data, and a privileged QA generator produces both answerable and unanswerable questions with exact ground truth. This makes it possible to evaluate evidence-grounded reasoning, abstention, and tool-mediated analysis in a controlled setting without distributing a large static corpus. InfiniteScienceGym complements real scientific benchmarks by targeting blind spots and failure modes that are hard to evaluate using published datasets alone. Evaluating both proprietary and open-weight models, we find that none achieve more than 50% accuracy overall, that recognizing unanswerable questions remains a major weakness, and that stronger models tend to use tools more effectively rather than simply consuming more tokens.

cs.CL cs.AI