核心发现
方法论
本研究提出了一套三阶段自动化数据集构建流程,包括参考数据采集、基于模板的人类引导问题生成和程序化答案生成。参考数据来自8个不同领域,确保与模型预训练数据无重叠。利用13种专用工具(如文本检索、数据库操作、数学计算、图结构分析和代码解释)模拟真实场景中的外部知识访问。问题生成采用人机协作的模板验证机制,确保题目只能通过工具访问外部知识解决。答案由程序化调用工具的操作链自动生成,确保答案的准确性。通过对比纯内在知识模型(如ChatGPT)与工具增强模型(如ReAct、Chameleon)在ToolQA上的表现,验证了工具辅助显著提升模型在复杂推理任务中的能力。
关键结果
- 在简单问题上,纯内在知识模型如ChatGPT的成功率约为5%,而工具增强模型ReAct(GPT-3.5)最高达43.15%,提升显著。复杂问题中,纯模型成功率降至2%,工具模型最高仅为8.2%,显示硬题依然具有挑战性。
- 不同模型在不同任务中的表现差异明显,ReAct在多工具调用和多步骤推理中表现优越,但仍存在参数调用错误和数据源识别偏差的问题。
- 实验结果表明,ToolQA能有效区分模型是否真正利用外部工具,避免了预训练数据重叠带来的偏差,为未来多模态、多工具集成的评估提供了新基准。
研究意义
该研究填补了现有评估方法无法区分模型是否依赖预训练知识的空白,为外部工具辅助的LLMs提供了更公平、科学的评估平台。推动了模型在复杂推理、动态知识更新和多模态交互中的应用潜力,具有重要的学术和工业价值。通过引入多领域、多工具的设计,促进了跨学科的知识融合与模型泛化能力提升,为未来智能系统的构建提供了理论基础和实践指南。
技术贡献
本研究提出了基于自动化流程的ToolQA数据集,结合13种专用工具,创新性地实现了题目生成、答案验证与工具调用的闭环机制。引入了多领域参考数据,确保评估的公平性和多样性。通过对比多种工具增强模型,验证了工具调用策略对复杂推理任务的提升效果,特别是在多步骤、多工具组合场景中的性能改善。该框架为未来多模态、多任务的模型训练和评估提供了技术基础,推动了外部知识融合与推理能力的深度结合。
新颖性
本研究首次系统性构建了涵盖8个不同领域、13种工具的外部知识访问评估数据集,强调题目只能通过工具访问外部知识解决,极大减少了预训练数据重叠的影响。与现有基准(如API-Bank、ToolBench)不同,ToolQA专注于开放式工具调用能力的评估,强调模型在复杂推理中的实际应用能力。其自动化的三阶段数据生成流程和多领域、多工具的设计,为外部工具在LLMs中的应用提供了创新范例,具有较强的推广价值。
局限性
- 当前模型在硬题(复杂多步骤推理、多工具组合)中的成功率仍较低,说明模型在复杂推理和工具调度方面仍有较大提升空间。
- 工具调用中的参数错误和数据源识别偏差表明模型在理解和执行工具指令方面存在不足,未来需加强模型的推理和理解能力。
- 数据集虽覆盖多个领域,但仍未涵盖所有实际应用场景,未来应扩展更多行业和任务的参考数据,提升评估的全面性和实用性。
未来方向
未来研究将集中于提升模型在复杂任务中的多工具调度能力,结合强化学习和自监督训练优化工具调用策略。同时,计划引入更多动态更新的知识源,增强模型的实时性和适应性。此外,将探索多模态信息融合,结合视觉、语音等多模态数据,构建更全面的智能问答系统,推动AI在实际场景中的应用落地。
AI 总览摘要
在人工智能快速发展的今天,基于大规模预训练语言模型(LLMs)的问答系统已成为研究热点。然而,尽管模型在多项任务中表现出色,但其在复杂推理、数字计算和新颖知识获取方面仍存在明显短板。Hallucination(幻觉)问题和对外部知识的依赖不足,限制了其在实际应用中的可靠性。传统评估方法难以区分模型是否真正利用了外部工具,导致对模型能力的评价存在偏差。
为解决这一问题,ToolQA应运而生。该数据集通过自动化流程,结合多领域参考数据和13种专用工具,系统性地评估LLMs在利用外部工具进行问答的能力。其核心创新在于确保题目只能通过调用外部工具获得答案,从而有效避免预训练数据的重叠带来的偏差。数据集涵盖8个不同领域,包括时间、空间、科学、数学、社交和个人信息,确保多样性和代表性。
在实验中,纯内在知识模型如ChatGPT在简单问题上的成功率仅为5%,而工具增强模型如ReAct(GPT-3.5)最高达43.15%。复杂问题中,纯模型成功率降至2%,工具模型最高仅为8.2%,显示硬题仍具挑战性。这些结果验证了ToolQA在评估模型实际工具利用能力方面的有效性,也揭示了当前模型在多步骤、多工具推理中的不足。
该研究的意义在于为未来多模态、多工具融合的智能系统提供了科学的评估平台,推动了模型在动态知识获取和复杂推理方面的技术突破。同时,ToolQA的自动化构建流程和多领域设计,为后续研究提供了可复制、扩展的范例。未来,结合强化学习和多模态信息融合,有望进一步提升模型的推理能力和应用范围,推动AI技术向更高水平发展。
深度分析
研究背景
近年来,随着预训练语言模型(如GPT、BERT)的崛起,NLP任务的性能得到了极大提升。早期工作主要依赖模型内部知识进行问答,然而,内部知识有限且易出现幻觉问题。随后,retrieval-augmented方法(如RAG、REALM)引入外部知识检索,改善了信息的时效性和准确性。尽管如此,现有评估多集中在单一任务或单一工具使用上,难以全面衡量模型在多工具、多任务场景中的能力。近年来,诸如API-Bank、ToolBench等基准开始关注多工具调用,但多为封闭式、任务导向,缺乏开放式、多领域的评估体系。ToolQA的出现,旨在弥补这一空白,通过自动化流程构建多领域、多工具的开放式问答评估平台,推动模型在复杂推理和多模态交互中的能力提升。
核心问题
当前,LLMs在复杂推理和多步骤工具调用方面表现有限,尤其是在硬题(需要多工具、多步骤推理)中成功率极低。现有评估方法无法有效区分模型是否真正利用外部知识,导致对模型能力的评价偏向内部知识的记忆能力。这一问题限制了模型在实际应用中的可靠性和泛化能力。如何设计一个公平、全面、自动化的评估体系,既能确保题目不能通过模型内部知识直接回答,又能反映模型在多工具、多领域场景中的实际能力,成为亟待解决的核心问题。
核心创新
本研究的核心创新在于:1)提出自动化三阶段数据集构建流程,确保题目只能通过调用外部工具获得答案;2)设计涵盖8个领域、13种工具的参考数据和工具集,模拟真实场景中的多模态知识访问;3)引入人机协作的模板验证机制,提升题目质量和多样性;4)通过程序化答案生成,确保答案的准确性和多步骤推理能力。这一体系突破了以往单一任务或封闭式评估的局限,为多模态、多工具的模型能力评估提供了新范式。
方法详解
- �� 参考数据采集:从时间、空间、科学、数学、社交等领域收集无重叠的外部知识源,包括文本、表格和图结构。
- �� 工具设计:开发13种工具,包括文本检索(AgendaRetriever、SciREXRetriever)、数据库操作(Database Loader、Data Filter、Get Value)、数学计算(WolframAlpha Calculator)、图结构分析(Graph Loader、Neighbour Checker、Node Checker、Edge Checker)和代码解释(Python Interpreter、SQL Interpreter)等。
- �� 问题生成:采用人机协作的模板验证机制,利用ChatGPT生成候选模板,经过人工筛选后自动填充具体值,形成题目。
- �� 答案生成:利用程序化调用工具的操作链,自动执行多步骤推理,确保答案的正确性。
- �� 实验验证:在多领域、多工具场景下测试模型表现,包括纯内在知识模型和工具增强模型,比较其成功率和错误类型。
实验设计
采用ToolQA中的8个领域数据,设计了多轮对比实验。基线模型包括ChatGPT(直接回答)、链式推理(CoT)、Chameleon和ReAct等。评估指标为成功率(exact match),在简单和复杂问题上进行对比。通过分析错误类型(参数错误、数据源识别偏差)揭示模型在多工具调用中的不足。实验还包括不同版本的ReAct(GPT-3与GPT-3.5)性能对比,验证模型在复杂推理中的表现差异。结果显示,工具增强模型在硬题上的成功率明显优于纯模型,验证了方法的有效性。
结果分析
纯内在知识模型在简单问题中的成功率约为5%,复杂问题降至2%;而ReAct(GPT-3.5)在简单题中最高达43.15%,硬题成功率为8.2%。不同任务中,模型表现差异显著,特别是在多步骤、多工具场景下,成功率仍有较大提升空间。错误分析显示,参数调用错误和数据源识别偏差是主要瓶颈。整体而言,ToolQA验证了多工具调用的潜力,也指出了当前模型在复杂推理中的不足,为未来优化提供了方向。
应用场景
该数据集可广泛应用于评估和训练多模态、多工具的智能问答系统,特别适合金融、医疗、科研等需要动态知识访问的场景。模型在实际应用中,可结合ToolQA的评估结果,优化工具调用策略,提升系统的可靠性和智能水平。未来,结合实时知识更新和多模态信息融合,有望实现更智能、更自主的AI助手,推动行业智能化升级。
局限与展望
尽管ToolQA涵盖多领域、多工具,但仍存在硬题成功率偏低的问题,反映模型在复杂推理中的不足。工具调用中的参数错误和数据源识别偏差,限制了模型的实际应用效果。数据集设计虽多样,但未覆盖所有行业和任务场景,未来需扩展更多实际应用场景。此外,模型在多工具调度和多步骤推理中的计算成本较高,需优化推理效率。未来应结合强化学习、多模态融合等技术,提升模型的推理能力和实用性。
通俗解读 非专业人士也能看懂
想象一下你在厨房做饭。你有很多食材(知识),但有时候你需要用特定的工具(比如搅拌机、秤、刀具)来完成某个菜肴。单靠记忆(内部知识)可能无法应对所有复杂菜谱,尤其是需要精确测量或特殊操作的菜肴。这时,你会用到厨房里的各种工具(外部工具)来帮忙,比如用秤称重、用搅拌机搅拌。这个过程就像让AI模型调用不同的工具,解决复杂的问题。工具就像厨房里的各种设备,帮助你做出更复杂、更精确的菜肴。没有这些工具,即使你记得所有食谱,也难以做出完美的菜肴。这就是为什么研究者设计了ToolQA,让AI学会像厨师一样,合理调用各种工具,解决复杂问题。
简单解释 像给14岁少年讲一样
想象你在学校里学习做科学实验。有时候,你只知道一些基本的知识(比如化学反应原理),但要完成一个复杂的实验,你可能需要查阅一本特殊的手册或者用一个计算器来帮你算出具体的数值。这就像让AI模型不仅用自己学到的知识,还能用外部的工具,比如数据库、计算器或者图表,来帮忙解决问题。比如,问“这个化学反应需要多长时间?”模型不能只靠记忆回答,而是需要调用实验手册(工具)去查找答案。这个研究就是让AI学会像你一样,合理调用各种工具,解决复杂的问题。它们就像你的学习助手,帮你做得更快、更准。未来,这样的AI可以帮我们在工作和生活中处理更复杂的任务,就像你用多种工具完成一项科学实验一样!
术语表
Large Language Models (LLMs) (大规模语言模型)
基于深度学习的模型,训练在海量文本数据上,具备理解和生成自然语言的能力。
论文中指GPT、BERT等模型的基础架构。
ToolQA (ToolQA数据集)
专为评估LLMs调用外部工具能力设计的多领域问答数据集,确保题目只能通过工具访问外部知识解决。
论文的核心贡献之一。
Programmatic Answer Generation (程序化答案生成)
利用预定义的工具操作链,通过自动执行多步骤推理,生成题目的正确答案。
确保答案的准确性和可验证性。
ReAct (Reasoning + Action)
一种结合推理和工具调用的模型框架,允许模型在推理过程中动态调用外部工具。
论文中用作性能最优的工具增强模型。
Template-based Question Generation (基于模板的问题生成)
利用预定义模板,通过填充具体信息自动生成符合题意的问题。
确保题目具有外部知识依赖性。
Reference Corpora (参考语料)
用于生成和验证题目的外部知识源,涵盖文本、表格和图结构。
确保题目不被模型预训练数据覆盖。
Toolset (工具集)
一组设计用于访问和操作外部知识的程序工具,包括检索、计算、数据库操作等。
模型调用的核心组件。
Success Rate (成功率)
模型正确回答题目的比例,用于衡量模型在特定任务中的表现。
实验中的主要评估指标。
Hard Questions (难题)
需要多步骤、多工具、多推理能力才能正确回答的问题。
评估模型复杂推理能力的重要指标。
Automated Data Collection (自动化数据采集)
通过程序自动从公开数据源获取无重叠的参考数据,确保评估的公平性。
数据集构建的基础环节。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升模型在多工具、多步骤推理中的成功率,尤其是在硬题场景下?未来是否可以结合强化学习或自监督学习优化工具调用策略?
- 2 在动态知识更新方面,模型如何实时访问最新信息,避免依赖静态参考语料?未来是否可以结合在线知识库实现实时推理?
- 3 多模态信息融合(如视觉、语音)在复杂推理中的作用如何?是否可以扩展ToolQA以支持多模态任务?
- 4 如何降低工具调用中的参数错误率?是否可以引入更智能的参数调度或验证机制?
- 5 未来是否可以设计更复杂的多工具组合任务,评估模型在跨模态、多任务场景中的能力?
应用场景
近期应用
智能问答系统优化
结合ToolQA的评估机制,开发能在金融、医疗等行业中调用多工具的智能问答系统,提升信息检索和决策效率。
模型调优与训练
利用ToolQA数据指导模型学习多工具调用策略,提升模型在复杂推理任务中的表现,推动行业应用落地。
知识库动态更新
结合ToolQA中的多领域参考数据,建立动态知识库,支持模型实时访问最新信息,增强系统的时效性。
远期愿景
自主智能助手
未来AI助手能自主调用多模态、多工具资源,完成复杂任务,成为人类生活和工作中的得力助手。
跨行业智能系统
实现跨行业、多任务、多模态的智能系统,推动工业、医疗、科研等领域的智能化升级,带来生产力革命。
原文摘要
Large Language Models (LLMs) have demonstrated impressive performance in various NLP tasks, but they still suffer from challenges such as hallucination and weak numerical reasoning. To overcome these challenges, external tools can be used to enhance LLMs' question-answering abilities. However, current evaluation methods do not distinguish between questions that can be answered using LLMs' internal knowledge and those that require external information through tool use. To address this issue, we introduce a new dataset called ToolQA, which is designed to faithfully evaluate LLMs' ability to use external tools for question answering. Our development of ToolQA involved a scalable, automated process for dataset curation, along with 13 specialized tools designed for interaction with external knowledge in order to answer questions. Importantly, we strive to minimize the overlap between our benchmark data and LLMs' pre-training data, enabling a more precise evaluation of LLMs' tool-use reasoning abilities. We conducted an in-depth diagnosis of existing tool-use LLMs to highlight their strengths, weaknesses, and potential improvements. Our findings set a new benchmark for evaluating LLMs and suggest new directions for future advancements. Our data and code are freely available to the broader scientific community on GitHub.
参考文献 (20)
Chain of Thought Prompting Elicits Reasoning in Large Language Models
Jason Wei, Xuezhi Wang, Dale Schuurmans 等
Chameleon: Plug-and-Play Compositional Reasoning with Large Language Models
Pan Lu, Baolin Peng, Hao Cheng 等
ReAct: Synergizing Reasoning and Acting in Language Models
Shunyu Yao, Jeffrey Zhao, Dian Yu 等
SituatedQA: Incorporating Extra-Linguistic Contexts into QA
Michael J.Q. Zhang, Eunsol Choi
Reframing Human-AI Collaboration for Generating Free-Text Explanations
Sarah Wiegreffe, Jack Hessel, Swabha Swayamdipta 等
Training Verifiers to Solve Math Word Problems
K. Cobbe, V. Kosaraju, Mo Bavarian 等
Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks
Patrick Lewis, Ethan Perez, Aleksandara Piktus 等
Improving language models by retrieving from trillions of tokens
Sebastian Borgeaud, Arthur Mensch, Jordan Hoffmann 等
Survey of Hallucination in Natural Language Generation
Ziwei Ji, Nayeon Lee, Rita Frieske 等
Training language models to follow instructions with human feedback
Long Ouyang, Jeff Wu, Xu Jiang 等
ReACC: A Retrieval-Augmented Code Completion Framework
Shuai Lu, Nan Duan, Hojae Han 等
PaLM: Scaling Language Modeling with Pathways
A. Chowdhery, Sharan Narang, Jacob Devlin 等
WebGPT: Browser-assisted question-answering with human feedback
Reiichiro Nakano, Jacob Hilton, S. Balaji 等
Ethical and social risks of harm from Language Models
Laura Weidinger, John F. J. Mellor, Maribeth Rauh 等
Time-Aware Language Models as Temporal Knowledge Bases
Bhuwan Dhingra, Jeremy R. Cole, Julian Martin Eisenschlos 等
Cross-Task Generalization via Natural Language Crowdsourcing Instructions
Swaroop Mishra, Daniel Khashabi, Chitta Baral 等
Measuring Mathematical Problem Solving With the MATH Dataset
Dan Hendrycks, Collin Burns, Saurav Kadavath 等
Investigating the Limitations of Transformers with Simple Arithmetic Tasks
Rodrigo Nogueira, Zhiying Jiang, Jimmy J. Li
Language Models are Few-Shot Learners
Tom B. Brown, Benjamin Mann, Nick Ryder 等
被引用 (20)
Adaptive Multi-Resolution Procedural Knowledge Compression for Large Language Models
Emerging from Ground: Addressing Intent Deviation in Tool-Using Agents via Deriving Real Calls into Virtual Trajectories
CirrusBench: Evaluating LLM-based Agents Beyond Correctness in Real-World Cloud Service Environments
CUA-Skill: Develop Skills for Computer Using Agent
From Language to Action in Arabic: Reliable Structured Tool Calling via Data-Centric Fine-Tuning
Approaches and emerging trends in multi-agent autonomous AI systems for education innovation in Vietnam
Balancing automation and control: user perceptions of tool invocations in conversational agents
PARKA: Path-aware knowledge retrieval and structural-semantic knowledge adaptation for knowledge-based question answering
Enhanced framework for detecting Vietnamese hate and offensive spans
Tool retrieval bridge: Aligning vague instructions with retriever preferences via bridge model
Agentic Tool Use in Large Language Models
Lightweight and Post-Training Structured Pruning for On-Device Large Language Models
ToolWeave: Structured Synthesis of Complex Multi-Turn Tool-Calling Dialogues
Beyond Accuracy: Unveiling Inefficiency Patterns in Tool-Integrated Reasoning
Diagon: A Programmable Testbed for AI-Agent Cognitive Labor Markets
Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion
Democratizing Tool Learning with Environments Fully Simulated by a Free 8B Language Model
Skill Retrieval Augmentation for Agentic AI
Can LLMs Be Effective Sensor Processing Copilots?
Group of Skills: Group-Structured Skill Retrieval for Agent Skill Libraries