AutoTool: Dynamic Tool Selection and Integration for Agentic Reasoning

TL;DR

AutoTool通过双阶段优化实现动态工具选择,提升LLM推理能力,平均在数学、科学、代码和多模态任务中提升6.4%。

cs.CL 🔴 高级 2025-12-15 25 次浏览
Jiaru Zou Ling Yang Yunzhe Qi Sirui Chen Mengting Ai Ke Shen Jingrui He Mengdi Wang
强化学习 大语言模型 工具集成 动态选择 多任务学习

核心发现

方法论

AutoTool采用双阶段优化策略:第一阶段通过监督微调(SFT)和强化学习(RL)稳定长链推理轨迹,第二阶段引入基于KL正则化的Plackett–Luce排序,细化多步工具选择。模型通过构建包含1000+工具和100+任务的200k数据集,结合工具选择理由和轨迹增强,训练出具备动态工具选择能力的LLM。具体算法包括工具嵌入、基于嵌入的软最大距离采样,以及PL排序优化,确保工具选择的鲁棒性和泛化能力。

关键结果

  • 在十个不同任务基准中,AutoTool在数学与科学推理任务中平均提升6.4%,在搜索问答中提升4.5%,在代码生成中提升7.7%,在多模态理解中提升6.9%。与参数更少的模型相比,AutoTool表现出更强的适应性和泛化能力,尤其在未见工具的动态环境中表现优异。
  • AutoTool在多个任务中超越了传统固定工具集的模型,特别是在工具集不断演化和新工具出现的场景中,展现出优越的适应性和性能提升。
  • 通过PL排序和KL正则化策略,有效引导模型学习偏好高质量工具组合,减少错误传播,增强推理连贯性和工具选择的准确性。

研究意义

该研究突破了传统静态工具集成的限制,提出动态工具选择机制,极大提升LLM在开放、多变环境中的适应性和推理能力。这不仅推动了多任务、多模态AI系统的研发,也为未来自主智能体的工具交互提供了理论基础和实践路径,解决了模型在实际应用中面临的泛化和适应性难题。

技术贡献

AutoTool创新性在于引入基于PL排序的工具选择优化框架,结合双阶段训练策略,实现模型在多工具环境中的动态决策能力。提出工具嵌入机制确保工具表示的通用性,利用KL正则化强化工具偏好学习,提供了理论上的排序一致性保证。数据集的构建和工具选择理由的显式标注,为模型提供了丰富的监督信息,推动了工具选择的可解释性和可控性。

新颖性

本研究首次系统性提出结合PL排序和KL正则化的动态工具选择框架,突破了以往固定工具集的限制,支持工具集的不断演化和未见工具的动态利用。其核心创新在于将工具选择视为排序问题,通过优化排序分布实现偏好学习,显著提升模型泛化能力。

局限性

  • 模型在极端复杂或多工具冲突场景下仍可能出现选择偏差,尤其在工具表示不充分或未标注的情况下。
  • 训练过程中对数据质量依赖较高,工具选择理由的标注成本较大,可能影响大规模推广。
  • 模型推理速度受工具调用频繁影响,实际部署时需优化效率。

未来方向

未来将探索多模态、多任务联合训练策略,提升模型在更复杂环境中的适应性。还计划引入自监督学习和增强学习结合的方法,进一步优化工具选择的效率与准确性。此外,研究将关注模型在真实场景中的鲁棒性和可解释性,推动自主智能体的实用化。

AI 总览摘要

AutoTool提出了一种创新的动态工具选择框架,旨在解决传统大语言模型在多工具环境中泛化不足的问题。现有方法多假设工具集固定,限制了模型在新工具和演变环境中的适应能力。本文引入双阶段优化策略:第一阶段通过监督微调和强化学习稳定推理轨迹,第二阶段利用基于PL排序的工具偏好优化,显著提升模型的工具选择能力。核心技术包括工具嵌入、基于嵌入的采样机制,以及KL正则化的排序优化,确保工具选择的鲁棒性和可解释性。作者构建了一个包含1000+工具和100+任务的200k数据集,涵盖数学、科学、代码和多模态任务,为模型提供丰富的监督信息。在十个不同任务基准上,AutoTool在参数较少的模型中表现优异,平均提升6.4%的推理准确率,尤其在未见工具的动态环境中展现出强大泛化能力。这一研究为自主智能体的工具交互提供了理论基础和实践方案,推动了多任务、多模态AI系统的未来发展。尽管如此,模型在极端复杂场景和超大规模工具集中的表现仍有待优化,未来将结合自监督和增强学习,提升效率和鲁棒性。

深度分析

研究背景

近年来,大语言模型(LLMs)在推理和生成任务中取得突破,但在多工具环境中表现受限。传统方法多采用静态工具集,模型在训练时学习工具调用规则,难以应对工具集的不断演变。已有研究如Toolformer、ReTool等在固定工具集上优化,但缺乏动态选择能力,限制了模型在开放场景中的应用。多模态和多任务的需求推动了工具集成技术的发展,但仍未解决模型在未见工具和环境变化中的泛化问题。此背景下,如何实现模型在多工具、多任务、多模态环境中的自主选择和适应,成为当前研究热点。

核心问题

核心问题在于现有大模型多采用预定义、静态工具集,难以应对工具的不断演化和未见工具的动态引入。这导致模型在实际应用中泛化能力不足,特别是在复杂、多样的任务场景中表现不佳。如何设计一种机制,使模型能够在推理过程中动态选择、组合工具,且具备良好的泛化和适应能力,是亟待解决的难题。这一问题关系到智能系统的自主性和实用性,挑战在于工具表示、偏好学习和决策优化的有效结合。

核心创新

本研究提出AutoTool框架,创新点包括:1)引入基于PL排序的工具偏好优化,将工具选择问题转化为排序任务,提升偏好学习的效果;2)采用双阶段训练策略,第一阶段稳定推理轨迹,第二阶段细化工具选择,增强模型在动态环境中的适应性;3)设计工具嵌入机制,确保工具表示的通用性和可扩展性;4)构建了包含1000+工具的高质量数据集,显式标注工具选择理由,提升监督信号的丰富性。这些创新共同推动模型在未见工具和环境变化中的表现。

方法详解

  • �� 构建工具集和任务集,涵盖数学、科学、代码和多模态任务,形成200k数据集。
  • �� 设计工具嵌入机制,将工具特征映射到模型隐藏空间,实现工具表示的通用性。
  • �� 在推理轨迹中引入工具选择步骤,模型生成选择理由,并通过嵌入距离采样动态选择工具。
  • �� 利用双阶段训练:第一阶段通过监督微调和RL稳定推理轨迹;第二阶段引入PL排序和KL正则化,优化工具偏好。
  • �� 采用PL排序模型,将工具选择转化为排序问题,利用工具偏好奖励指导训练。
  • �� 通过轨迹采样和奖励赋值,构建工具偏好分布,优化模型偏好。
  • �� 设计损失函数,最大化偏好一致性,提升工具选择的准确性和泛化能力。

实验设计

实验在十个任务基准上进行,包括AIME、GPQA、HotpotQA、2Wiki等,评估模型在数学、科学、搜索和多模态任务中的性能。比较基线包括GPT-4、Qwen系列、ReTool等。指标主要为准确率和任务完成度。训练参数包括不同模型规模(如Qwen3-8B、Qwen2.5-VL-7B),采用不同训练策略(SFT、RL、PL排序优化)。还进行了消融实验,验证工具偏好优化和数据集影响。测试环境模拟工具集不断演变,验证模型的泛化能力。

结果分析

AutoTool在十个任务中平均提升6.4%的推理准确率,尤其在未见工具环境中表现优异。在代码生成任务中提升7.7%,多模态任务中提升6.9%。模型在工具偏好学习方面表现出更强的鲁棒性和一致性,验证了PL排序和KL正则化的有效性。与传统静态工具集模型相比,AutoTool在泛化和适应性方面具有明显优势。消融实验显示,工具偏好优化和高质量数据集是性能提升的关键因素。

应用场景

该技术适用于智能问答、自动化助手、科学研究和教育等场景。模型可在不断变化的工具环境中自主选择工具,提升任务完成效率和准确性。未来可结合实际应用中的动态工具库,支持多模态交互和复杂推理,推动自主智能体的商业化和普及。

局限与展望

模型在极端复杂场景或工具表示不足时仍可能出现偏差。训练数据依赖人工标注,成本较高。推理过程中频繁调用工具可能影响效率。未来需优化模型速度和工具表示的表达能力,增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有很多不同的机器(工具),每台机器都能帮你完成特定任务。以前,你每次只用固定的几台机器,工厂的机器都一样,不能应对新来的特殊任务。现在,AutoTool就像一个聪明的工厂经理,它可以根据任务的不同,动态选择最合适的机器,还能学习新机器的使用方法。这样一来,无论任务多复杂或机器多新,工厂都能灵活应对,效率大大提高。它通过不断学习,知道什么时候用哪个机器,确保每次都用最合适的工具完成任务。这就像你在厨房做饭,遇到新菜谱时,能快速找到最合适的厨具和材料,做出美味佳肴。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里做实验,实验需要用到各种工具,比如显微镜、烧杯、温度计等等。以前,你只用固定的几样工具,遇到新实验就不太会用。AutoTool就像一个聪明的助手,它可以根据每个实验的需要,动态选择最合适的工具,还能学习新的工具怎么用。比如说,遇到一个新的显微镜,它会自己学会怎么操作,然后帮你完成实验。这样一来,不管实验多复杂,助手都能帮你找到最好的工具,让你轻松搞定所有任务。这就像你在玩游戏,遇到新关卡时,助手会告诉你用哪个装备最合适,帮你赢得比赛!

术语表

Tool Embedding (工具嵌入)

将工具的特征信息映射到模型的隐藏空间中,确保工具表示的通用性和可扩展性。

用于实现工具的动态选择和表示学习。

PL排序 (Plackett–Luce Ranking)

一种将偏好转化为排序分布的算法,用于优化工具选择偏好。

核心机制之一,用于工具偏好学习。

KL正则化 (Kullback-Leibler Regularization)

一种正则化技术,用于在训练中保持模型偏好与目标分布的一致性。

提升工具选择的稳定性和泛化能力。

Trajectory (轨迹)

模型在推理过程中生成的连续决策和推理步骤的序列。

描述模型的推理和工具调用流程。

Data Augmentation (轨迹增强)

通过生成和筛选高质量的推理轨迹,丰富训练数据。

提升模型的推理连贯性和工具选择能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端复杂环境中的工具选择准确性?
  • 2 模型在多模态、多任务环境中泛化能力的极限在哪里?
  • 3 未来能否实现完全自主的工具学习和调用?

应用场景

近期应用

智能问答系统

支持复杂、多工具环境下的自动问答,提升准确率和交互体验。

科学研究助手

辅助科研人员在多模态数据和工具中快速找到最佳方案,提升效率。

远期愿景

自主智能体

实现完全自主的工具选择和任务执行,推动AI自主化发展。

多模态协作平台

构建跨领域、多模态的智能协作系统,支持复杂场景中的决策和操作。

原文摘要

Agentic reinforcement learning has advanced large language models (LLMs) to reason through long chain-of-thought trajectories while interleaving external tool use. Existing approaches assume a fixed inventory of tools, which limits the adaptability of LLM agents to new or evolving toolsets. We present AutoTool, a training framework that equips LLM agents with dynamic tool-selection capabilities throughout their reasoning trajectories. AutoTool employs a dual-phase optimization pipeline: (i) SFT and RL-based trajectory stabilization for coherent reasoning, and (ii) KL-regularized Plackett-Luce Ranking to refine consistent multi-step tool selection. We further build a 200k dataset with explicit tool-selection rationales across 1,000+ tools and 100+ tasks spanning mathematics, science, code generation, and multimodal reasoning. Across ten diverse benchmarks, we train two base models, Qwen3-8B and Qwen2.5-VL-7B, with AutoTool. With fewer parameters, AutoTool consistently outperforms advanced LLM agents and tool-integration methods, yielding average gains of 6.4% in math & science reasoning, 4.5% in search-based QA, 7.7% in code generation, and 6.9% in multimodal understanding. In addition, AutoTool exhibits stronger generalization by dynamically leveraging unseen tools from evolving toolsets during inference.

cs.CL cs.LG