Don't Adapt Small Language Models for Tools; Adapt Tool Schemas to the Models

TL;DR

提出PA-Tool,通过峰值性指标无训练调整模型偏好,实现工具命名对齐,提升17%准确率。

cs.CL 🔴 高级 2025-10-09 46 次浏览
Jonggeun Lee Woojung Song Jongwook Han Haesung Pyun Yohan Jo
自然语言处理 多模态系统 模型偏好 工具使用 架构优化

核心发现

方法论

该方法利用污染检测中的峰值性信号,评估模型对工具组件名称的熟悉程度。通过多次生成候选名称,计算其峰值性,选取最高者作为模型偏好的名称,从而实现架构层面上的工具命名对齐,无需模型训练。具体流程包括:提供描述、采样候选、计算峰值性、选择最优,构建映射字典。实验在MetaTool和RoTBench上验证,显示工具命名偏差降低80%,性能提升最多17%。

关键结果

  • 在MetaTool中,PA-Tool在可靠性任务中提升最高达17%,在多工具选择中提升9.6%,显著减少模型生成不存在工具名的错误。RoTBench中,单轮和多轮任务中工具选择提升最高10%,参数识别提升4.3%。错误分析显示80%的命名偏差错误被消除,模型对工具偏好的理解得到显著改善。
  • 在不同模型规模(如Qwen2.5-3B、Llama3.1-8B)上,PA-Tool均表现出优越的性能,尤其在资源有限的小模型中效果最为明显。与训练后微调模型相比,PA-Tool无需训练成本即可实现性能提升,且与现有描述增强、检索校正等方法具有良好的互补性。
  • 实验还验证了峰值性指标在模型训练过程中逐步增强,支持其作为偏好信号的有效性。通过消除命名偏差,模型在API调用、参数提取等任务中表现更为稳健,展现了架构级干预在模型工具使用中的潜力。

研究意义

该研究突破了模型偏好与工具架构的匹配瓶颈,为资源有限的模型提供了无需再训练的工具对齐方案。解决方案简洁高效,极大降低了模型在实际应用中的部署门槛。通过优化工具架构,显著提升模型在多任务、多工具场景下的表现,为未来多模态、多任务系统的构建提供了理论基础和技术路径。该方法不仅适用于现有模型,还具备良好的迁移性,有望推动大规模多模态系统的普及与智能化水平提升。

技术贡献

提出基于污染检测中峰值性指标的架构层面工具命名对齐方法PA-Tool,创新性地将偏好识别与架构优化结合,避免模型再训练。该方法通过多次采样与峰值性计算,自动识别模型偏好的命名模式,实现工具架构的无训练优化。实验验证其在MetaTool和RoTBench上的优越性能,显著降低命名偏差,提升工具调用准确率。该技术为模型架构干预提供了新思路,拓展了模型对外部工具的适应能力。

新颖性

本研究首次提出利用污染检测中的峰值性指标进行模型偏好识别,直接实现工具架构的无训练对齐。区别于传统微调或描述增强方法,PA-Tool无需模型参数更新,极大简化了工具适配流程。其创新点在于将污染检测的偏好信号迁移至工具命名优化,开启了模型偏好与架构干预的新路径,为模型工具使用的可扩展性提供了新思路。

局限性

  • 该方法依赖于模型在预训练中接触到的命名模式,可能在极端偏离预训练知识的场景中效果有限。
  • 峰值性指标虽有效,但在多任务、多工具复杂场景下的鲁棒性仍需进一步验证。
  • 目前只在特定基准数据集上验证,实际应用中可能面临不同领域、不同工具集的迁移问题。

未来方向

未来将探索多模态、多任务场景下的架构优化策略,结合动态学习机制提升偏好识别的鲁棒性。还计划将该方法扩展到多语言、多领域环境,增强模型的通用性和适应性。同时,结合强化学习等技术,动态调整工具架构以适应不断变化的任务需求,推动智能系统的自主适应能力。

AI 总览摘要

随着人工智能系统的不断发展,模型与外部工具的高效结合成为核心挑战之一。传统方法多依赖模型微调或描述优化,但这些都需要大量训练资源,且难以应对多样化的工具架构偏差。本文提出的PA-Tool方法,创新性地利用污染检测中的峰值性指标,识别模型偏好的工具命名模式,从而实现架构层面的无训练对齐。通过多次生成候选名称,计算峰值性,选择最符合模型预训练知识的名称,PA-Tool显著降低了命名偏差错误,提升了工具调用的准确率。实验在MetaTool和RoTBench两个基准上验证,最高提升17%的性能,错误减少达80%。这一技术不仅简洁高效,还具有良好的迁移性,为资源有限模型的工具使用提供了新思路。未来,结合多模态、多任务场景,PA-Tool有望推动智能系统的自主适应能力,开启模型架构优化的新篇章。

深度分析

研究背景

近年来,随着大规模预训练语言模型(如GPT、LLaMA)的崛起,模型在自然语言理解和生成方面取得了突破性进展。多模态系统和多任务架构逐渐成为研究热点,工具增强技术成为提升模型实用性的关键路径。现有研究多关注模型微调(如Supervised Fine-tuning)或描述优化(如描述增强、检索校正),以改善工具调用能力。然而,模型在实际应用中仍面临架构偏差、命名不一致等问题,导致工具调用错误频发。尤其是在资源有限的小模型中,偏差更为明显,严重制约其应用推广。

核心问题

核心问题在于模型对工具组件名称的偏好与实际工具架构存在偏差,导致命名偏差和调用错误。这种偏差源于预训练中内化的命名习惯,难以通过微调解决,且微调成本高昂。模型在面对不同工具架构时,容易生成不存在的工具名或参数名,影响任务完成率。解决这一问题对于提升小模型的工具利用效率、降低部署门槛具有重要意义,但现有方法缺乏高效、无训练的解决方案。

核心创新

本研究提出PA-Tool,创新点在于:1)利用污染检测中的峰值性指标,评估模型对工具命名的熟悉程度;2)通过多次采样生成候选名称,计算峰值性,自动识别模型偏好的命名模式;3)无需模型微调,直接进行架构层面的工具命名对齐。该方法突破了传统微调依赖的限制,提供了一种高效、可扩展的工具架构优化方案。其核心创新在于将污染检测的偏好信号迁移至工具命名,开启了模型偏好识别与架构优化的新路径。

方法详解

  • �� 提供工具组件描述,输入模型,生成多个候选名称。• 计算每个候选名称的峰值性,衡量其在候选集中的集中程度。• 选择峰值性最高的候选作为偏好名称,构建映射字典。• 将此过程应用于所有工具组件,完成架构对齐。具体步骤包括:
  • 采样候选(N次)以探索模型偏好
  • 计算Levenshtein距离,定义相似性阈值
  • 统计每个候选的峰值性(邻近候选数)
  • 选取峰值性最大者,作为最终名称
  • 通过映射实现工具架构的无训练优化。

实验设计

在MetaTool和RoTBench两个基准上进行验证,评估工具选择和参数识别任务。使用不同模型(如Qwen、Llama)及多种配置(原始、贪婪、多候选、人工、PA-Tool),比较准确率提升。参数设置包括候选数N=32,温度t=0.4,峰值性阈值α=0.2。通过错误分析、 Ablation研究验证峰值性指标的有效性。实验还考察多轮交互、多工具组合的性能变化,确保方法的鲁棒性。

结果分析

PA-Tool在MetaTool中,工具选择任务最高提升17%,多工具任务提升9.6%;在RoTBench中,单轮和多轮任务最高提升10%,参数识别提升4.3%。错误分析显示,命名偏差错误减少80%,模型对工具偏好的理解明显改善。不同模型规模(如Qwen2.5-3B、Llama3.1-8B)均获益,尤其在资源有限的小模型中效果最显著。实验还验证峰值性指标在训练过程中逐步增强,支持其作为偏好信号的有效性。

应用场景

该方法适用于多模态、多任务系统中的工具调用优化,特别是在资源有限的边缘设备或嵌入式系统中。无需模型微调,便于快速部署,提升模型在实际场景中的工具利用效率。未来还可结合动态学习机制,实现模型在不断变化的任务环境中的自适应架构调整,推动智能系统的自主演化。

局限与展望

目前依赖预训练中接触到的命名模式,可能在极端偏离预训练知识的场景中效果有限。峰值性指标在复杂多工具场景中的鲁棒性尚需验证。仅在特定基准数据集上测试,实际应用中可能面临不同领域、不同工具集的迁移问题。未来需研究多模态、多语言环境下的泛化能力。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭,每个调料瓶都有名字,比如‘盐’、‘糖’、‘胡椒’。有时候,你会忘记某个调料的名字,或者用自己习惯的名字叫它们,比如叫‘白色粉末’。这就像模型在用工具时遇到的问题:它们记得一些工具的名字,但面对新或不同的名字时,会胡乱猜测,甚至叫出不存在的工具。PA-Tool就像一个聪明的助手,它会观察你平时怎么叫这些调料,找到你最常用的名字,然后用这些名字替换掉那些不太熟悉的名字。这样,无论你用什么名字,它都能帮你找到正确的调料,做出美味的菜肴。这种方法不用重新学习,只是调整名字的标签,让厨房变得更顺畅。它让模型像个懂得你习惯的厨师一样,能更准确地调用工具,做出更好的结果。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的朋友给你一堆装备,比如‘剑’、‘盾’、‘魔法棒’,但你有时候会用自己习惯的名字,比如叫‘长刀’或‘防御牌’。如果你用的名字和朋友给的名字不一样,你可能会找不到装备,或者用错装备。PA-Tool就像一个超级聪明的朋友,它会观察你平时怎么叫这些装备,然后帮你把你习惯的名字换成朋友的正式名字。这样一来,不管你用什么名字,它都能帮你找到正确的装备,帮你赢得比赛。这就像让你的游戏角色变得更聪明,更懂你的习惯,不用重新学东西,只是调整名字,让一切变得更顺畅。它让模型更像个懂得你偏好的助手,能更快更准地帮你完成任务!

原文摘要

Small language models (SLMs) enable scalable tool-augmented multi-agent systems where multiple SLMs handle subtasks orchestrated by a powerful coordinator. However, they struggle with tool-use tasks, particularly in selecting appropriate tools and identifying correct parameters. A common failure mode is \textit{schema misalignment}: models hallucinate plausible tool names that are absent from the provided tool schema, due to different naming conventions internalized during pretraining. Rather than training models to adapt to unfamiliar schemas, we propose adapting schemas to align with models' pretrained knowledge. We introduce \textbf{PA-Tool} (Pretraining-Aligned Tool Schema Generation), a training-free method that leverages peakedness, a signal used in contamination detection that indicates pretraining familiarity, to rename tool components. By generating multiple candidates and selecting the candidate with the highest peakedness, PA-Tool identifies pretraining-aligned naming patterns. Experiments on MetaTool and RoTBench show improvements of up to 17\%, with schema misalignment errors reduced by 80\%. PA-Tool enables small models to substantially improve tool-use accuracy without retraining, showing that schema-level interventions can unlock the tool-use potential of resource-efficient models. Our code is available at https://github.com/holi-lab/PA-Tool.

cs.CL