ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling

TL;DR

ToolPRM通过细粒度内部调用决策评分,提升结构化函数调用的推理性能。

cs.AI 🔴 高级 2025-10-16 49 次浏览
Jianghao Lin Yuanyuan Shi Xin Peng Renjie Ding Hairui Wang Yuxuan Peng Bizhe Bai Weixi Song Fengshuo Bai Huacan Chai Weinan Zhang Fei Huang Ying Wen
大语言模型 结构化输出 推理扩展 奖励模型 函数调用

核心发现

方法论

本文提出基于细粒度步骤的过程奖励模型ToolPRM,结合细粒度束搜索,优化结构化函数调用的推理。通过函数掩码、逐步采样和逐步标注,构建了首个细粒度内部调用监督数据集。ToolPRM利用状态转移机制,将函数调用过程划分为选择函数名、参数名、参数值等多个决策步骤,训练奖励模型以评估每个步骤的正确性。结合该模型的指导,采用探索更多但保留更少的推理策略,有效提升了多项函数调用基准的性能。

关键结果

  • ToolPRM在预测准确率方面优于Outcome Reward Model(ORM)和粗粒度奖励模型(C-PRM),在训练集上步骤准确率达99.11%,轨迹准确率99.38%。在BFCL和ToolAlpaca基准上,ToolPRM显著优于其他推理扩展策略,尤其在较小模型(如Hammer2.1-1.5B)上提升明显,表现出较强的边缘计算适应性。
  • 在推理扩展方面,ToolPRM结合大规模束搜索(beam width M)和少量保留(N)策略,验证了“探索更多但保留更少”的原则,有效避免早期JSON错误无法修正的问题。实验显示,ToolPRM在不同模型规模(如7B、20B)上均实现了性能提升,尤其在模型较小或边缘设备场景中表现优越。
  • 通过对比不同奖励模型的预测性能,ToolPRM在训练过程中保持较低的损失(0.0286)和较高的轨迹整体准确率,验证了其在细粒度奖励建模中的优越性,为结构化输出的推理扩展提供了新的技术路径。

研究意义

该研究突破了结构化输出中推理扩展的瓶颈,提出“探索更多但保留更少”的原则,强调在结构化任务中早期错误不可修正的特性。通过细粒度奖励模型,显著提升了函数调用的准确性和鲁棒性,为大模型在复杂任务中的应用提供了理论基础和实用工具。该方法不仅改善了推理效率,也为未来多阶段、多步骤的结构化任务优化提供了新思路,具有重要的学术价值和工业应用潜力。

技术贡献

技术上,本文首次提出细粒度的内部调用过程奖励模型ToolPRM,结合状态转移机制,将函数调用拆解为多个决策步骤,训练奖励模型以逐步评估正确性。创新点包括:1)构建细粒度标注数据集,2)设计状态转移模型,3)结合束搜索实现“探索更多但保留更少”的推理策略。该方法显著优于传统的整体奖励和粗粒度奖励模型,提供了更精细的优化手段和理论保证,为结构化输出的推理扩展提供了新范式。

新颖性

本研究首次实现了针对结构化函数调用的细粒度过程奖励机制,突破了以往仅对整体调用进行奖励的限制。不同于传统的粗粒度奖励模型,ToolPRM在每个决策点提供明确的正负反馈,有效避免早期错误无法修正的问题。其创新在于将推理过程拆解为多个可控步骤,结合状态转移和束搜索策略,显著提升了模型的推理能力和鲁棒性。这一方法为结构化任务中的推理扩展提供了全新思路,具有较高的学术创新性。

局限性

  • 该方法依赖于高质量的细粒度标注数据,数据采集和标注成本较高,且在极端复杂场景下可能仍存在误判风险。
  • 早期JSON格式错误一旦发生,后续修正难度大,影响整体性能,限制了在某些高错误率环境中的适用性。
  • 模型训练和推理过程中计算成本较高,尤其在大规模束搜索时,可能影响实时性和边缘部署的可行性。

未来方向

未来将探索更高效的标注策略,减少数据依赖,同时结合自监督和迁移学习提升模型泛化能力。此外,将尝试引入动态调整束宽和保留策略,以适应不同任务复杂度和硬件环境,推动结构化推理的实用化和普及。

AI 总览摘要

大规模语言模型(LLMs)在函数调用任务中展现出强大能力,但其推理扩展仍面临挑战。传统方法多关注整体调用的奖励,忽视了调用过程中的细粒度决策,导致早期错误难以修正,影响整体性能。本文提出ToolPRM,一种结合细粒度步骤评分的过程奖励模型,通过函数掩码、逐步采样和逐步标注,构建了首个细粒度内部调用监督数据集。该模型将函数调用拆解为选择函数名、参数名、参数值等多个决策步骤,训练奖励模型以逐步评估正确性。结合状态转移机制和束搜索策略,推动“探索更多但保留更少”的推理原则,有效避免早期错误积累,显著提升多项函数调用基准的性能。实验结果显示,ToolPRM在不同模型规模上均优于传统奖励模型,尤其在边缘设备场景中表现优越。这一方法为结构化输出的推理扩展提供了新思路,具有重要的学术价值和工业应用潜力。未来将继续优化标注效率,提升模型泛化能力,推动结构化推理的广泛应用。

深度分析

研究背景

近年来,大型语言模型(LLMs)在自然语言理解和生成任务中取得突破,尤其在多任务、多模态场景中展现出强大能力。函数调用作为连接外部系统的重要接口,已成为提升模型实用性的关键方向。早期研究如OpenAI的Codex和GPT-4在代码和API调用方面取得显著成效,但仍存在调用准确性不足、推理复杂度高等问题。传统方法多采用整体奖励机制,忽略调用过程中的中间决策,限制了模型的优化空间。近年来,奖励模型(Reward Models, RMs)逐渐引入,用于引导模型生成更符合预期的调用序列,但多为粗粒度评估,难以捕捉调用中的细节错误。推理扩展策略如Beam Search和Monte Carlo Tree Search(MCTS)在无结构任务中表现优异,但在结构化调用中早期错误难以修正,限制了其效果。

核心问题

结构化函数调用的核心问题在于其多步骤、多决策的复杂性。早期决策错误(如函数名或参数填写错误)会导致整个调用流程失效,无法通过后续修正弥补。这使得传统的推理扩展策略在结构化任务中效果有限,尤其在JSON格式严格要求的场景下,错误一旦发生便不可逆转。此外,现有奖励模型多为整体评估,缺乏对中间步骤的细粒度指导,难以实现高效优化。如何在保证调用正确性的同时,提升推理效率,成为亟待解决的问题。

核心创新

本研究的核心创新在于提出细粒度的内部调用过程奖励模型ToolPRM,将函数调用拆解为多个决策步骤(选择函数名、参数名、参数值等),并为每个步骤设计明确的正负标签。通过函数掩码和逐步采样,构建了高质量的细粒度监督数据集。结合状态转移机制,将调用过程建模为一系列状态转换,训练奖励模型以逐步评估每个决策的正确性。采用束搜索策略,遵循“探索更多但保留更少”的原则,有效避免早期错误积累,显著提升结构化调用的准确率。这一方法突破了传统整体奖励的局限,为结构化推理提供了更细粒度、更高效的优化路径。

方法详解

  • �� 数据采集:利用xlam-function-calling-60k和xlam-irrelevance-7.5k数据集,通过函数掩码技术引入模糊性,增强模型鲁棒性。
  • �� 逐步采样:采用策略模型(如Hammer2.1-3B)生成函数调用,自动标注每个步骤的正确性标签(如<FUNC_NAM E>、<ARG_VALUE>等)。
  • �� 状态转移:定义五个状态(初始、选择函数名、选择参数名、填写参数值、终止),每次决策由奖励模型评估。
  • �� 训练ToolPRM:基于标注的轨迹数据,训练奖励模型预测每个步骤的正确性标签(+/-),优化其参数。
  • �� 推理策略:结合束搜索,利用ToolPRM的细粒度评分,扩大探索范围(增加束宽M),同时缩小保留(N),实现“探索更多但保留更少”。

实验设计

采用xlam-function-calling-60k和xlam-irrelevance-7.5k数据集进行训练和验证,构建了包含超过50万样本的细粒度标注数据。在BFCL和ToolAlpaca两个基准上评估模型性能,比较ToolPRM、ORM和C-PRM的预测准确率。通过不同模型(7B、20B)和推理策略(不同束宽)进行测试,分析模型在不同场景下的表现。实验还包括对奖励模型的训练曲线和误差分析,验证其在多步骤推理中的优势。

结果分析

ToolPRM在预测准确率方面优于ORM(0.0536损失)和C-PRM(0.0371损失),在轨迹整体准确率上达99.38%。在BFCL和ToolAlpaca基准中,ToolPRM结合束搜索策略显著提升模型性能,尤其在较小模型(如Hammer2.1-1.5B)上,性能提升明显,达到了与更大模型相当的水平。实验还验证了“探索更多但保留更少”的原则,有效避免早期错误导致的整体失败。这些结果表明,细粒度奖励模型在结构化推理任务中具有巨大潜力。

应用场景

该方法适用于需要高精度结构化调用的工业场景,如智能助手、自动化API调用、数据集成等。通过提升调用准确率,减少错误传递,增强系统鲁棒性。未来可结合边缘设备优化,推动在移动端、边缘计算环境中的应用,实现更智能、更可靠的自动化系统。

局限与展望

该方法依赖大量高质量标注数据,数据采集成本较高。在极端复杂或高错误率场景下,早期错误仍难以完全避免,影响整体性能。此外,推理过程中计算成本较大,尤其在大规模束搜索时,可能限制实时性和边缘部署的可行性。未来需优化标注流程和模型效率。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,每一道菜都需要按照特定步骤来完成。比如,先准备食材、然后调味、最后装盘。如果你在某个步骤出了错,比如放错了调料,整个菜就可能变得不好吃。传统的厨师可能会尝试多次修正,但如果错误太早发生,后续就难以挽回。本文的方法就像给厨师一套细致的指南,告诉他每一步都要检查,确保每个决定都正确。这样,即使出错,也能及时发现和修正,做出更美味的菜。这种细致的指导帮助厨师在复杂的菜肴制作中更有把握,也让厨房工作变得更高效、更可靠。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,每次你要做很多决定,比如选择角色、装备、技能。每个决定都很重要,如果你选错了,可能会输掉比赛。以前的游戏只会看你最后的成绩,但如果你能在每一步都给你打分,告诉你哪个决定是对的,哪个是错的,就能帮你变得更厉害。这个研究就像是给游戏增加了一个“聪明的教练”,让它在你每个选择时都能给出建议和评分。这样,游戏就能帮你不断改正错误,变得更厉害。特别是在复杂的任务中,这个方法能让AI更聪明、更可靠,避免早期的错误导致全部失败。

原文摘要

Large language models (LLMs) excel at function calling, but inference scaling has been explored mainly for unstructured generation. We propose an inference-scaling framework for structured outputs that combines fine-grained beam search with \textbf{ToolPRM}, a process reward model scoring each intra-call decision (function name and argument filling). We build the first fine-grained intra-call supervision dataset via function masking, rollout collection, and step-level annotation. ToolPRM outperforms outcome and coarse-grained reward models in predictive accuracy and yields consistent test-time gains on multiple function-calling benchmarks. We further show that structured generation follows ``\textbf{explore more but retain less}'', since early JSON errors are unrecoverable.

cs.AI