ToolPRM: Fine-Grained Inference Scaling of Structured Outputs for Function Calling
ToolPRM通过细粒度内部调用决策评分,提升结构化函数调用的推理性能。
核心发现
方法论
本文提出基于细粒度步骤的过程奖励模型ToolPRM,结合细粒度束搜索,优化结构化函数调用的推理。通过函数掩码、逐步采样和逐步标注,构建了首个细粒度内部调用监督数据集。ToolPRM利用状态转移机制,将函数调用过程划分为选择函数名、参数名、参数值等多个决策步骤,训练奖励模型以评估每个步骤的正确性。结合该模型的指导,采用探索更多但保留更少的推理策略,有效提升了多项函数调用基准的性能。
关键结果
- ToolPRM在预测准确率方面优于Outcome Reward Model(ORM)和粗粒度奖励模型(C-PRM),在训练集上步骤准确率达99.11%,轨迹准确率99.38%。在BFCL和ToolAlpaca基准上,ToolPRM显著优于其他推理扩展策略,尤其在较小模型(如Hammer2.1-1.5B)上提升明显,表现出较强的边缘计算适应性。
- 在推理扩展方面,ToolPRM结合大规模束搜索(beam width M)和少量保留(N)策略,验证了“探索更多但保留更少”的原则,有效避免早期JSON错误无法修正的问题。实验显示,ToolPRM在不同模型规模(如7B、20B)上均实现了性能提升,尤其在模型较小或边缘设备场景中表现优越。
- 通过对比不同奖励模型的预测性能,ToolPRM在训练过程中保持较低的损失(0.0286)和较高的轨迹整体准确率,验证了其在细粒度奖励建模中的优越性,为结构化输出的推理扩展提供了新的技术路径。
研究意义
该研究突破了结构化输出中推理扩展的瓶颈,提出“探索更多但保留更少”的原则,强调在结构化任务中早期错误不可修正的特性。通过细粒度奖励模型,显著提升了函数调用的准确性和鲁棒性,为大模型在复杂任务中的应用提供了理论基础和实用工具。该方法不仅改善了推理效率,也为未来多阶段、多步骤的结构化任务优化提供了新思路,具有重要的学术价值和工业应用潜力。
技术贡献
技术上,本文首次提出细粒度的内部调用过程奖励模型ToolPRM,结合状态转移机制,将函数调用拆解为多个决策步骤,训练奖励模型以逐步评估正确性。创新点包括:1)构建细粒度标注数据集,2)设计状态转移模型,3)结合束搜索实现“探索更多但保留更少”的推理策略。该方法显著优于传统的整体奖励和粗粒度奖励模型,提供了更精细的优化手段和理论保证,为结构化输出的推理扩展提供了新范式。
新颖性
本研究首次实现了针对结构化函数调用的细粒度过程奖励机制,突破了以往仅对整体调用进行奖励的限制。不同于传统的粗粒度奖励模型,ToolPRM在每个决策点提供明确的正负反馈,有效避免早期错误无法修正的问题。其创新在于将推理过程拆解为多个可控步骤,结合状态转移和束搜索策略,显著提升了模型的推理能力和鲁棒性。这一方法为结构化任务中的推理扩展提供了全新思路,具有较高的学术创新性。
局限性
- 该方法依赖于高质量的细粒度标注数据,数据采集和标注成本较高,且在极端复杂场景下可能仍存在误判风险。
- 早期JSON格式错误一旦发生,后续修正难度大,影响整体性能,限制了在某些高错误率环境中的适用性。
- 模型训练和推理过程中计算成本较高,尤其在大规模束搜索时,可能影响实时性和边缘部署的可行性。
未来方向
未来将探索更高效的标注策略,减少数据依赖,同时结合自监督和迁移学习提升模型泛化能力。此外,将尝试引入动态调整束宽和保留策略,以适应不同任务复杂度和硬件环境,推动结构化推理的实用化和普及。
AI 总览摘要
大规模语言模型(LLMs)在函数调用任务中展现出强大能力,但其推理扩展仍面临挑战。传统方法多关注整体调用的奖励,忽视了调用过程中的细粒度决策,导致早期错误难以修正,影响整体性能。本文提出ToolPRM,一种结合细粒度步骤评分的过程奖励模型,通过函数掩码、逐步采样和逐步标注,构建了首个细粒度内部调用监督数据集。该模型将函数调用拆解为选择函数名、参数名、参数值等多个决策步骤,训练奖励模型以逐步评估正确性。结合状态转移机制和束搜索策略,推动“探索更多但保留更少”的推理原则,有效避免早期错误积累,显著提升多项函数调用基准的性能。实验结果显示,ToolPRM在不同模型规模上均优于传统奖励模型,尤其在边缘设备场景中表现优越。这一方法为结构化输出的推理扩展提供了新思路,具有重要的学术价值和工业应用潜力。未来将继续优化标注效率,提升模型泛化能力,推动结构化推理的广泛应用。
深度分析
研究背景
近年来,大型语言模型(LLMs)在自然语言理解和生成任务中取得突破,尤其在多任务、多模态场景中展现出强大能力。函数调用作为连接外部系统的重要接口,已成为提升模型实用性的关键方向。早期研究如OpenAI的Codex和GPT-4在代码和API调用方面取得显著成效,但仍存在调用准确性不足、推理复杂度高等问题。传统方法多采用整体奖励机制,忽略调用过程中的中间决策,限制了模型的优化空间。近年来,奖励模型(Reward Models, RMs)逐渐引入,用于引导模型生成更符合预期的调用序列,但多为粗粒度评估,难以捕捉调用中的细节错误。推理扩展策略如Beam Search和Monte Carlo Tree Search(MCTS)在无结构任务中表现优异,但在结构化调用中早期错误难以修正,限制了其效果。
核心问题
结构化函数调用的核心问题在于其多步骤、多决策的复杂性。早期决策错误(如函数名或参数填写错误)会导致整个调用流程失效,无法通过后续修正弥补。这使得传统的推理扩展策略在结构化任务中效果有限,尤其在JSON格式严格要求的场景下,错误一旦发生便不可逆转。此外,现有奖励模型多为整体评估,缺乏对中间步骤的细粒度指导,难以实现高效优化。如何在保证调用正确性的同时,提升推理效率,成为亟待解决的问题。
核心创新
本研究的核心创新在于提出细粒度的内部调用过程奖励模型ToolPRM,将函数调用拆解为多个决策步骤(选择函数名、参数名、参数值等),并为每个步骤设计明确的正负标签。通过函数掩码和逐步采样,构建了高质量的细粒度监督数据集。结合状态转移机制,将调用过程建模为一系列状态转换,训练奖励模型以逐步评估每个决策的正确性。采用束搜索策略,遵循“探索更多但保留更少”的原则,有效避免早期错误积累,显著提升结构化调用的准确率。这一方法突破了传统整体奖励的局限,为结构化推理提供了更细粒度、更高效的优化路径。
方法详解
- �� 数据采集:利用xlam-function-calling-60k和xlam-irrelevance-7.5k数据集,通过函数掩码技术引入模糊性,增强模型鲁棒性。
- �� 逐步采样:采用策略模型(如Hammer2.1-3B)生成函数调用,自动标注每个步骤的正确性标签(如<FUNC_NAM E>、<ARG_VALUE>等)。
- �� 状态转移:定义五个状态(初始、选择函数名、选择参数名、填写参数值、终止),每次决策由奖励模型评估。
- �� 训练ToolPRM:基于标注的轨迹数据,训练奖励模型预测每个步骤的正确性标签(+/-),优化其参数。
- �� 推理策略:结合束搜索,利用ToolPRM的细粒度评分,扩大探索范围(增加束宽M),同时缩小保留(N),实现“探索更多但保留更少”。
实验设计
采用xlam-function-calling-60k和xlam-irrelevance-7.5k数据集进行训练和验证,构建了包含超过50万样本的细粒度标注数据。在BFCL和ToolAlpaca两个基准上评估模型性能,比较ToolPRM、ORM和C-PRM的预测准确率。通过不同模型(7B、20B)和推理策略(不同束宽)进行测试,分析模型在不同场景下的表现。实验还包括对奖励模型的训练曲线和误差分析,验证其在多步骤推理中的优势。
结果分析
ToolPRM在预测准确率方面优于ORM(0.0536损失)和C-PRM(0.0371损失),在轨迹整体准确率上达99.38%。在BFCL和ToolAlpaca基准中,ToolPRM结合束搜索策略显著提升模型性能,尤其在较小模型(如Hammer2.1-1.5B)上,性能提升明显,达到了与更大模型相当的水平。实验还验证了“探索更多但保留更少”的原则,有效避免早期错误导致的整体失败。这些结果表明,细粒度奖励模型在结构化推理任务中具有巨大潜力。
应用场景
该方法适用于需要高精度结构化调用的工业场景,如智能助手、自动化API调用、数据集成等。通过提升调用准确率,减少错误传递,增强系统鲁棒性。未来可结合边缘设备优化,推动在移动端、边缘计算环境中的应用,实现更智能、更可靠的自动化系统。
局限与展望
该方法依赖大量高质量标注数据,数据采集成本较高。在极端复杂或高错误率场景下,早期错误仍难以完全避免,影响整体性能。此外,推理过程中计算成本较大,尤其在大规模束搜索时,可能限制实时性和边缘部署的可行性。未来需优化标注流程和模型效率。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,每一道菜都需要按照特定步骤来完成。比如,先准备食材、然后调味、最后装盘。如果你在某个步骤出了错,比如放错了调料,整个菜就可能变得不好吃。传统的厨师可能会尝试多次修正,但如果错误太早发生,后续就难以挽回。本文的方法就像给厨师一套细致的指南,告诉他每一步都要检查,确保每个决定都正确。这样,即使出错,也能及时发现和修正,做出更美味的菜。这种细致的指导帮助厨师在复杂的菜肴制作中更有把握,也让厨房工作变得更高效、更可靠。
简单解释 像给14岁少年讲一样
想象你在玩一款游戏,每次你要做很多决定,比如选择角色、装备、技能。每个决定都很重要,如果你选错了,可能会输掉比赛。以前的游戏只会看你最后的成绩,但如果你能在每一步都给你打分,告诉你哪个决定是对的,哪个是错的,就能帮你变得更厉害。这个研究就像是给游戏增加了一个“聪明的教练”,让它在你每个选择时都能给出建议和评分。这样,游戏就能帮你不断改正错误,变得更厉害。特别是在复杂的任务中,这个方法能让AI更聪明、更可靠,避免早期的错误导致全部失败。
原文摘要
Large language models (LLMs) excel at function calling, but inference scaling has been explored mainly for unstructured generation. We propose an inference-scaling framework for structured outputs that combines fine-grained beam search with \textbf{ToolPRM}, a process reward model scoring each intra-call decision (function name and argument filling). We build the first fine-grained intra-call supervision dataset via function masking, rollout collection, and step-level annotation. ToolPRM outperforms outcome and coarse-grained reward models in predictive accuracy and yields consistent test-time gains on multiple function-calling benchmarks. We further show that structured generation follows ``\textbf{explore more but retain less}'', since early JSON errors are unrecoverable.