AgentFlux: Decoupled Fine-Tuning & Inference for On-Device Agentic Systems

TL;DR

提出AgentFlux,通过解耦微调提升本地模型工具调用准确率,达46%的提升。

cs.AI 🔴 高级 2025-10-01 44 次浏览
Rohan Kadekodi Zhan Jin Keisuke Kamahori Yile Gu Sean Khatiri Noah H. Bayindirli Sergey Gorbunov Baris Kasikci
AI微调 本地推理 工具调用 模型架构 层次调度

核心发现

方法论

本文提出解耦微调(decoupled fine-tuning)策略,利用LoRA(Low-Rank Adaptation)在模型后训练阶段分别为工具选择和参数生成创建专用适配器。通过分离两个子任务,采用不同的损失掩码实现针对性训练,提升工具调用的准确性。结合合成数据生成和自动化流程,训练出高效的工具选择和参数生成适配器。基于此,设计层次化调度(hierarchical orchestration)机制,动态加载适配器,优化工具集规模和模型响应速度。最终在MCP-Bench基准上,Qwen-2.5-7B模型经过解耦微调后,工具调用准确率提升46%,优于同规模及更大模型。

关键结果

  • 解耦微调显著改善工具调用准确率,Qwen-2.5-7B模型提升46%,在MCP-Bench上超越其他本地模型和部分前沿模型。实验显示,单纯prompt调优仅带来微弱提升,而解耦微调结合层次调度实现更优性能。模型在多工具集环境下保持高准确率,且推理延迟降低一半以上。
  • 在不同工具集(如文件系统、笔记应用)中,层次调度有效限制上下文长度,提升决策精度。实验证明,分任务微调和层次调度结合,能在保持模型轻量化的同时,显著增强工具调用能力。
  • 对比传统微调,解耦微调在工具调用任务中表现优越,特别是在大规模工具集和长上下文环境下,模型表现稳定,适应性强。

研究意义

该研究突破了本地模型在工具调用中的性能瓶颈,推动边缘设备上自主智能系统的实现。解决隐私保护和成本控制难题,为工业应用提供可行方案。通过解耦微调与层次调度,显著提升模型的任务适应性和可扩展性,为未来智能代理系统的普及奠定基础。这不仅丰富了模型微调策略,也推动了边缘AI的研究与实践,具有深远的行业影响。

技术贡献

技术创新在于引入解耦微调策略,将工具选择与参数生成任务分离,利用LoRA适配器实现任务专用化。结合合成数据自动生成流程,提升训练效率和多样性。提出层次化调度机制,有效缩短上下文长度,增强模型在大规模工具集中的表现。实现动态加载适配器,优化推理流程,降低延迟。整体架构在保证模型轻量的同时,大幅提升工具调用准确率,为边缘智能提供新思路。

新颖性

首次提出解耦微调结合层次调度的框架,专门针对本地模型在工具调用中的性能瓶颈。区别于传统微调方法,强调任务分解和模块化训练,解决大规模工具集下的上下文限制问题。这一策略在保持模型轻量的同时,显著提升了工具调用的准确性和效率,代表了边缘AI微调与调度的创新方向。

局限性

  • 当前方法依赖合成数据的质量,若生成数据偏差可能影响模型泛化能力。
  • 层次调度虽降低了上下文复杂度,但在极端多工具环境中仍存在调度复杂度增加的问题。
  • 模型微调和适配器加载存在一定的硬件和软件实现难度,可能限制在低端设备上的应用推广。

未来方向

未来将探索多任务联合训练策略,进一步优化微调效率。增强层次调度的自适应能力,支持更复杂的工具集和多模态输入。结合强化学习优化调度策略,实现更智能的工具选择。推动模型在实际边缘设备上的部署与应用,提升系统的鲁棒性和实用性。

AI 总览摘要

在智能代理系统中,工具调用能力一直是制约本地模型性能的关键瓶颈。传统微调方法难以同时优化工具选择和参数生成两个子任务,导致准确率不足。本文提出的AgentFlux框架,通过解耦微调策略,将模型微调分为两个专用适配器,分别负责工具选择和参数生成。利用合成数据自动生成训练样本,结合LoRA(Low-Rank Adaptation)技术,显著提升模型在工具调用任务中的表现。在此基础上,设计层次化调度机制,将工具集划分为子集,减少上下文长度,提升决策效率。实验证明,Qwen-2.5-7B模型经过解耦微调后,工具调用准确率提升46%,在MCP-Bench上优于同规模及更大模型。该方法不仅增强了模型的任务适应性,也降低了推理延迟,为边缘设备上的自主智能提供了新思路。未来,结合强化学习和多模态输入,AgentFlux有望实现更智能、更高效的本地代理系统,推动边缘AI的普及与应用。

深度分析

研究背景

随着大型语言模型(LLMs)在任务自动化中的广泛应用,基于模型的智能代理逐渐成为研究热点。早期工作如GPT-3、Llama系列主要关注模型规模和预训练策略,但在工具调用方面表现有限。近年来,出现支持外部工具调用的模型(如GPT-4、Qwen系列),推动了模型作为自主调度者的发展。标准协议如MCP(Model Context Protocol)推动了工具集成与交互,但本地模型在工具选择和参数生成方面仍存在性能瓶颈。传统微调和prompt调优虽有所改善,但在长上下文和大规模工具集环境中效果有限。边缘设备对隐私和成本的要求促使研究转向本地模型部署,然而性能差距依然明显。本文在此背景下,提出解耦微调和层次调度,旨在突破本地模型在工具调用中的瓶颈。

核心问题

核心问题在于本地模型在工具调用任务中的表现不足,尤其是在工具选择和参数生成两个环节。工具选择作为分类任务,受限于上下文长度和注意力机制,难以准确识别合适工具。参数生成则要求结构化输出,模型在复杂参数结构和长上下文中易出错。此外,长描述和多工具集增加了模型的负担,导致调用准确率低,延迟高。解决这些瓶颈对于实现隐私保护和成本控制的边缘智能系统至关重要。

核心创新

创新点包括:1)引入解耦微调,将工具选择和参数生成任务分离,利用LoRA适配器实现专用化,提升任务性能;2)利用合成数据自动生成训练样本,丰富多样,增强模型泛化;3)提出层次化调度机制,将工具集划分为子集,减少上下文长度,提升决策效率。这些创新区别于传统微调和端到端训练,强调模块化和任务分解,显著改善本地模型的工具调用能力,为边缘AI提供新路径。

方法详解

  • �� 利用gpt-4o自动生成多样化训练数据,覆盖所有工具及参数场景。
  • �� 通过模拟工具调用轨迹,提取训练样本,训练两个LoRA适配器:工具选择器和参数生成器。
  • �� 工具选择器负责分类任务,预测下一步调用的工具名,采用损失掩码只计算工具名部分。
  • �� 参数生成器针对每个工具,预测具体参数,损失只在参数部分。
  • �� 采用分层调度:先用基础模型进行高层工具集选择,再加载子集内的工具选择器,减少上下文复杂度。
  • �� 动态加载适配器,结合vLLM实现高效推理,支持多工具集环境。
  • �� 在MCP-Bench上进行大规模评估,验证准确率和延迟改善。

实验设计

采用MCP-Bench中的文件系统工具集,训练数据由gpt-4o生成,模型微调后在50个任务上测试。对比传统微调和prompt调优效果,验证解耦微调的性能提升。引入层次调度机制,评估不同工具集规模对模型性能的影响。指标包括工具调用准确率(ToolFit)和推理延迟。实验还包括不同模型(Qwen-2.5-7B、Llama-8B等)在相同策略下的表现对比,验证方法的普适性和优越性。

结果分析

解耦微调后,Qwen-2.5-7B模型在MCP-Bench上的工具调用准确率提升46%,显著优于未微调模型(16%)和传统微调(约20%)。层次调度有效缩短上下文长度,保持高准确率(超过70%),且推理延迟降低一半以上。多工具集环境下,模型表现稳定,适应性强。对比其他本地模型,解耦微调方案在工具调用精度和响应速度方面均优越,验证了其在实际边缘场景中的应用潜力。

应用场景

该技术适用于边缘设备上的智能助手、自动化办公、隐私敏感场景等。只需在本地部署微调模型,无需云端交互,保障数据隐私。可广泛应用于企业内部自动化、个人助理和工业控制等领域。未来结合多模态输入和强化学习,将实现更智能、更自主的边缘AI系统,推动行业数字化转型。

局限与展望

当前方法依赖合成数据质量,若生成偏差可能影响泛化能力。层次调度在极端大规模工具集时仍面临调度复杂度问题。模型微调和适配器加载存在硬件限制,推广到低端设备仍需优化。未来需解决多任务协同训练和多模态融合等挑战,以实现更广泛应用。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,厨房里有很多不同的工具,比如刀、锅、碗碟。每次做菜时,你需要先决定用哪个工具(比如用刀切菜),然后用它完成具体任务(比如切胡萝卜)。如果你每次都要重新思考用哪个工具,效率会很低。现在,科学家们让电脑学会像你一样,先快速决定用哪个工具,然后再用专门的“助手”帮忙准备工具的具体参数(比如刀的角度、大小)。他们还设计了一个“厨房管理系统”,可以把工具分类成不同的组(比如切菜组、炒菜组),每组有自己的助手,这样每次只需要考虑一小部分工具,效率就大大提高。这就像你在厨房里有不同的助手帮你,既快又准。这个方法让电脑在本地就能像专业厨师一样,快速、准确地调用各种工具,做出复杂的菜肴,既保护隐私,又节省成本。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你需要用很多不同的道具,比如剑、魔法棒、药水。每次打怪或完成任务,你都得选对道具,还得用正确的方法用它们。这很难对吧?科学家们也遇到类似的问题,他们让电脑学会像你一样,先决定用哪个道具,然后再用专门的“助手”帮忙准备好用的参数,比如用多大力气挥剑,或者魔法棒的魔法强度。为了让电脑更聪明,他们还把所有的道具分成不同的类别,比如武器组、魔法组,这样每次只需要考虑一小部分,就能更快做出决定。这就像你在游戏里有不同的队友帮你,每个队友专门负责一类任务,合作起来就特别快。这个方法让电脑在本地就能像高手一样,快速、准确地调用各种工具,完成复杂的任务,不用联网,也能保护你的隐私。是不是很酷?

术语表

LoRA(低秩适配)

一种在预训练模型基础上进行参数微调的技术,通过低秩矩阵调整模型参数,提升微调效率。

用于训练工具选择和参数生成的适配器,提升模型性能。

层次化调度(hierarchical orchestration)

一种多层次的调度策略,将工具集划分为子集,先进行高层决策,再细化选择,提高效率。

用于管理大量工具,减少上下文长度,优化模型响应。

MCP(模型上下文协议)

一种标准协议,用于定义语言模型与外部工具的交互接口。

本文中用于工具调用的标准框架。

合成数据(synthetic data)

由模型自动生成的训练样本,用于增强微调数据集的多样性。

用于训练工具选择和参数生成适配器。

ToolFit(工具调用适配度)

衡量模型工具调用准确率的指标,反映模型输出与期望调用的匹配程度。

在MCP-Bench评估中的关键指标。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升模型在极端长上下文环境下的工具调用能力仍待探索,尤其是在多模态输入和复杂任务场景中。
  • 2 现有方法在多工具集、多任务同时调度时的效率和鲁棒性仍有待优化,未来需结合强化学习等技术进行改进。

应用场景

近期应用

边缘设备智能助手

在手机、笔记本等设备上部署微调模型,支持隐私保护的自动化任务执行,无需云端依赖。

工业自动化控制

在工厂或现场设备中实现自主调度和工具调用,提高效率和安全性。

远期愿景

自主边缘AI系统

实现完全自主、智能的边缘设备,支持多模态输入、多任务协同,推动智能制造和智慧城市发展。

原文摘要

The deployment of Large Language Models (LLMs) as agentic orchestrators has revolutionized task automation, but the need for privacy-preserving, cost-effective solutions demands on-device inference capabilities. However, local LLMs consistently underperform compared to frontier models in tool calling scenarios, struggling with both tool selection from large tool sets and accurate argument generation for complex parameter structures. We introduce a methodology that disaggregates a tool-calling task into two distinct subtasks: tool selection and argument generation. We propose "decoupled fine-tuning", a novel post-training approach that employs LoRA fine-tuning to create dedicated LoRA adapters for tool selection and tool-specific argument generation using separate loss masking for each of the subtasks. Furthermore, we present AgentFlux, an inference framework that leverages the LoRA adapters created using decoupled fine-tuning to perform efficient agent orchestration with the help of local models on end-user devices. AgentFlux decomposes the tool-call generation step into tool selection and argument generation, and dynamically loads the corresponding LoRA adapters to generate tool calls. Additionally, AgentFlux implements hierarchical orchestration to restrict the number of tools required for tool selection. Our experiments on the MCP-Bench benchmark demonstrate that the Qwen-2.5-7B model trained using decoupled fine-tuning improves the tool calling accuracy of the base model by 46%, and outperforms other local reasoning, non-reasoning and fine-tuned models of similar size in all cases, and models that are 2x larger, in most cases.

cs.AI cs.LG