Multi-Step Tool-Calling over Korean Open Public APIs: A Benchmark and a Data-Synthesis Recipe

TL;DR

EDGE框架通过动态图合成数据,提升工具调用性能。

cs.AI 🔴 高级 2026-09-05 97 次浏览
Dain Kim Eungi Cho Kyumin Kim Shinyeong Noh Kyuseong Lim
数据主权 开源模型 工具调用 动态图 多步任务

核心发现

方法论

EDGE框架通过动态图合成工具调用数据,验证每个工具的依赖关系,并通过实际执行来筛选有效路径。使用GRPO对9B模型进行微调,显著提升了在KOPA-BENCH和BFCL基准上的表现。

关键结果

  • 在KOPA-BENCH上,微调后的9B模型pass@1提高了10个百分点,几乎达到未调优的27B模型水平。
  • 在BFCL基准上,微调模型在多轮任务上表现提升超过5个百分点。
  • 通过轨迹多样化,模型在pass@4上提高了11个百分点。

研究意义

研究解决了开源模型在多步工具调用中的性能不足问题,提供了一个新的基准和数据合成方法,推动了公共机构在数据主权下的开源模型应用。

技术贡献

EDGE框架通过实际执行验证工具依赖关系,提供了新的数据合成方法,显著提升了小型开源模型的性能,几乎达到大型架构的水平。

新颖性

首次提出了基于执行验证的动态图合成方法,与现有的工具调用数据集相比,提供了更可靠的多步任务解决方案。

局限性

  • EDGE框架依赖于实时API,可能受到API变动的影响。
  • 在某些情况下,模型可能无法处理高复杂度的任务。

未来方向

未来可以探索更广泛的API平台,扩展EDGE框架的应用范围,并优化模型在不同任务上的泛化能力。

AI 总览摘要

随着数据主权法规的加强,公共机构需要部署开源的本地大型语言模型来处理实时政府API。然而,现有的开源模型在多步工具调用中表现不佳。为解决这一问题,研究团队提出了韩国开放公共API基准(KOPA-BENCH)和EDGE框架。EDGE通过动态图合成工具调用数据,验证每个工具的依赖关系,并通过实际执行来筛选有效路径。微调后的9B模型在KOPA-BENCH和BFCL基准上表现显著提升,几乎达到未调优的27B模型水平。研究不仅提高了模型的性能,还为公共机构在数据主权下的开源模型应用提供了新的解决方案。未来的工作将扩展EDGE框架的应用范围,并优化模型在不同任务上的泛化能力。

深度分析

研究背景

随着数据主权法规的加强,公共机构需要在本地部署开源模型来处理实时政府API。然而,这些模型在多步工具调用中表现不佳,缺乏有效的基准来衡量性能差距。

核心问题

开源模型在多步工具调用中表现不佳,缺乏有效的基准来衡量性能差距。现有数据集无法有效处理韩国公共API的实时端点故障和高基数传递。

核心创新

EDGE框架通过动态图合成工具调用数据,验证每个工具的依赖关系,并通过实际执行来筛选有效路径。与现有方法相比,EDGE提供了更可靠的多步任务解决方案。

方法详解

  • �� 构建工具依赖图,验证每个工具的依赖关系。

  • �� 通过实际执行筛选有效路径。

  • �� 使用GRPO对模型进行微调,提升性能。

实验设计

实验使用KOPA-BENCH和BFCL基准,评估模型在多步任务上的表现。使用GRPO对9B模型进行微调,显著提升了在KOPA-BENCH和BFCL基准上的表现。

结果分析

微调后的9B模型在KOPA-BENCH上pass@1提高了10个百分点,几乎达到未调优的27B模型水平。在BFCL基准上,微调模型在多轮任务上表现提升超过5个百分点。

应用场景

EDGE框架可用于公共机构在数据主权下的开源模型应用,提升工具调用性能,支持实时政府API。

局限与展望

EDGE框架依赖于实时API,可能受到API变动的影响。在某些情况下,模型可能无法处理高复杂度的任务。

通俗解读 非专业人士也能看懂

想象一个厨房,EDGE就像一个厨师助手,帮助厨师在不同的锅具之间传递食材。每个锅具代表一个工具,食材是数据。EDGE确保每次传递都准确无误,最终做出一道完美的菜肴。这个过程就像在厨房中协调多个步骤,确保每个步骤都顺利进行。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,EDGE就像你的游戏助手,帮助你在不同的关卡之间传递道具。每个关卡代表一个工具,道具是数据。EDGE确保每次传递都准确无误,最终帮助你通关游戏。这个过程就像在游戏中协调多个步骤,确保每个步骤都顺利进行。

术语表

EDGE框架

一种通过动态图合成工具调用数据的方法,验证每个工具的依赖关系。

用于提升开源模型在多步任务中的性能。

KOPA-BENCH

韩国开放公共API基准,包含145个多步任务。

用于评估开源模型在多步任务中的表现。

GRPO

一种微调方法,用于提升模型性能。

用于微调EDGE框架生成的数据集。

动态图

一种通过实际执行验证工具依赖关系的方法。

用于合成工具调用数据。

多步任务

需要多个工具调用的任务。

EDGE框架用于提升多步任务的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在更多API平台上扩展EDGE框架的应用?
  • 2 如何优化模型在不同任务上的泛化能力?

应用场景

近期应用

公共机构应用

公共机构可以使用EDGE框架提升开源模型在数据主权下的工具调用性能。

远期愿景

全球API平台扩展

EDGE框架可以扩展到全球更多API平台,提升模型在不同任务上的泛化能力。

原文摘要

Data-sovereignty regulations increasingly require public institutions to deploy open-source, on-premise LLM agents that chain multiple tool-calls across live government APIs. However, open-source models consistently underperform in this multi-step setting, and no existing benchmark measures the gap. We introduce the Korean Open Public API Benchmark (KOPA-Bench), comprising 145 real-world tasks. To close this gap, we present EDGE, an Execution-grounded Dynamic Graph for tool-calling data synthEsis driven by live execution. EDGE builds a graph of how each tool's output can feed another's input, keeps only the links that succeed when actually called against the live APIs, and traverses these verified links to synthesize executable multi-step trajectories. Fine-tuned via GRPO on the resulting dataset, our 9B model nearly matches the untuned 27B model from the same family, improving substantially not only on KOPA-Bench but also on the BFCL benchmark.

cs.AI cs.CL