Data Turnstile: A Scalable Open Framework for Function-Calling Data Generation

TL;DR

Data Turnstile框架生成高质量函数调用数据,Qwen3-0.6B模型准确率提升至75.9%。

cs.CL 🟡 进阶级 2026-07-31 4 次浏览
Goutham Ramakrishnan Megha Sharma
小型语言模型 数据生成 函数调用 域适应 开源框架

核心发现

方法论

Data Turnstile通过分解多轮工具使用交互为有约束的逐步生成,结合验证和错误反馈循环,实现对API多样性、对话复杂度和输出正确性的精细控制。框架采用有向无环图(DAG)结构,确保每一步生成的质量。

关键结果

  • 在BFCL单轮基准测试中,使用Turnstile数据微调的Qwen3-0.6B模型准确率达到75.9%,相比启用思维的基础模型提高了8.5个百分点,接近Qwen3-1.7B和Qwen3-4B模型。
  • 在τ^2-bench多轮基准测试中,Turnstile训练的Qwen3-1.7B在电信领域通过率达到31.1%,提高了4.7倍,超过了Qwen2.5-32B-Instruct模型。
  • Turnstile数据生成的多样性和质量显著优于开源数据,尤其在工具调用顺序和结构多样性方面。

研究意义

Data Turnstile框架为小型语言模型提供了生成高质量训练数据的方法,解决了数据稀缺和噪声问题,显著提高了模型在函数调用任务中的表现。这一研究为边缘设备上的语言模型部署提供了新的可能性,降低了成本和延迟。

技术贡献

该框架通过逐步生成和验证机制,避免了大型语言模型的依赖,能够在本地执行,快速迭代。它提供了生成多样化和高质量数据的方法,适用于不同领域的API定义,增强了小型语言模型的工具调用能力。

新颖性

Data Turnstile首次提出将多轮交互分解为有约束的逐步生成,并通过错误反馈循环提高数据质量,与现有的单次生成方法相比具有显著优势。

局限性

  • 该框架在处理非常复杂的多轮交互时,生成失败率较高,尤其是在并行调用多个API时。
  • 生成的数据质量依赖于模板的设计,可能无法涵盖所有真实场景。

未来方向

未来研究可以探索如何进一步提高生成复杂交互的成功率,以及如何扩展框架以支持更多类型的API和交互场景。

AI 总览摘要

Data Turnstile是一个开源框架,用于生成高质量的函数调用数据,特别适用于小型语言模型。现有的小型语言模型在工具使用任务中面临数据稀缺和噪声问题,导致性能受限。Data Turnstile通过分解多轮交互为有约束的逐步生成,并结合验证和错误反馈循环,实现对生成质量的精细控制。

实验结果表明,使用Turnstile数据微调的小型语言模型在BFCL和τ^2-bench基准测试中表现优异,准确率和通过率显著提高,甚至超过了更大的模型。这一框架为小型语言模型的边缘部署提供了新的可能性,降低了成本和延迟,同时提高了数据隐私。

尽管如此,该框架在处理非常复杂的交互时仍面临挑战,未来研究可以探索如何进一步提高生成复杂交互的成功率,以及如何扩展框架以支持更多类型的API和交互场景。

深度分析

研究背景

随着语言模型的不断发展,小型语言模型因其低延迟、低成本和数据隐私优势而受到关注。然而,它们在工具使用任务中面临数据稀缺和噪声问题,导致性能受限。现有的大型语言模型可以通过容量弥补低质量监督的不足,而小型模型则需要高质量的数据支持。

核心问题

小型语言模型在工具使用任务中面临数据稀缺和噪声问题,无法像大型模型那样通过容量弥补低质量监督的不足。数据质量成为训练小型语言模型的关键瓶颈,亟需一种能够生成高质量训练数据的方法。

核心创新

Data Turnstile框架通过分解多轮交互为有约束的逐步生成,并结合验证和错误反馈循环,提高数据质量。它采用有向无环图(DAG)结构,确保每一步生成的质量,并支持本地执行和快速迭代。

方法详解

  • �� 将多轮交互分解为有向无环图(DAG)结构,定义用户查询、推理轨迹、API调用、执行输出和助手响应等角色。
  • �� 每个角色独立生成,结合验证和错误反馈循环,提高生成质量。
  • �� 通过模板设计实现数据的多样性和质量控制。

实验设计

实验在BFCL和τ^2-bench基准测试上进行,使用不同规模的小型语言模型进行微调。评估指标包括准确率和通过率,比较了不同数据源和生成方法的影响。

结果分析

使用Turnstile数据微调的Qwen3-0.6B模型在BFCL单轮基准测试中准确率达到75.9%,在τ^2-bench多轮基准测试中通过率达到31.1%,显著超过了更大的模型。

应用场景

该框架适用于生成不同领域的API定义数据,增强小型语言模型的工具调用能力,适用于边缘设备部署,降低成本和延迟。

局限与展望

该框架在处理非常复杂的多轮交互时,生成失败率较高,尤其是在并行调用多个API时。生成的数据质量依赖于模板的设计,可能无法涵盖所有真实场景。

通俗解读 非专业人士也能看懂

想象一个厨房,Data Turnstile就像一个智能厨师助手。它会根据食谱分步骤准备食材,确保每一步都准确无误。如果某步出错,它会及时纠正,保证最终菜品的质量。这样,即使是小厨房也能做出美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,Data Turnstile就像一个超级助手,帮你一步步完成任务。它会检查每个步骤是否正确,如果有错误,它会帮你纠正。这样,你就能轻松赢得比赛!是不是很酷?

术语表

API (应用程序接口)

API是应用程序之间的接口,允许它们交换数据和功能。

在论文中,API是生成数据的核心对象。

DAG (有向无环图)

DAG是一种图结构,没有循环,适用于表示依赖关系。

用于分解多轮交互为逐步生成。

CoT (思维链)

CoT是推理的一种方法,通过分步思考解决问题。

用于评估模型的推理能力。

SLM (小型语言模型)

SLM是参数较少的语言模型,适用于边缘设备。

研究对象,面临数据稀缺问题。

BFCL (伯克利函数调用排行榜)

BFCL是评估模型工具调用能力的基准测试。

用于评估框架生成数据的效果。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提高复杂交互的生成成功率?
  • 2 如何扩展框架以支持更多类型的API?

应用场景

近期应用

边缘设备部署

小型语言模型可在边缘设备上部署,降低成本和延迟。

客户服务应用

生成高质量数据可用于训练客服机器人,提高响应准确性。

远期愿景

跨领域工具使用

框架可扩展至更多领域,支持复杂工具使用场景。

原文摘要

Small language models (SLMs) are attractive for agentic deployment due to low latency, reduced cost, and on-device privacy, yet they struggle with tool-use tasks where training data is scarce and noisy. Unlike larger models, SLMs cannot compensate for low-quality supervision through sheer capacity, making data quality the critical bottleneck. We present Data Turnstile, an open-source framework that takes user-defined API specifications and generates high-quality synthetic training data for function calling. Turnstile decomposes multi-turn tool-use interactions into constrained, stepwise generation with validation and error-feedback loops, providing fine-grained control over API diversity, conversation complexity, and output correctness. We demonstrate effectiveness of domain adaptation with Turnstile data on two challenging function calling benchmarks. On the BFCL single-turn benchmark, a Qwen3-0.6B fine-tuned on Turnstile data without chain-of-thought achieves 75.9% overall accuracy (versus 67.4% for the base model with thinking enabled), closing the gap with thinking-enabled Qwen3-1.7B (78.4%) and Qwen3-4B (79.9%) despite being 3$\times$ and 7$\times$ smaller respectively. On $τ^2$-bench, a multi-turn agentic benchmark, Turnstile-trained Qwen3-1.7B achieves 31.1% pass^1 on the Telecom domain, improving 4.7$\times$ over its 6.6% base and surpassing Qwen2.5-32B-Instruct (27.4%), a model 19$\times$ larger. Turnstile-trained Qwen3-0.6B achieves 24.6%, improving 7$\times$ over its 3.5% base and approaching the 32B model (53$\times$ larger). We release Data Turnstile along with a dataset spanning 1,000+ APIs and 100K+ multi-turn interactions.

cs.CL