核心发现
方法论
Data Turnstile通过分解多轮工具使用交互为有约束的逐步生成,结合验证和错误反馈循环,实现对API多样性、对话复杂度和输出正确性的精细控制。框架采用有向无环图(DAG)结构,确保每一步生成的质量。
关键结果
- 在BFCL单轮基准测试中,使用Turnstile数据微调的Qwen3-0.6B模型准确率达到75.9%,相比启用思维的基础模型提高了8.5个百分点,接近Qwen3-1.7B和Qwen3-4B模型。
- 在τ^2-bench多轮基准测试中,Turnstile训练的Qwen3-1.7B在电信领域通过率达到31.1%,提高了4.7倍,超过了Qwen2.5-32B-Instruct模型。
- Turnstile数据生成的多样性和质量显著优于开源数据,尤其在工具调用顺序和结构多样性方面。
研究意义
Data Turnstile框架为小型语言模型提供了生成高质量训练数据的方法,解决了数据稀缺和噪声问题,显著提高了模型在函数调用任务中的表现。这一研究为边缘设备上的语言模型部署提供了新的可能性,降低了成本和延迟。
技术贡献
该框架通过逐步生成和验证机制,避免了大型语言模型的依赖,能够在本地执行,快速迭代。它提供了生成多样化和高质量数据的方法,适用于不同领域的API定义,增强了小型语言模型的工具调用能力。
新颖性
Data Turnstile首次提出将多轮交互分解为有约束的逐步生成,并通过错误反馈循环提高数据质量,与现有的单次生成方法相比具有显著优势。
局限性
- 该框架在处理非常复杂的多轮交互时,生成失败率较高,尤其是在并行调用多个API时。
- 生成的数据质量依赖于模板的设计,可能无法涵盖所有真实场景。
未来方向
未来研究可以探索如何进一步提高生成复杂交互的成功率,以及如何扩展框架以支持更多类型的API和交互场景。
AI 总览摘要
Data Turnstile是一个开源框架,用于生成高质量的函数调用数据,特别适用于小型语言模型。现有的小型语言模型在工具使用任务中面临数据稀缺和噪声问题,导致性能受限。Data Turnstile通过分解多轮交互为有约束的逐步生成,并结合验证和错误反馈循环,实现对生成质量的精细控制。
实验结果表明,使用Turnstile数据微调的小型语言模型在BFCL和τ^2-bench基准测试中表现优异,准确率和通过率显著提高,甚至超过了更大的模型。这一框架为小型语言模型的边缘部署提供了新的可能性,降低了成本和延迟,同时提高了数据隐私。
尽管如此,该框架在处理非常复杂的交互时仍面临挑战,未来研究可以探索如何进一步提高生成复杂交互的成功率,以及如何扩展框架以支持更多类型的API和交互场景。
深度分析
研究背景
随着语言模型的不断发展,小型语言模型因其低延迟、低成本和数据隐私优势而受到关注。然而,它们在工具使用任务中面临数据稀缺和噪声问题,导致性能受限。现有的大型语言模型可以通过容量弥补低质量监督的不足,而小型模型则需要高质量的数据支持。
核心问题
小型语言模型在工具使用任务中面临数据稀缺和噪声问题,无法像大型模型那样通过容量弥补低质量监督的不足。数据质量成为训练小型语言模型的关键瓶颈,亟需一种能够生成高质量训练数据的方法。
核心创新
Data Turnstile框架通过分解多轮交互为有约束的逐步生成,并结合验证和错误反馈循环,提高数据质量。它采用有向无环图(DAG)结构,确保每一步生成的质量,并支持本地执行和快速迭代。
方法详解
- �� 将多轮交互分解为有向无环图(DAG)结构,定义用户查询、推理轨迹、API调用、执行输出和助手响应等角色。
- �� 每个角色独立生成,结合验证和错误反馈循环,提高生成质量。
- �� 通过模板设计实现数据的多样性和质量控制。
实验设计
实验在BFCL和τ^2-bench基准测试上进行,使用不同规模的小型语言模型进行微调。评估指标包括准确率和通过率,比较了不同数据源和生成方法的影响。
结果分析
使用Turnstile数据微调的Qwen3-0.6B模型在BFCL单轮基准测试中准确率达到75.9%,在τ^2-bench多轮基准测试中通过率达到31.1%,显著超过了更大的模型。
应用场景
该框架适用于生成不同领域的API定义数据,增强小型语言模型的工具调用能力,适用于边缘设备部署,降低成本和延迟。
局限与展望
该框架在处理非常复杂的多轮交互时,生成失败率较高,尤其是在并行调用多个API时。生成的数据质量依赖于模板的设计,可能无法涵盖所有真实场景。
通俗解读 非专业人士也能看懂
想象一个厨房,Data Turnstile就像一个智能厨师助手。它会根据食谱分步骤准备食材,确保每一步都准确无误。如果某步出错,它会及时纠正,保证最终菜品的质量。这样,即使是小厨房也能做出美味佳肴。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,Data Turnstile就像一个超级助手,帮你一步步完成任务。它会检查每个步骤是否正确,如果有错误,它会帮你纠正。这样,你就能轻松赢得比赛!是不是很酷?
术语表
API (应用程序接口)
API是应用程序之间的接口,允许它们交换数据和功能。
在论文中,API是生成数据的核心对象。
DAG (有向无环图)
DAG是一种图结构,没有循环,适用于表示依赖关系。
用于分解多轮交互为逐步生成。
CoT (思维链)
CoT是推理的一种方法,通过分步思考解决问题。
用于评估模型的推理能力。
SLM (小型语言模型)
SLM是参数较少的语言模型,适用于边缘设备。
研究对象,面临数据稀缺问题。
BFCL (伯克利函数调用排行榜)
BFCL是评估模型工具调用能力的基准测试。
用于评估框架生成数据的效果。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提高复杂交互的生成成功率?
- 2 如何扩展框架以支持更多类型的API?
应用场景
近期应用
边缘设备部署
小型语言模型可在边缘设备上部署,降低成本和延迟。
客户服务应用
生成高质量数据可用于训练客服机器人,提高响应准确性。
远期愿景
跨领域工具使用
框架可扩展至更多领域,支持复杂工具使用场景。
原文摘要
Small language models (SLMs) are attractive for agentic deployment due to low latency, reduced cost, and on-device privacy, yet they struggle with tool-use tasks where training data is scarce and noisy. Unlike larger models, SLMs cannot compensate for low-quality supervision through sheer capacity, making data quality the critical bottleneck. We present Data Turnstile, an open-source framework that takes user-defined API specifications and generates high-quality synthetic training data for function calling. Turnstile decomposes multi-turn tool-use interactions into constrained, stepwise generation with validation and error-feedback loops, providing fine-grained control over API diversity, conversation complexity, and output correctness. We demonstrate effectiveness of domain adaptation with Turnstile data on two challenging function calling benchmarks. On the BFCL single-turn benchmark, a Qwen3-0.6B fine-tuned on Turnstile data without chain-of-thought achieves 75.9% overall accuracy (versus 67.4% for the base model with thinking enabled), closing the gap with thinking-enabled Qwen3-1.7B (78.4%) and Qwen3-4B (79.9%) despite being 3$\times$ and 7$\times$ smaller respectively. On $τ^2$-bench, a multi-turn agentic benchmark, Turnstile-trained Qwen3-1.7B achieves 31.1% pass^1 on the Telecom domain, improving 4.7$\times$ over its 6.6% base and surpassing Qwen2.5-32B-Instruct (27.4%), a model 19$\times$ larger. Turnstile-trained Qwen3-0.6B achieves 24.6%, improving 7$\times$ over its 3.5% base and approaching the 32B model (53$\times$ larger). We release Data Turnstile along with a dataset spanning 1,000+ APIs and 100K+ multi-turn interactions.