SynAE: A Framework for Measuring the Quality of Synthetic Data for Tool-Calling Agent Evaluations

TL;DR

SynAE通过多维指标评估合成数据的有效性、保真度和多样性,提升工具调用代理的评估质量。

cs.CL 🔴 高级 2026-05-21 38 次浏览
Shuaiqi Wang Aadyaa Maddi Zinan Lin Giulia Fanti
人工智能 合成数据 评估框架 多轮对话 工具调用

核心发现

方法论

SynAE采用多指标评估框架,结合任务指令、响应、工具调用和最终输出,利用LLM作为判别者,衡量合成数据的有效性、保真度和多样性。指标包括Validity Rate、Key Node Dependency、Attribute Match、KNN-Precision、FID等,覆盖结构和语义相似性。通过控制生成方案(如空白填充、过采样、上下文生成)模拟常见合成缺陷,验证指标敏感性。实验在T1、BFCL、ACP等基准数据集上,展示SynAE能细粒度捕捉合成数据的质量变化。

关键结果

  • SynAE在T1数据集上成功检测到不同空白填充概率p(0.1-0.9)引起的语义退化,KNN-Precision从接近1下降到0,说明指标对质量变化敏感。
  • 过采样比例r(0.1-0.9)增加导致输出KNN-Recall显著下降,验证指标能反映多样性降低。
  • 在行业标准NeMo合成工具下,SynAE准确识别合成数据在保真度和多样性上的退化,验证其实用性。

研究意义

该框架弥补了当前合成数据评估缺乏系统性和细粒度指标的空白,为工具调用代理的预部署评估提供科学依据。通过多维指标体系,能全面衡量合成数据的真实性、丰富性和实用性,有助于提升大规模语言模型在实际应用中的可靠性和安全性。

技术贡献

提出多指标融合的评估体系,结合结构化语义匹配、分布距离和多样性指标,突破单一指标的局限。引入LLM作为判别者,增强了评估的语义理解能力。设计控制生成方案模拟真实场景中的合成缺陷,验证指标的敏感性和适用性。实现跨数据集的通用性和扩展性,为合成数据质量评价提供新工具。

新颖性

首次系统性提出多维度评估合成数据质量,特别是在多轮工具调用场景中,结合结构和语义指标,超越传统单一指标的局限。引入LLM判别机制,提升评估的语义一致性,是本研究的核心创新。

局限性

  • 目前指标对极端合成缺陷(如严重语义偏差)敏感度有限,未来需引入更强的语义理解模型。
  • 评估依赖预定义属性和任务场景,泛化到新领域仍需验证。
  • 部分指标计算成本较高,影响大规模应用的效率。

未来方向

未来将结合自监督学习和多模态信息,提升指标的鲁棒性和泛化能力,探索实时评估机制。同时,计划扩展多任务、多领域的评估体系,支持更复杂的工具调用场景,为工业实践提供更全面的工具链。

AI 总览摘要

随着大规模语言模型和工具调用系统的快速发展,如何科学评估合成数据的质量成为关键问题。当前,评估多轮对话和工具调用的合成数据多依赖单一指标,难以全面反映其真实性和多样性。本文提出SynAE框架,融合多维指标体系,系统性衡量合成数据在结构、语义和多样性上的表现。通过引入LLM作为判别者,结合结构依赖、分布距离和信息熵指标,SynAE能够敏锐捕捉合成数据的细节变化。实验在多个公开基准数据集上验证了其有效性,成功识别不同合成缺陷,展现出优异的适应性和鲁棒性。该方法不仅为工具调用代理的预部署评估提供了科学依据,也为未来合成数据的质量控制奠定了基础。未来,结合多模态信息和自监督技术,SynAE有望实现实时、全流程的质量监控,推动工业界在安全、隐私和性能方面的持续优化。

深度分析

研究背景

随着大模型在自然语言处理中的广泛应用,合成数据成为训练和评估的重要资源。传统评估方法多关注单一指标,如准确率或BLEU分数,难以全面反映多轮交互和工具调用的复杂性。近年来,学界提出多种结构化评估框架,但缺乏系统性、多维度的指标体系,难以应对真实场景中的多样性和复杂性。行业内也逐渐认识到合成数据的质量直接影响模型的可靠性和安全性,亟需一套科学、全面的评估工具。本研究在此背景下,提出了SynAE框架,旨在弥补现有方法的不足,推动合成数据在实际应用中的广泛采用。

核心问题

当前合成数据评估多依赖单一指标,不能同时衡量数据的真实性、多样性和实用性。尤其在多轮工具调用场景中,缺乏系统性指标,导致模型性能难以准确反映。行业内缺少统一的评估标准,难以比较不同合成方法的优劣。现有指标对结构和语义的敏感度不足,无法捕捉细粒度的质量变化。解决这一问题,要求开发多维指标体系,结合结构、语义和多样性,全面评估合成数据的质量。

核心创新

本研究的核心创新在于:

1)提出多指标融合的评估框架,涵盖有效性、保真度和多样性,弥补单一指标的不足;

2)引入LLM作为判别者,提升语义理解能力,增强评估的准确性;

3)设计控制生成方案(如空白填充、过采样、上下文生成),模拟真实缺陷,验证指标敏感性;

4)实现跨数据集的适用性,支持多轮、多任务场景的评估。该方法结合结构和语义指标,突破传统评估的局限,为合成数据质量控制提供新思路。

方法详解

  • �� 输入:真实数据集和合成数据集,支持缺失响应或工具调用。
  • �� 结构指标:利用Key Node Dependency和Attribute Match,衡量指令-响应关系和属性一致性。
  • �� 语义指标:采用KNN-Precision、FID,评估文本相似性和分布距离。
  • �� 多样性指标:使用Vendi Score和Attribute Diversity,衡量样本间差异。
  • �� 控制方案:设计空白填充、过采样、上下文生成和无效化方案,模拟不同缺陷。
  • �� 评估流程:结合LLM判别,计算Validity Rate、Fidelity、Diversity,输出多维指标。

实验设计

在T1、BFCL、ACP等公开数据集上,采用行业标准NeMo合成工具,调节参数(如p、r、k)模拟不同缺陷。对比不同合成方案的指标表现,验证SynAE的敏感性和鲁棒性。实验还包括不同模型(GPT-4、Llama)和不同指标组合的效果分析,确保指标的全面性和实用性。

结果分析

SynAE能准确检测空白填充比例p的变化,KNN-Precision从接近1降至0,反映语义退化。过采样比例r增加,输出KNN-Recall显著下降,验证多样性指标的敏感性。行业工具NeMo生成的合成数据中,SynAE成功识别出质量退化,验证其在实际场景中的应用潜力。整体上,指标体系能细粒度反映合成数据的质量变化,为后续优化提供依据。

应用场景

该框架适用于工业界在模型部署前的合成数据质量检测,确保模型在实际环境中的可靠性。可用于自动化监控合成数据生成流程,提升模型安全性和隐私保护。未来,结合实时监控和多模态信息,将实现全流程的质量控制,推动智能系统的安全落地。

局限与展望

目前指标对极端缺陷的敏感度有限,复杂场景下的多模态评估尚未实现。计算成本较高,限制大规模应用。未来需优化算法效率,扩展多任务、多模态支持,提升指标的普适性和实用性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,生产各种玩具。每个玩具都要符合一定的标准,比如外形、颜色和功能。现在,工厂用机器自动制造玩具,但有时候机器会出错,生产出不符合标准的玩具。为了确保玩具质量,工厂需要一套检测系统,能判断每个玩具是否合格。这个检测系统会检查玩具的外观、功能是否正常,还会比较不同玩具的多样性,确保没有太多一样的。SynAE就像这个检测系统,它用多种方法检查合成数据的“质量”,确保这些数据既真实又丰富,能帮助模型更好地学习和测试。它不仅看外表,还会用智能“眼睛”判断内容是否合理,确保合成数据像真实一样,能用在各种复杂场景中。

简单解释 像给14岁少年讲一样

想象你在学校里,老师让你写作文,但你可以用电脑帮忙。你写完后,老师会检查你的作文是不是符合要求,内容是不是丰富,句子是不是多样。现在,很多AI模型也是这样,它们用大量的“作文”来学习。为了确保这些“作文”质量高,科学家们开发了一个叫SynAE的“作文检查器”。它会用不同的标准,比如内容是否合理、句子是否丰富、主题是否多样,来评估这些合成的“作文”。它还能模拟一些写作中的问题,比如内容重复或不符合题意,测试检测器的敏感度。这样,AI模型就能用更高质量的数据学习,变得更聪明、更可靠。就像老师用多种方法检查你的作文一样,SynAE用多维指标确保合成数据的“作文”都符合标准,帮助AI更好地成长。

原文摘要

Today, tool-calling agents are commonly evaluated or tested on static datasets of execution traces, including input commands, agent responses, and associated tool calls. However, internal production datasets are often insufficient or unusable for testing; for example, they may contain sensitive or proprietary data, or they may be too sparse to support comprehensive testing (especially pre-deployment). In these settings, practitioners are increasingly replacing or augmenting real datasets with synthetic ones for evaluation purposes. A key challenge is quantifying the relation between these synthetic datasets and the real data. We introduce SynAE, an evaluation framework for assessing how well synthetic benchmarks for multi-turn, tool-calling agents replicate and augment the characteristics of real data trajectories. SynAE assesses the validity, fidelity, and diversity of synthetic data across four metric categories: (i) task instructions and intermediate responses, (ii) tool calls, (iii) final outputs, and (iv) downstream evaluation. We evaluate SynAE using recent agent benchmarks and test common synthetic data failure modes via realistic and controlled generation schemes. SynAE detects fine-grained variations in data validity, fidelity and diversity, and shows that no single metric is sufficient to fully characterize synthetic data quality, motivating a multi-axis evaluation of synthetic data for agent testing. A demo of SynAE is available at https://synae-2026-synae-demo.static.hf.space/index.html, with code at https://github.com/wsqwsq/SynAE.

cs.CL cs.LG cs.SE