Skill Coverage: A Test Adequacy Metric for Agent Skills

TL;DR

提出技能覆盖率指标,基于轨迹检测技能行为约束,平均覆盖率38.66%-45.51%,提升失败任务16%。

cs.AI 🔴 高级 2026-06-09 45 次浏览
Boyin Tan Xiaowei Huang Youcheng Sun
人工智能 大语言模型 软件测试 技能评估 任务验证

核心发现

方法论

本文提出基于轨迹的技能覆盖率指标,将自然语言技能指令转化为半结构化的技能行为约束(SBC),利用LLM辅助提取和验证。通过定义约束的适用条件和预期行为,结合轨迹检测是否满足条件,判定覆盖情况。验证该方法在SkillsBench上,采用人类标注对比,达88.58%的判定一致性。实验证明,当前基准中轨迹覆盖技能行为约束比例仅为38.66%-45.51%。利用失败约束作为诊断目标,强化技能指令,显著提升任务成功率,平均达16%。

关键结果

  • 在SkillsBench中,轨迹仅覆盖技能行为约束的38.66%-45.51%,显示任务级指标无法反映技能层面细节。
  • 通过对失败任务中未满足的约束进行分析,强化技能指令后,任务恢复率提升至16%。
  • 验证指标与人类标注达88.58%的一致性,确保评估的可靠性和可扩展性。

研究意义

该研究填补了技能测试的细粒度评估空白,为大语言模型(LLM)在复杂任务中的技能使用提供了量化指标。技能覆盖率不仅反映技能的测试充分性,也为技能改进提供了具体的诊断依据,有助于推动可重用技能生态系统的发展,提升LLM在实际应用中的表现和可靠性。

技术贡献

提出基于轨迹的技能覆盖率指标,结合自然语言转化为半结构化约束的SBC模型,建立验证协议,确保指标的可操作性和可扩展性。引入失败约束强化机制,提供细粒度的技能使用诊断,显著优于传统任务成功率指标,突破了技能评估的瓶颈。

新颖性

首次将轨迹检测与自然语言技能指令结合,提出技能行为约束(SBC)模型,系统性评估技能覆盖率,突破传统任务成功率的粗粒度限制,提供细粒度行为诊断工具。

局限性

  • 当前方法依赖轨迹的可观测性,某些技能行为可能未在测试轨迹中体现,导致覆盖率低估。
  • 技能指令的自然语言转化为约束存在歧义,可能影响验证准确性。
  • 强化机制仅强调原始指令,未考虑复杂技能的多样化应用场景,未来需结合多模态信息。

未来方向

未来将结合多模态数据和强化学习,提升技能行为约束的表达能力和检测精度。同时,探索自动化的约束生成与修正流程,以实现大规模、自动化的技能覆盖评估体系,推动技能生态的标准化和普及。

AI 总览摘要

随着大语言模型(LLM)在复杂任务中的广泛应用,技能作为可重用的程序性知识,成为提升任务性能的关键因素。然而,现有评估指标多关注任务层面成功与否,难以反映技能内部的细粒度使用情况。本文提出一种基于轨迹的技能覆盖率指标,将自然语言技能指令转化为半结构化的技能行为约束(SBC),并通过轨迹检测是否满足这些约束,从而实现技能测试的细粒度评估。该方法利用LLM辅助提取和验证SBC,确保指标的可靠性。在SkillsBench上的应用显示,现有轨迹仅覆盖技能行为约束的38.66%至45.51%,揭示任务成功率背后技能层面不足。通过分析未满足的约束,强化技能指令,显著提升任务成功率,平均达16%。这一指标不仅提供了技能测试的量化工具,也为技能改进提供了具体的诊断依据。未来,该方法有望结合多模态数据和自动化流程,推动技能生态的标准化和大规模应用,极大促进LLM在实际场景中的表现和可靠性。

深度分析

研究背景

近年来,随着大语言模型(如GPT-4、Claude等)在自然语言理解和生成中的突破,技能作为模块化、可重用的程序性知识,逐渐成为提升模型任务表现的核心。早期工作如Few-Shot学习、Chain-of-Thought推理,强调模型的推理能力,但缺乏对技能内部行为的细粒度评估。现有基准如SkillsBench、ClawHub提供了任务成功的整体指标,但未能反映技能行为的完整覆盖。软件工程中的测试覆盖率理念启发了对技能行为的细粒度检测,旨在确保技能的每个行为都被充分验证,为模型的可解释性和可调试性提供支持。

核心问题

现有任务成功指标无法揭示技能内部的使用细节,导致技能的测试和优化缺乏指导。任务结果的成功或失败,不能区分模型是否正确执行了技能指令,或仅依赖部分技能内容完成任务。这种模糊性限制了技能的系统性评估和改进。如何量化技能在实际轨迹中的使用情况,成为技能评估的核心难题。缺乏细粒度的行为检测机制,使得技能的有效性和完整性难以保证,也阻碍了技能生态的健康发展。

核心创新

本文的核心创新包括:1)提出技能行为约束(SBC)模型,将自然语言技能指令转化为半结构化的可验证约束,增强可操作性;2)建立轨迹检测机制,判断轨迹是否覆盖SBC,区分覆盖与否及其结果(Pass/Fail);3)引入验证协议,确保自动化检测的可靠性,结合人类标注提升准确性;4)利用失败约束强化技能内容,形成闭环诊断与改进流程。这些创新突破了传统任务成功指标的局限,为技能的细粒度检测和持续优化提供了理论基础和实践工具。

方法详解

  • �� 约束提取:利用LLM辅助,从技能自然语言描述中抽取候选SBC,结合人工审校,确保约束的准确性和可验证性。
  • �� 约束规范化:将候选SBC转化为符合EARS风格的条件-行为形式,定义适用条件和预期行为。
  • �� 轨迹检测:对每个轨迹,判断是否满足SBC的适用条件,若满足,则检测行为是否符合预期,判定覆盖状态。
  • �� 评估验证:通过人类标注和LLM验证,确保检测指标的可靠性,达88.58%的判定一致性。
  • �� 失败分析:对未满足的约束进行诊断,强化技能指令,形成闭环改进流程。
  • �� 实验验证:在SkillsBench上,评估覆盖率,验证指标的有效性,提升任务成功率,形成可扩展的评估体系。

实验设计

采用SkillsBench中的87个任务和202个技能,评估轨迹覆盖率,验证指标的可靠性。比对人类标注与自动检测,确保一致性。不同模型和策略下,测量轨迹覆盖比例,发现仅为38.66%-45.51%。通过失败约束强化技能,反复测试,任务成功率提升至16%。实验还包括对指标的敏感性分析和不同技能类型的适用性验证,确保方法的稳健性和普适性。

结果分析

实验结果显示,当前基准中轨迹仅覆盖技能行为约束的38.66%-45.51%,揭示了任务成功率背后技能层面的不足。利用失败约束作为诊断目标,强化技能内容后,任务成功率平均提升16%。验证指标与人类标注达88.58%的判定一致性,验证了检测的可靠性。该方法还揭示了技能指令的自然语言转化和轨迹检测的可行性,为未来大规模技能评估提供了基础。

应用场景

该指标可广泛应用于LLM的技能开发、调试和优化中,帮助开发者识别技能中的薄弱环节,实现技能的持续改进。也可用于自动化测试流程,确保技能在不同任务中的全面覆盖,提升模型的可靠性和可解释性。长远来看,有望推动技能生态的标准化,支持多模态、多任务的复杂场景应用,促进AI系统的自主学习和自我优化。

局限与展望

目前方法依赖轨迹的可观测性,某些技能行为可能未在测试轨迹中体现,导致覆盖率低估。自然语言转化存在歧义,影响检测准确性。强化机制仅强调指令,未考虑多模态信息和复杂场景,未来需结合视觉、声音等多模态数据,提升检测的全面性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,技能就像食谱,每个步骤都很重要。有时候,你只记得做了炒菜,但不知道是不是按照食谱的每一步走的。这个研究就像是用相机记录你做菜的全过程,然后检查你是不是按照食谱操作。通过这种方式,可以发现你在某个步骤犯了错误,比如忘记放盐。这样,不仅能帮你改正,还能让你以后做菜更正宗、更好吃。这个方法用在AI模型上,就是让它在完成任务时,像你一样被“录像”下来,检查它是不是按照“食谱”操作,从而不断改进技能,变得更聪明、更可靠。

简单解释 像给14岁少年讲一样

你知道在学校里学做手工吗?老师会告诉你每一步该怎么做,比如先剪纸、再粘贴、最后装饰。可是,有时候你会忘记做某一步,结果作品不完美。这篇文章就像是用相机记录你做手工的每一步,然后检查你是不是都按照老师的指示做了。这样一来,不仅能找到你哪里做错了,还能告诉你怎么改正,让你以后做得更棒。用在AI上也是一样,研究人员让AI在完成任务时“录视频”,然后检查它是不是都按照“手工教程”操作。这样,AI就能学得更细、更准,变得更聪明、更可靠。

原文摘要

Agent skills encode reusable procedural knowledge for large language model (LLM) agents, and existing benchmarks show that such skills can improve task-level performance. However, a task outcome does not reveal which parts of a reusable skill were exercised, nor whether the agent followed the relevant skill instructions when those parts were exercised. This gap makes it unclear whether a skill has been adequately tested, or whether observed task failures provide actionable evidence for improving agent skill effectiveness. To fill this gap, we introduce skill coverage, a trajectory-based test-adequacy metric for reusable agent skills. Our framework extracts skill behavior constraints from each skill, translating natural-language skill instructions into semi-structured constraints that specify the expected agent behavior under particular conditions. It then determines whether each constraint is covered by an agent trajectory and, for covered constraints, assigns a Pass or Fail verdict according to the agent behavior. We apply this framework to SkillsBench. The results show that agent trajectories on the benchmark leaderboard cover only 38.66 to 45.51% of the extracted skill behavior constraints on average. We then use Fail verdicts to strengthen the corresponding skill content only by emphasizing the original instructions that the agent failed to follow, and run the same tasks with the strengthened skills. This emphasis yields an average 16.0% recovery rate of the failed tasks across the five agent-model rows. These results show that skill coverage is both a test-adequacy metric and a fine-grained signal for observing skill-use behavior. In failed tasks, failed constraint labels provide actionable evidence for improving agent skill effectiveness. A project website accompanies the paper.

cs.AI cs.LG cs.SE