SkillCoach: Self-Evolving Rubrics for Evaluating and Enhancing Agentic Skill-Use

TL;DR

SkillCoach通过自进化评分标准提升代理技能使用,显著提高评估质量。

cs.AI 🔴 高级 2026-07-02 2 次浏览
Jiayin Zhu Kelong Mao Yudong Guo Dengbo He Sulong Xu Simiu Gu Yutao Yue
自进化 代理技能 评分标准 技能评估 训练

核心发现

方法论

SkillCoach通过从真实执行中提取的技能基础过程评分标准来评估代理技能使用。该方法沿四个维度评估轨迹:技能选择、技能执行、技能组合和技能反思。外部验证器作为独立信号,允许将过程质量与偶然成功区分开。

关键结果

  • 实验表明,进化的评分标准显著提高了评估质量,揭示了被最终准确率隐藏的失败,并提供比仅结果过滤更强的监督信号。
  • 在技能依赖任务中,使用SkillCoach的代理表现出更高的技能使用能力。
  • 在包含干扰技能的库中,SkillCoach能够更好地选择高质量的训练轨迹。

研究意义

SkillCoach在学术界和工业界的影响在于其能够揭示隐藏的技能使用失败,并提供更强的训练信号。这解决了长期以来在复杂技能库中可靠技能使用的痛点。

技术贡献

SkillCoach与现有方法的根本区别在于其自进化的评分标准,能够在技能选择、执行、组合和反思方面提供更细粒度的过程监督。

新颖性

SkillCoach首次将技能结构用于定义评估和训练的过程监督,区别于仅关注最终结果的传统方法。

局限性

  • 在复杂的技能库中,评分标准的进化可能需要大量计算资源。
  • 对评分标准的依赖可能导致在新任务中的泛化能力有限。

未来方向

未来的研究方向包括扩展SkillCoach以支持更大规模的技能库,并探索其在不同领域中的应用潜力。

AI 总览摘要

在现代企业中,技能库的增长使得可靠的技能使用变得困难。SkillCoach通过自进化的评分标准框架,评估和增强代理的技能使用能力。该方法从真实执行中提取技能基础过程评分标准,沿四个维度评估轨迹:技能选择、技能执行、技能组合和技能反思。实验表明,进化的评分标准显著提高了评估质量,揭示了被最终准确率隐藏的失败,并提供比仅结果过滤更强的监督信号。

SkillCoach的创新在于其能够在技能选择、执行、组合和反思方面提供更细粒度的过程监督。这种方法不仅揭示了隐藏的技能使用失败,还为训练提供了更强的信号。实验结果显示,使用SkillCoach的代理在技能依赖任务中表现出更高的技能使用能力,特别是在包含干扰技能的库中。

尽管SkillCoach在技能使用评估和训练中显示出显著优势,但其在复杂技能库中的应用可能需要大量计算资源。此外,对评分标准的依赖可能导致在新任务中的泛化能力有限。未来的研究方向包括扩展SkillCoach以支持更大规模的技能库,并探索其在不同领域中的应用潜力。

深度分析

研究背景

在现代企业中,技能库的增长使得可靠的技能使用变得困难。传统方法通常假设一旦生成或检索到技能,代理就能正确使用它。然而,随着技能库的扩展,这一假设往往不成立。代理可能会遗漏必要的技能,选择错误的技能,跳过关键步骤,或者在提交前忘记进行最终检查。

核心问题

在复杂的技能库中,可靠的技能使用是一个核心问题。代理需要选择正确的技能,遵循步骤,正确组合工作流程,并对输出进行反思。现有方法通常依赖于最终验证器的成功,但这对于评估和训练来说过于粗糙。

核心创新

SkillCoach通过自进化的评分标准框架,评估和增强代理的技能使用能力。该方法从真实执行中提取技能基础过程评分标准,沿四个维度评估轨迹:技能选择、技能执行、技能组合和技能反思。外部验证器作为独立信号,允许将过程质量与偶然成功区分开。

方法详解

  • �� 从真实执行中提取技能基础过程评分标准
  • �� 沿四个维度评估轨迹:技能选择、技能执行、技能组合和技能反思
  • �� 外部验证器作为独立信号,允许将过程质量与偶然成功区分开
  • �� 进化的评分标准用于选择高质量的训练轨迹

实验设计

实验设计包括在技能依赖任务中测试SkillCoach的性能。使用的基准包括无技能、策划技能和自生成技能设置。实验结果显示,进化的评分标准显著提高了评估质量,揭示了被最终准确率隐藏的失败。

结果分析

实验结果显示,使用SkillCoach的代理在技能依赖任务中表现出更高的技能使用能力,特别是在包含干扰技能的库中。进化的评分标准显著提高了评估质量,揭示了被最终准确率隐藏的失败,并提供比仅结果过滤更强的监督信号。

应用场景

SkillCoach可应用于企业中的技能依赖任务,帮助代理更可靠地使用技能。其在复杂技能库中的应用可以提高任务成功率,并为训练提供更强的信号。

局限与展望

尽管SkillCoach在技能使用评估和训练中显示出显著优势,但其在复杂技能库中的应用可能需要大量计算资源。此外,对评分标准的依赖可能导致在新任务中的泛化能力有限。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要根据食谱选择合适的工具和步骤来完成一道菜。SkillCoach就像一个智能助手,帮助厨师在复杂的工具和步骤中做出最佳选择。它不仅关注最终的菜品是否成功,还关注每一步的执行是否正确。通过不断学习和调整,SkillCoach可以帮助厨师提高烹饪效率和成功率。

简单解释 像给14岁少年讲一样

想象你在玩一个需要完成任务的游戏。SkillCoach就像一个超级助手,帮助你选择正确的道具和步骤来完成任务。它不仅关注你是否完成了任务,还关注你在过程中是否做对了每一步。通过不断学习,SkillCoach可以帮助你在游戏中变得更厉害!

术语表

技能选择 (Skill Selection)

评估代理是否调用了合适的金牌技能,同时避免了干扰技能。

在SkillCoach中用于评估技能使用的一个维度。

技能执行 (Skill Following)

评估代理是否遵循了金牌技能和参考解决方案中指定的关键步骤。

在SkillCoach中用于评估技能使用的一个维度。

技能组合 (Skill Composition)

评估代理是否在有效的工作流程中协调了多个技能或依赖的子过程。

在SkillCoach中用于评估技能使用的一个维度。

技能反思 (Skill Reflection)

评估代理在最终提交前是否进行了明确的检查。

在SkillCoach中用于评估技能使用的一个维度。

自进化评分标准 (Self-Evolving Rubric)

从真实执行中提取的技能基础过程评分标准,用于评估和增强代理的技能使用。

SkillCoach的核心创新之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的技能库中有效应用SkillCoach?
  • 2 SkillCoach在不同领域中的应用潜力如何?

应用场景

近期应用

企业技能评估

SkillCoach可以帮助企业评估和增强代理在复杂技能库中的技能使用能力。

远期愿景

跨领域技能应用

SkillCoach有潜力在不同领域中应用,帮助代理在复杂环境中更可靠地使用技能。

原文摘要

Skills are becoming a reusable operational layer for LLM agents, encoding SOPs, domain rules, tool workflows, scripts, and validation routines. In realistic skill repositories, overlapping skills make reliable skill-use difficult. Final verifier success is too coarse for both evaluation and training, since an agent may pass through trial and error while selecting distractor skills, skipping required steps, composing workflows incorrectly or omitting final checks. We introduce SkillCoach, a self-evolving rubric framework for evaluating and enhancing agentic skill-use. SkillCoach derives skill-grounded process rubrics from real rollouts and evaluates trajectories along four dimensions: skill selection, skill following, skill composition, and skill-grounded reflection. It keeps the external verifier as a separate outcome signal, allowing process quality to be distinguished from accidental task success. The evolved rubrics further serve as process supervision for selecting high-quality training trajectories. Experiments show that evolved rubrics substantially improve evaluation quality, expose failures hidden by final accuracy, and provide stronger supervision signals than outcome-only filtering for enhancing agentic skill-use.

cs.AI cs.CL