SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision

TL;DR

SkillRevise通过执行条件的技能修订,将LLM代理的成功率从36.05%提高到61.63%。

cs.AI 🔴 高级 2026-05-31 12 次浏览
Yuxuan Liu Zhaochen Su Lingyun Xie Yuhao Zhang Qing Zong Jiahe Guo Zhongwei Xie Yiyan Ji Yauwai Yim Hongyu Luo Xiyu Ren Ruan Chenyu Haoran Li Yangqiu Song
LLM 技能修订 执行证据 冷启动 自我进化

核心发现

方法论

SkillRevise是一种执行基础的框架,旨在通过诊断执行证据中的技能缺陷,检索通用记忆中的修复原则,并应用执行锚定的编辑来迭代地改进初始技能。通过重新执行候选者并测量经验效用,它在修订预算内保留最佳观察到的技能。

关键结果

  • 在SkillsBench上,SkillRevise将基础代理的成功率从36.05%提高到61.63%。
  • 在SkillLearnBench-Random和SWE-Skills-Bench-Hard上,SkillRevise在多个执行器上表现出一致的改进。
  • 与一键生成的技能相比,SkillRevise在六个LLM中表现出显著的性能提升。

研究意义

SkillRevise通过提供一种系统化的技能修订方法,解决了在冷启动情况下技能构建的挑战。它不仅提高了LLM代理的成功率,还展示了技能在不同执行器和任务环境中的可转移性,表明其捕获了超越单一执行器的可重用程序知识。

技术贡献

SkillRevise的技术贡献在于其执行锚定的修订方法,它结合了任务特定的诊断、可重用的原则记忆和效用门控的选择,提供了一种在有限修订预算内改进现有LLM编写技能的有效方法。

新颖性

SkillRevise首次将执行证据与通用修复知识相结合,用于技能修订,填补了现有方法在冷启动情况下的空白。

局限性

  • 在长时间跨度的任务中,SkillRevise的修订效果可能受到限制。
  • 在特定领域的技能设计缺陷中,通用原则可能不足以提供有效修复。

未来方向

未来的工作可以探索SkillRevise在更多领域和更复杂任务中的应用,以及如何进一步优化修订过程以提高效率和效用。

AI 总览摘要

SkillRevise是一种新颖的框架,旨在通过执行条件的技能修订来提高LLM代理的技能。在复杂的验证驱动环境中,现有的自我进化方法在冷启动情况下表现不佳,SkillRevise通过诊断执行证据中的技能缺陷,检索通用记忆中的修复原则,并应用执行锚定的编辑来解决这一问题。

在实验中,SkillRevise在SkillsBench、SkillLearnBench-Random和SWE-Skills-Bench-Hard上表现出显著的性能提升,成功率从36.05%提高到61.63%。这一结果表明,SkillRevise不仅提高了技能的执行效用,还展示了其在不同执行器和任务环境中的可转移性。

尽管SkillRevise在多个基准测试中表现出色,但在长时间跨度的任务中,其修订效果可能受到限制。未来的研究可以探索其在更多领域和更复杂任务中的应用,以及如何进一步优化修订过程以提高效率和效用。

深度分析

研究背景

随着LLM代理在复杂环境中的应用日益广泛,如何有效地构建和修订技能成为研究热点。传统的技能构建方法依赖专家编写或一键生成,但在执行效用上存在不足。SkillRevise通过执行条件的修订方法,提供了一种新的解决方案。

核心问题

现有的技能构建方法在冷启动情况下表现不佳,无法有效利用初始不完善的技能。SkillRevise旨在通过迭代修订初始技能,提高其执行效用。

核心创新

SkillRevise的核心创新在于其执行锚定的修订方法,通过结合任务特定的诊断和通用修复原则,实现了技能的有效改进。

方法详解

  • �� 诊断执行证据中的技能缺陷
  • �� 检索通用记忆中的修复原则
  • �� 应用执行锚定的编辑
  • �� 重新执行候选者并测量经验效用
  • �� 在修订预算内保留最佳观察到的技能

实验设计

在SkillsBench、SkillLearnBench-Random和SWE-Skills-Bench-Hard上进行评估,使用多个执行器,包括GPT-5.5、Claude Opus 4.7等。实验结果表明,SkillRevise在多个基准测试中表现出色。

结果分析

SkillRevise显著提高了LLM代理的成功率,尤其在SkillsBench上,从36.05%提高到61.63%。这一结果表明其在不同执行器和任务环境中的可转移性。

应用场景

SkillRevise可用于需要高效技能执行的复杂任务环境,如自动化工作流程、智能助手等。

局限与展望

在长时间跨度的任务中,SkillRevise的修订效果可能受到限制。此外,在特定领域的技能设计缺陷中,通用原则可能不足以提供有效修复。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们需要不断改进他们的工作流程以提高效率。SkillRevise就像一个智能系统,能够观察工人的工作,找出问题,并提供改进建议。通过这种方式,工厂的生产效率得到了显著提高。同样,SkillRevise通过分析LLM代理的执行证据,找出技能中的缺陷,并应用修复原则来改进技能,从而提高代理的成功率。

简单解释 像给14岁少年讲一样

想象一下你在玩一个游戏,你的角色需要完成各种任务。SkillRevise就像一个超级助手,它能观察你在游戏中的表现,找出你在哪些地方做得不好,然后给你一些建议来改进你的技能。这样,你就能更快地完成任务,获得更高的分数!是不是很酷?

术语表

LLM (大规模语言模型)

一种能够生成自然语言文本的人工智能模型,通常用于复杂的语言任务。

在本文中,LLM用于生成初始技能。

技能修订

通过分析执行证据,识别技能中的缺陷,并应用修复原则来改进技能的过程。

SkillRevise框架的核心机制。

执行锚定

一种将修复原则应用于具体执行证据的技术,以提高技能的效用。

SkillRevise中用于改进技能的关键步骤。

冷启动

在缺乏足够数据或经验的情况下启动一个系统或过程的情况。

SkillRevise旨在解决冷启动情况下的技能构建问题。

通用记忆

存储可重用修复原则的知识库,用于指导技能修订。

SkillRevise中用于检索修复原则的组件。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的任务环境中应用SkillRevise?
  • 2 如何优化修订过程以提高效率?

应用场景

近期应用

自动化工作流程

SkillRevise可以用于提高自动化工作流程的效率,减少错误。

远期愿景

智能助手

通过改进技能,SkillRevise可以增强智能助手的能力,使其更好地完成复杂任务。

原文摘要

Agent skills are procedural artifacts that enable LLM agents to execute workflows, verify constraints, and recover from failures. Existing self-evolving methods refine skills using accumulated trajectories. However, they struggle in cold-start settings, where only an initial, imperfect skill is available. Consequently, skill construction defaults to expert authoring or one-shot LLM generation. Expert-authored skills are costly and may not align with how LLM agents actually execute tasks, while one-shot generated skills can be syntactically well formed yet behaviorally weak. To bridge this gap, we propose SkillRevise, an execution-grounded framework designed to iteratively refine these initial skills. SkillRevise diagnoses skill defects from execution evidence, retrieves relevant repair principles from a general memory, and applies execution-anchored edits. By re-executing candidates and measuring empirical utility, it retains the best observed skill within the revision budget. Evaluated across three main benchmarks, two domain-specific studies, and six LLMs, SkillRevise substantially outperforms one-shot baselines, improving the base agent's success rate on SkillsBench from 36.05% to 61.63%. Furthermore, the revised skills transfer across both executors and task environments, suggesting that SkillRevise captures reusable procedural knowledge beyond any single executor. Our code is available at https://github.com/HKUST-KnowComp/skillrevise.

cs.AI