SkillRevise: Improving LLM-Authored Agent Skills via Trace-Conditioned Skill Revision
SkillRevise通过执行条件的技能修订,将LLM代理的成功率从36.05%提高到61.63%。
核心发现
方法论
SkillRevise是一种执行基础的框架,旨在通过诊断执行证据中的技能缺陷,检索通用记忆中的修复原则,并应用执行锚定的编辑来迭代地改进初始技能。通过重新执行候选者并测量经验效用,它在修订预算内保留最佳观察到的技能。
关键结果
- 在SkillsBench上,SkillRevise将基础代理的成功率从36.05%提高到61.63%。
- 在SkillLearnBench-Random和SWE-Skills-Bench-Hard上,SkillRevise在多个执行器上表现出一致的改进。
- 与一键生成的技能相比,SkillRevise在六个LLM中表现出显著的性能提升。
研究意义
SkillRevise通过提供一种系统化的技能修订方法,解决了在冷启动情况下技能构建的挑战。它不仅提高了LLM代理的成功率,还展示了技能在不同执行器和任务环境中的可转移性,表明其捕获了超越单一执行器的可重用程序知识。
技术贡献
SkillRevise的技术贡献在于其执行锚定的修订方法,它结合了任务特定的诊断、可重用的原则记忆和效用门控的选择,提供了一种在有限修订预算内改进现有LLM编写技能的有效方法。
新颖性
SkillRevise首次将执行证据与通用修复知识相结合,用于技能修订,填补了现有方法在冷启动情况下的空白。
局限性
- 在长时间跨度的任务中,SkillRevise的修订效果可能受到限制。
- 在特定领域的技能设计缺陷中,通用原则可能不足以提供有效修复。
未来方向
未来的工作可以探索SkillRevise在更多领域和更复杂任务中的应用,以及如何进一步优化修订过程以提高效率和效用。
AI 总览摘要
SkillRevise是一种新颖的框架,旨在通过执行条件的技能修订来提高LLM代理的技能。在复杂的验证驱动环境中,现有的自我进化方法在冷启动情况下表现不佳,SkillRevise通过诊断执行证据中的技能缺陷,检索通用记忆中的修复原则,并应用执行锚定的编辑来解决这一问题。
在实验中,SkillRevise在SkillsBench、SkillLearnBench-Random和SWE-Skills-Bench-Hard上表现出显著的性能提升,成功率从36.05%提高到61.63%。这一结果表明,SkillRevise不仅提高了技能的执行效用,还展示了其在不同执行器和任务环境中的可转移性。
尽管SkillRevise在多个基准测试中表现出色,但在长时间跨度的任务中,其修订效果可能受到限制。未来的研究可以探索其在更多领域和更复杂任务中的应用,以及如何进一步优化修订过程以提高效率和效用。
深度分析
研究背景
随着LLM代理在复杂环境中的应用日益广泛,如何有效地构建和修订技能成为研究热点。传统的技能构建方法依赖专家编写或一键生成,但在执行效用上存在不足。SkillRevise通过执行条件的修订方法,提供了一种新的解决方案。
核心问题
现有的技能构建方法在冷启动情况下表现不佳,无法有效利用初始不完善的技能。SkillRevise旨在通过迭代修订初始技能,提高其执行效用。
核心创新
SkillRevise的核心创新在于其执行锚定的修订方法,通过结合任务特定的诊断和通用修复原则,实现了技能的有效改进。
方法详解
- �� 诊断执行证据中的技能缺陷
- �� 检索通用记忆中的修复原则
- �� 应用执行锚定的编辑
- �� 重新执行候选者并测量经验效用
- �� 在修订预算内保留最佳观察到的技能
实验设计
在SkillsBench、SkillLearnBench-Random和SWE-Skills-Bench-Hard上进行评估,使用多个执行器,包括GPT-5.5、Claude Opus 4.7等。实验结果表明,SkillRevise在多个基准测试中表现出色。
结果分析
SkillRevise显著提高了LLM代理的成功率,尤其在SkillsBench上,从36.05%提高到61.63%。这一结果表明其在不同执行器和任务环境中的可转移性。
应用场景
SkillRevise可用于需要高效技能执行的复杂任务环境,如自动化工作流程、智能助手等。
局限与展望
在长时间跨度的任务中,SkillRevise的修订效果可能受到限制。此外,在特定领域的技能设计缺陷中,通用原则可能不足以提供有效修复。
通俗解读 非专业人士也能看懂
想象一个工厂,工人们需要不断改进他们的工作流程以提高效率。SkillRevise就像一个智能系统,能够观察工人的工作,找出问题,并提供改进建议。通过这种方式,工厂的生产效率得到了显著提高。同样,SkillRevise通过分析LLM代理的执行证据,找出技能中的缺陷,并应用修复原则来改进技能,从而提高代理的成功率。
简单解释 像给14岁少年讲一样
想象一下你在玩一个游戏,你的角色需要完成各种任务。SkillRevise就像一个超级助手,它能观察你在游戏中的表现,找出你在哪些地方做得不好,然后给你一些建议来改进你的技能。这样,你就能更快地完成任务,获得更高的分数!是不是很酷?
术语表
LLM (大规模语言模型)
一种能够生成自然语言文本的人工智能模型,通常用于复杂的语言任务。
在本文中,LLM用于生成初始技能。
技能修订
通过分析执行证据,识别技能中的缺陷,并应用修复原则来改进技能的过程。
SkillRevise框架的核心机制。
执行锚定
一种将修复原则应用于具体执行证据的技术,以提高技能的效用。
SkillRevise中用于改进技能的关键步骤。
冷启动
在缺乏足够数据或经验的情况下启动一个系统或过程的情况。
SkillRevise旨在解决冷启动情况下的技能构建问题。
通用记忆
存储可重用修复原则的知识库,用于指导技能修订。
SkillRevise中用于检索修复原则的组件。
开放问题 这项研究留下的未解疑问
- 1 如何在更复杂的任务环境中应用SkillRevise?
- 2 如何优化修订过程以提高效率?
应用场景
近期应用
自动化工作流程
SkillRevise可以用于提高自动化工作流程的效率,减少错误。
远期愿景
智能助手
通过改进技能,SkillRevise可以增强智能助手的能力,使其更好地完成复杂任务。
原文摘要
Agent skills are procedural artifacts that enable LLM agents to execute workflows, verify constraints, and recover from failures. Existing self-evolving methods refine skills using accumulated trajectories. However, they struggle in cold-start settings, where only an initial, imperfect skill is available. Consequently, skill construction defaults to expert authoring or one-shot LLM generation. Expert-authored skills are costly and may not align with how LLM agents actually execute tasks, while one-shot generated skills can be syntactically well formed yet behaviorally weak. To bridge this gap, we propose SkillRevise, an execution-grounded framework designed to iteratively refine these initial skills. SkillRevise diagnoses skill defects from execution evidence, retrieves relevant repair principles from a general memory, and applies execution-anchored edits. By re-executing candidates and measuring empirical utility, it retains the best observed skill within the revision budget. Evaluated across three main benchmarks, two domain-specific studies, and six LLMs, SkillRevise substantially outperforms one-shot baselines, improving the base agent's success rate on SkillsBench from 36.05% to 61.63%. Furthermore, the revised skills transfer across both executors and task environments, suggesting that SkillRevise captures reusable procedural knowledge beyond any single executor. Our code is available at https://github.com/HKUST-KnowComp/skillrevise.