SkillAxe: Sharpening LLM-Authored Agent Skills Through Evaluation-Guided Self-Refinement

TL;DR

SkillAxe通过自我优化提升LLM技能,通过28%提高通过率。

cs.MA 🔴 高级 2026-06-09 16 次浏览
Srishti Gautam Arjun Radhakrishna Sumit Gulwani
LLM 技能优化 无监督学习 自我优化 实验验证

核心发现

方法论

SkillAxe是一个无监督框架,通过四个维度诊断和优化LLM技能:质量影响、触发精度、指令遵循和解决路径覆盖。无需标签或奖励。

关键结果

  • SkillAxe在SkillsBench上将LLM技能的通过率提高了28%,缩小了与人类技能的差距47-67%。
  • 在SpreadsheetBench上,SkillAxe将通过率从16.0%提高到52.0%,仅使用22个技能。
  • SkillAxe在多任务环境中表现出色,显著提高了技能覆盖率。

研究意义

研究解决了LLM技能开发中的诊断反馈缺乏问题,提供了一种自动化、无监督的优化方法,显著提高了技能的有效性和可靠性。

技术贡献

SkillAxe通过无监督诊断和优化技能,提供了一种新的方法来提高LLM技能的质量和覆盖率,超越了现有的手动调整方法。

新颖性

SkillAxe首次将技能质量分解为可解释的维度,并通过无监督方法进行优化,显著提高了技能的有效性。

局限性

  • SkillAxe在复杂环境中可能面临触发精度不足的问题,需要进一步优化。
  • 框架依赖于现有技能的质量,初始技能质量低可能影响最终效果。

未来方向

未来工作包括扩展SkillAxe到更多领域,优化触发精度,并开发更复杂的技能诊断机制。

AI 总览摘要

SkillAxe是一种新颖的无监督框架,旨在提升LLM技能的质量和覆盖率。当前的LLM技能开发缺乏有效的诊断反馈,使得自动化优化变得困难。SkillAxe通过四个维度对技能进行诊断:质量影响、触发精度、指令遵循和解决路径覆盖。实验结果显示,SkillAxe在SkillsBench上将通过率提高了28%,在SpreadsheetBench上将通过率从16.0%提高到52.0%。这些结果表明,SkillAxe能够显著提高技能的有效性和可靠性,解决了LLM技能开发中的长期痛点。尽管如此,SkillAxe在复杂环境中可能面临触发精度不足的问题,未来工作将致力于优化这些方面。

深度分析

研究背景

LLM技能开发是现代智能体框架的关键,但现有方法多依赖人工调整,缺乏系统化的优化机制。SkillAxe通过无监督框架解决了这一问题。

核心问题

LLM技能开发缺乏有效的诊断反馈,导致优化过程困难。现有方法无法系统识别技能失败的原因。

核心创新

SkillAxe通过四个维度对技能进行诊断,并通过无监督方法进行优化,显著提高了技能的有效性和覆盖率。

方法详解

  • �� 质量影响:评估技能对结果的整体影响
  • �� 触发精度:评估技能在正确任务上的激活
  • �� 指令遵循:评估智能体对技能指导的遵循
  • �� 解决路径覆盖:评估技能对任务执行策略的支持

实验设计

在SkillsBench和SpreadsheetBench上进行实验,验证SkillAxe的有效性。使用多任务环境和真实数据集进行测试。

结果分析

SkillAxe显著提高了技能的覆盖率和通过率,在多任务环境中表现出色,缩小了与人类技能的差距。

应用场景

SkillAxe可用于自动化技能优化,提高智能体在复杂任务中的表现,适用于多领域的技能开发。

局限与展望

SkillAxe在复杂环境中可能面临触发精度不足的问题,需进一步优化。初始技能质量低可能影响最终效果。

通俗解读 非专业人士也能看懂

想象SkillAxe是一个厨师,它能不断改进自己的菜谱。每次做菜,它都会记录下哪些步骤做得好,哪些需要改进。通过这种方式,它能不断提高自己的厨艺,而不需要外部的指导。SkillAxe就像这个厨师,通过自我诊断和优化,提升LLM技能的质量。

简单解释 像给14岁少年讲一样

SkillAxe就像一个游戏中的角色,它能自己升级技能。每次完成任务后,它会分析哪些技能有效,哪些需要改进。通过这种方式,它能不断提高自己的能力,就像你在游戏中不断升级角色一样。

术语表

SkillAxe (技能斧头)

一种无监督框架,用于优化LLM技能,通过四个维度进行诊断和改进。

用于提高LLM技能的质量和覆盖率。

LLM (大型语言模型)

一种能够生成自然语言文本的模型,广泛用于智能体框架。

作为智能体的核心组件,用于执行复杂任务。

SkillsBench (技能基准)

一个用于评估技能有效性的基准测试环境,包含多任务和技能。

用于验证SkillAxe的有效性。

SpreadsheetBench (电子表格基准)

一个用于评估电子表格任务的基准测试环境,包含真实世界任务。

用于验证SkillAxe在复杂任务中的表现。

无监督学习

一种机器学习方法,不需要标签数据,通过自我优化提高模型性能。

SkillAxe通过无监督学习进行技能优化。

开放问题 这项研究留下的未解疑问

  • 1 如何提高SkillAxe在复杂环境中的触发精度?
  • 2 SkillAxe在不同领域的适用性如何?
  • 3 如何优化SkillAxe的初始技能质量?

应用场景

近期应用

智能体技能优化

SkillAxe可用于自动化优化智能体技能,提高任务完成率。适用于多领域的技能开发。

远期愿景

跨领域技能开发

SkillAxe可扩展到更多领域,提高智能体在复杂任务中的表现。需解决触发精度问题。

原文摘要

Skill documents, structured natural-language instructions that guide Large Language Model (LLM) agents, are critical to modern agent frameworks, yet LLMs struggle to write skills that actually work. On SkillsBench, human-authored skills improve pass rates by 16.2 percentage points, while LLM-authored skills provide no measurable gain. We introduce SkillAxe, a fully unsupervised framework that enables LLMs to iteratively diagnose and refine their own skills. SkillAxe decomposes skill quality into four interpretable dimensions (quality impact, trigger precision, instruction compliance with fault attribution, and solution-path coverage), producing structured improvement briefs that require no ground-truth labels, test suites, or environment rewards. On SkillsBench, SkillAxe improves pass rates by 28\% relative over unimproved LLM skills and closes 47--67\% of the gap to human-authored skills. We validate the approach as a continuous improvement engine in the wild on SpreadsheetBench, where a SkillAxe-built skill library learns from past agent trajectories and raises pass rate from 16.0\% to 52.0\% using only 22 skills.

cs.MA