SkillCAT: Contrastive, Assessment-Augmented and Topology-AwareSkill Self-Evolution for LLM Agents

TL;DR

SkillCAT框架通过对比因果提取、评估增强进化和拓扑感知任务执行,将LLM技能自进化的平均得分提高49.69%。

cs.CL 🔴 高级 2026-06-11 4 次浏览
Kunfeng Chen Qihuang Zhong Juhua Liu Bo Du
技能自进化 对比因果提取 评估增强 拓扑感知 LLM代理

核心发现

方法论

SkillCAT框架分为三个阶段:对比因果提取(CCE)通过对比同任务成功/失败轨迹来提取因果证据;评估增强进化(AAE)在源任务克隆上重放候选补丁,仅保留不损害任务结果的补丁,并进行层次合并;拓扑感知任务执行(TTE)将进化后的技能编译为可路由的子技能拓扑,仅加载任务相关的能力节点。

关键结果

  • SkillCAT在SpreadsheetBench、WikiTableQuestions和DocVQA等基准测试上提高了初始技能的平均得分达49.69%。
  • 在跨模型和分布外泛化评估中,SkillCAT表现出色,证明了其可靠性和有效性。
  • 每个组件(CCE、AAE和TTE)对最终改进都有贡献,验证了其设计的合理性。

研究意义

SkillCAT通过优化技能自进化过程,提高了LLM代理在复杂任务中的执行性能,解决了现有方法中的单轨迹偏差、未经验证的合并和推理时的上下文过载问题。

技术贡献

SkillCAT通过引入对比因果提取和评估增强进化,提供了新的技能自进化策略,显著提高了技能的可靠性和任务选择性部署能力。

新颖性

SkillCAT首次将技能生命周期分解为三个可观察阶段,并针对每个阶段引入了针对性优化,显著提高了技能自进化的效率和准确性。

局限性

  • SkillCAT在处理极端复杂任务时可能会出现性能下降,因为这些任务可能需要更复杂的技能拓扑。
  • 在某些情况下,技能的层次合并可能导致信息丢失。

未来方向

未来工作可以探索SkillCAT在更多任务类型上的应用,并优化拓扑感知任务执行以提高复杂任务的处理能力。

AI 总览摘要

SkillCAT框架旨在解决现有LLM技能自进化方法中的关键问题。现有方法通常从单一轨迹中提取技能补丁,并在推理时加载整个技能库,导致证据提取不可靠、低质量或有害技能编辑的积累,以及由于不相关或冲突的技能内容导致的上下文使用效率低下。

SkillCAT通过将技能自进化过程分解为三个阶段:对比因果提取(CCE)、评估增强进化(AAE)和拓扑感知任务执行(TTE),有效解决了这些问题。CCE通过对比同任务成功/失败轨迹来提取因果证据,AAE在源任务克隆上重放候选补丁,仅保留不损害任务结果的补丁,并进行层次合并,TTE将进化后的技能编译为可路由的子技能拓扑,仅加载任务相关的能力节点。

实验结果表明,SkillCAT在多个基准测试上显著提高了技能自进化的平均得分,证明了其可靠性和有效性。SkillCAT的设计不仅提高了技能的可靠性,还增强了任务选择性部署能力,为未来的研究和应用提供了新的方向。

深度解读

原文摘要

Skill self-evolution methods for LLM agents aim to turn execution trajectories into reusable skill documents. However, current pipelines typically derive skill patches from a single trajectory per task, merge them indiscriminately, and load the entire skill corpus during inference. These choices lead to unreliable evidence extraction, the accumulation of low-quality or even harmful skill edits, and inefficient use of context due to irrelevant or conflicting skill content. We propose SkillCAT, a framework that decomposes this process into three stages. (1) Contrastive Causal Extraction (CCE) samples multiple trajectories per task and contrasts same-task success/failure pairs to find the evidence that explains outcome differences. (2) Assessment-Augmented Evolution (AAE) replays each candidate patch on source-task clones, retains only those that do not damage task outcomes, and then merges the retained patches hierarchically. (3) Topology-Aware Task Execution (TTE) compiles the evolved skills into routable sub-skill topologies, so that inference loads only task-relevant capability nodes. We evaluate SkillCAT on widely-used agent benchmarks, including SpreadsheetBench, WikiTableQuestions, and DocVQA, and further assess cross-model and out-of-distribution generalization. Across these settings, SkillCAT improves the average score over the initial skill by up to 49.69%, demonstrating reliable and effective skill evolution.

cs.CL