SkillsVote: Lifecycle Governance of Agent Skills from Collection, Recommendation to Evolution

TL;DR

SkillsVote通过生命周期管理,提升大规模开源Agent Skills的推荐与演化,实验中显著改善代码基任务表现。

cs.CL 🔴 高级 2026-05-18 49 次浏览
Hongyi Liu Haoyan Yang Tao Jiang Bo Tang Feiyu Xiong Yuyu Luo Zhiyu Li
人工智能 大规模技能管理 生命周期治理 开源生态 代码任务

核心发现

方法论

SkillsVote采用三阶段流程:预任务推荐通过结构化技能库搜索,筛选相关技能;执行后,将轨迹分解为技能关联子任务,进行责任归因;最后,基于成功且可复用的探索,进行受控的技能演化。其核心算法包括基于结构化文件系统的技能检索、轨迹子任务划分与归因机制,以及证据门控的技能更新策略。系统利用大规模开源技能库(超百万条)进行技能质量、环境适配性和可验证性分析,结合任务合成技术,提升技能的可用性与可信度。

关键结果

  • 在Terminal-Bench 2.0和SWE-Bench Pro上,SkillsVote显著提升模型在复杂任务中的表现,平均准确率提升2.6个百分点,解决率提升2.7个百分点。实验中,利用历史轨迹和开源技能库实现离线迁移,在线演化在任务流中持续优化技能库,整体效果优于传统方法。
  • 在大规模技能检索中,SkillsVote的路由性能优于SkillRouter,最大规模库中,准确率提升约16个百分点,成本降低,显示出良好的扩展性和效率。技能推荐与轨迹归因的结合,有效避免了无关技能干扰,增强了技能库的质量控制。
  • 通过受控演化机制,只有成功且责任明确的子任务才能驱动技能更新,确保技能库的稳定性和实用性,验证了系统在多样化任务场景中的适应性。

研究意义

该研究解决了大规模开源技能生态中技能冗余、质量参差不齐、环境敏感等问题,提出生命周期治理框架,推动技能的可持续演化。其创新机制增强了AI系统在长远任务中的适应性和可靠性,为未来自主学习、知识管理提供了理论基础和工程方案,有望在自动编程、机器人控制等领域引领新一轮技术革新。

技术贡献

系统提出基于结构化文件系统的技能检索与推荐机制,结合轨迹子任务归因与受控演化策略,构建闭环治理体系。创新点在于引入责任归因与证据门控,确保技能演化的可靠性,显著提升大规模技能库的管理效率。该方法在模型迁移和在线演化中表现优异,突破了传统技能管理的规模瓶颈,提供了可解释、可控的技能更新路径。

新颖性

首次将生命周期管理理念引入Agent Skills生态,结合结构化检索、轨迹归因与证据门控,系统性解决技能库扩展中的污染与质量控制问题。相较于以往仅关注技能表达或单一迁移的研究,SkillsVote强调从轨迹到技能的责任归因与受控演化,创新性在于其闭环治理机制。

局限性

  • 当前系统依赖大量开源技能库,质量参差不齐,可能影响整体效果;未来需引入更智能的质量评估与过滤机制。
  • 在极端复杂环境或多模态任务中,技能归因与演化的准确性仍有待提升,需结合更丰富的感知信息。
  • 系统在大规模库中检索成本虽降低,但仍存在一定的计算开销,需优化索引与搜索策略。

未来方向

未来将结合强化学习与自监督机制,提升技能的自主演化能力;探索多模态环境下的技能归因与推荐策略;同时,推动跨领域应用,如机器人自主学习和自动编程,构建更智能的技能生态体系。

AI 总览摘要

SkillsVote提出了一套完整的Agent Skills生命周期治理框架,旨在解决开源技能生态中的冗余、质量不均和环境敏感等问题。该系统在技能收集、推荐、归因与演化环节,构建了闭环机制,确保技能的可验证性和可控性。核心创新在于利用结构化文件系统进行技能检索,结合轨迹子任务归因,将执行证据转化为可用于演化的可靠单元。实验结果显示,在Terminal-Bench 2.0和SWE-Bench Pro上,SkillsVote显著提升模型在复杂任务中的表现,平均准确率提升2.6个百分点,解决率提升2.7个百分点。系统还通过离线迁移和在线演化,持续优化技能库,有效避免了无关技能的干扰,增强了系统的适应性。该方法不仅提升了模型的任务解决能力,也为未来自主学习和知识管理提供了新思路。其闭环治理机制确保技能演化的稳定性和可信度,为大规模开源生态的可持续发展奠定基础。未来,结合强化学习和多模态感知,将进一步推动技能生态的智能化和自主演化,拓展在自动编程、机器人控制等领域的应用潜力。

深度分析

研究背景

近年来,随着大规模预训练模型(如GPT系列)在自然语言处理中的突破,基于长序列轨迹的Agent系统逐渐成为研究热点。早期工作如Memory Networks和Few-Shot Learning强调存储和利用少量示例,随后Workflow和策略压缩技术(如SOPs、heuristics)提升了经验的可复用性。近年来,技能(Skills)作为可执行、可验证的知识单元,逐渐成为长远目标。开源技能生态的兴起带来了规模化管理挑战,存在冗余、质量参差、环境敏感等问题。代表性工作如SkillNet、SkillsBench等,强调技能的组织与验证,但缺乏系统的生命周期管理机制。随着技能体系的扩展,如何实现高效的检索、可信的演化成为核心难题。

核心问题

当前大规模技能库面临多重挑战:一是技能冗余与低质量,导致检索效率低和效果不稳定;二是技能更新缺乏责任归因机制,易引入污染;三是缺乏系统的生命周期管理,难以保证技能的持续演化和可信性。这些问题严重制约了技能在复杂长序列任务中的应用效果。尤其在开源生态中,技能的环境适应性和安全性成为瓶颈。解决这些问题,需引入结构化检索、责任归因和受控演化机制,建立闭环治理体系。

核心创新

本研究提出SkillsVote,创新点包括:1)基于结构化文件系统的技能检索与推荐,提升匹配效率;2)轨迹子任务归因,将长轨迹划分为责任明确、可复用的单元,增强责任追踪;3)证据门控机制,确保只有成功且责任明确的子任务驱动技能演化,避免污染;4)闭环治理体系,将推荐、归因与演化紧密结合,确保技能库的持续优化。该框架突破了传统技能管理的局限,实现了大规模、可信的技能生态治理。

方法详解

  • �� 采集超百万开源技能库,分析其环境适应性、质量和可验证性。• 在任务执行前,利用结构化文件系统进行技能检索,筛选相关技能,提供紧凑的使用上下文。• 执行轨迹后,将轨迹划分为责任明确的子任务,每个子任务对应单一目标和评价信号。• 归因模块判断每个子任务的成功或失败,责任归属到技能、探索或环境。• 提取可复用的探索和知识变更,形成受控的演化单元。• 通过证据门控机制,筛选出符合条件的子任务,驱动技能库的更新,确保演化的稳健性。

实验设计

在Terminal-Bench 2.0和SWE-Bench Pro上,采用GPT-系列模型(如GPT-5.2、GPT-5.4、GPT-5.5)进行评估。对比无技能、在线演化、离线迁移和预任务推荐等多种设置。指标包括准确率(avg@5)和解决率(avg@1),通过不同任务难度和模型规模验证效果。实验还分析技能路由性能、库规模扩展与成本关系,以及责任归因对演化质量的影响。采用 ablation 研究验证关键机制的贡献。

结果分析

SkillsVote在所有测试场景中均优于基线,平均准确率提升达2.6个百分点,解决率提升2.7个百分点。在大规模技能库中,路由准确率提升约16个百分点,成本降低,显示良好的扩展性。离线迁移实验表明,基于轨迹的技能库能显著提升未见任务的表现。受控演化机制确保技能更新的可靠性,有效避免了无关或错误技能的引入。这些结果验证了系统在复杂长序列任务中的优越性能和实用性。

应用场景

该框架适用于自动编程、机器人自主学习、复杂任务调度等场景。通过结构化技能库和受控演化机制,提升系统的适应性和安全性。未来可结合强化学习实现自主技能演化,推动智能机器人、自动化软件开发等行业的创新发展。

局限与展望

系统依赖大量开源技能库,质量不一,需引入更智能的过滤机制。复杂环境中归因准确性仍待提升,计算成本较高。未来需优化索引策略,增强多模态感知能力,提升系统的鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象一个厨房里有很多厨师(技能),每个厨师都擅长做某一道菜。平时厨师们会不断尝试新菜(探索),但厨房里也有一些不太靠谱的厨师(低质量技能),他们可能做出不合格的菜。为了保证菜的质量,厨房管理者(系统)会在每次做菜前,根据菜单(任务)选择合适的厨师(技能),并在菜做好后,检查菜的质量,把好的经验总结成新菜谱(技能演化)。只有做出好菜的厨师,才能让菜谱更新,保证厨房的菜越做越好。这个过程就像SkillsVote一样,确保厨房(技能生态)不断优化,做出更好吃的菜(任务解决方案)。

简单解释 像给14岁少年讲一样

想象你在学校里,有很多不同的老师(技能),每个老师教不同的科目。有时候,你需要完成一个特别的项目(任务),你会先去找最合适的老师帮忙(推荐技能),让他们给你一些指导。你开始做项目,完成后,你会回头看看哪些老师的建议帮了大忙,哪些没用(归因),还会总结出一些新的学习方法(技能演化),让以后做类似项目更快更好。这个系统就像SkillsVote一样,帮助学校里的老师和学生合作得更顺畅,项目做得更棒。它确保每次学习都能变得更聪明、更有效,未来还能自己学会新技能,变得更厉害!

原文摘要

Long-horizon LLM agents generate traces that could become reusable experience, but raw trajectories are noisy, local, and hard to govern. Agent Skills offer a structured artifact for combining procedural guidance, executable resources, and applicability boundaries. Yet open skill ecosystems contain redundant, uneven, environment-sensitive artifacts, and indiscriminate updates can pollute future context. We present SkillsVote, a lifecycle-governance framework for Agent Skills across collection, recommendation, attribution, and evolution. SkillsVote profiles a million-scale open source corpus for environment requirements, quality, and verifiability, and synthesizes tasks for verifiable skills. Before execution, it performs agentic library search over structured skill folders to expose instructional context. After execution, it decomposes trajectories into skill-linked subtasks, attributes outcomes to skill-guided execution, agent exploration, environment, and result signals, and admits only successful reusable discoveries to evidence-gated updates. Experiments on Terminal-Bench 2.0 and SWE-Bench Pro show that SkillsVote improves agent performance on challenging agentic coding benchmarks. The gains arise from two complementary pathways: online evolution over task streams at test time and offline transfer via frozen libraries built from either historical trajectories or curated open source skills.

cs.CL cs.AI