SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents
SkillFlow基准测试自主体技能发现与演化,提升任务成功率8.43点。
核心发现
方法论
本研究提出SkillFlow基准,涵盖166个任务,分20个任务族,基于领域无关的执行流程(DAEF)设计任务架构。采用双智能体循环,第一为任务资产构建,第二为任务评审,结合轨迹和评分修正技能库。评估采用终身学习协议,模型从无技能开始,逐步解决任务,外化经验,修补技能,并持续更新技能库。实验中,Claude Opus 4.6模型在终身技能演化后,任务成功率由62.65%提升至71.08%。
关键结果
- Claude Opus 4.6在终身学习下任务成功率提升8.43点,达71.08%,显著优于基线。Kimi K2.5虽技能使用率达66.87%,但提升仅0.60点,Qwen-Coder-Next任务完成率仅44.58%,表现甚至退步,显示模型在技能修补和迁移方面存在不足。
- 不同模型表现差异明显,强模型如Claude Opus 4.6能稳定修正技能,提升能力;弱模型则难以整合经验,导致能力退化。技能使用率与实际效用不完全一致,反映模型在技能修补和迁移中的局限。
- 通过分析发现,模型在技能碎片化、错误强化和技能修复不稳定等方面存在共性失败模式,提示未来需改进技能表示和修补机制。
研究意义
本研究填补了自主智能体在技能发现、修补与演化方面的研究空白,为终身学习和自主技能管理提供了系统化评测平台。该基准促进模型在复杂、多任务环境中自主构建和维护技能库,推动自主智能体向更高的自主性和适应性发展。其结果对机器人、自动化系统及AI应用中的持续学习具有重要指导意义,有助于实现更具弹性和可扩展的智能系统。
技术贡献
提出基于领域无关执行流程(DAEF)的任务架构,结合双智能体循环机制,系统性评估技能发现、修补、迁移和失败模式。引入终身学习协议,强调技能外化与持续更新,创新性地将技能修补融入连续任务流程。实验验证不同模型在技能演化中的表现差异,为未来模型设计提供了理论基础和实践指南。
新颖性
首次系统性建立基于DAEF的终身技能演化基准,结合轨迹和评分驱动的技能修补机制,突破传统静态技能评估的局限。与现有技能库方法不同,本研究强调技能的自主发现与持续演化,揭示模型在连续学习中的能力瓶颈,为自主智能体的长期能力积累提供新思路。
局限性
- 当前模型在技能整合和迁移方面仍存在显著不足,表现出碎片化和错误强化的问题,限制了能力的稳定提升。
- 基准任务虽覆盖多领域,但仍偏向模拟环境,实际应用中复杂性和不确定性更高,模型适应性待验证。
- 技能修补机制依赖模型的原生能力,存在泛化能力不足和修补不稳定的风险,未来需引入更强的知识表示和推理机制。
未来方向
未来将探索更高效的技能表示与修补机制,提升模型在复杂环境中的迁移能力。加强多任务、多领域的终身学习能力,结合强化学习和元学习技术,推动自主智能体实现更稳定的能力积累。同时,扩展真实场景应用,验证模型在实际工业、服务和机器人系统中的表现。
AI 总览摘要
随着自主智能体在复杂任务中的应用不断扩大,如何实现其技能的自主发现、修补与演化成为研究热点。传统评测多关注模型对预定义技能的利用,而忽视了模型自主构建和持续优化技能的能力。为此,SkillFlow基准应运而生,涵盖166个任务,分布在20个任务族,基于领域无关的执行流程(DAEF)设计任务架构,支持跨任务技能迁移和演化。该基准采用双智能体循环机制,任务资产由一方构建,另一方评审,结合轨迹和评分反馈不断修补技能库。模型在无技能起点,通过连续任务解决、经验外化和技能修补,逐步建立起适应性强的技能体系。实验结果显示,Claude Opus 4.6模型在终身学习下,任务成功率由62.65%提升至71.08%,验证了技能演化的有效性。不同模型表现差异明显,强模型能稳定修正技能,持续提升能力;弱模型则存在碎片化和错误强化的问题,反映当前模型在技能整合方面的局限。研究揭示了模型在技能碎片化、错误强化和修补不稳定等方面的共性失败模式,为未来改进提供了方向。该基准不仅推动了自主技能管理的理论研究,也为工业机器人、自动化系统等实际应用提供了评估工具,助力智能体实现更高水平的自主学习和适应能力。未来,结合强化学习和元学习等技术,将进一步提升模型的技能迁移和持续演化能力,推动自主智能体向更复杂、更稳定的自主能力迈进。
深度分析
研究背景
近年来,随着大规模预训练模型(如GPT系列、Codex、Claude)的崛起,自主智能体在多任务环境中的应用逐渐成为研究焦点。早期工作如SkillsBench、MemorySkill等,强调技能的预定义和静态利用,但缺乏模型自主发现和演化能力。随着终身学习和持续适应的需求增加,研究逐步转向模型如何在连续任务中自主构建、修补和迁移技能。现有方法多依赖外部知识库或预定义技能集,难以实现真正的自主能力积累。SkillFlow的提出,旨在突破这一瓶颈,建立系统化的评测平台,推动模型在复杂、多任务环境中的自主能力。
核心问题
当前模型在技能发现、修补和迁移方面表现有限,难以实现持续能力的稳定增长。传统方法多依赖静态技能库,缺乏动态修补机制,导致能力碎片化、错误强化和迁移失败。如何设计一个能促使模型自主发现、修补和演化技能的系统,成为核心难题。这不仅关系到模型的自主性,也影响其在实际应用中的适应性和可靠性。解决这一问题需要建立统一的任务架构、有效的技能外化机制以及持续学习的评估体系。
核心创新
本研究创新点在于提出基于领域无关执行流程(DAEF)的任务架构,结合双智能体循环机制,实现技能的自主发现、修补和迁移。具体创新包括:1)设计统一的任务流程框架,支持跨任务迁移;2)引入轨迹和评分驱动的技能修补机制,增强模型的能力修正能力;3)建立终身学习协议,系统评估模型在连续任务中的能力演化。与现有静态技能库方法不同,本研究强调模型自主构建和持续优化技能,突破了技能碎片化和迁移难题,为自主智能体的长期能力积累提供了新路径。
方法详解
- �� 任务架构设计:基于DAEF抽象任务流程,去除领域特定实体,保留操作类型和依赖关系。• 任务构建:从公开数据集筛选真实场景任务,利用双智能体循环生成任务资产和评审任务,确保任务多样性和稳定性。• 技能外化:模型在解决任务后,根据轨迹和评分反馈生成技能修补包,逐步建立技能库。• 终身学习协议:模型从无技能开始,连续解决任务,修补和迁移技能,更新技能库,评估能力演化。• 评估指标:任务成功率、技能使用率、修补效果和能力增长。• 实验流程:在多个模型上测试,包括Claude、Codex、Qwen等,比较静态与动态技能策略的表现。
实验设计
采用20个任务族,166个任务,涵盖财务、医疗、供应链等领域。模型在无技能起点下,逐任务解决,利用轨迹和评分修补技能。对比静态技能和终身演化策略,评估任务成功率、成本、技能利用率等指标。实验中,模型经过多轮修补,观察技能库的变化和能力的持续增长。通过不同模型的表现,分析技能修补的有效性和模型的适应性。
结果分析
Claude Opus 4.6模型在终身学习后,任务成功率从62.65%提升至71.08%,表现优于其他模型。技能使用率高达66.87%,但实际能力提升有限,显示模型在技能修补和迁移方面仍有不足。部分模型如Qwen-Coder-Next表现退步,提示模型在连续学习中的不稳定性。分析发现,模型在技能碎片化、错误强化和修补不稳定方面存在共性问题,未来需改进技能表示和修补机制。
应用场景
该基准可用于评估自主智能体在工业机器人、自动化流程、企业决策等场景中的能力演化。模型能自主发现和修补技能,适应复杂环境,提升自主性和鲁棒性。未来,结合强化学习和元学习技术,有望实现更高效的技能迁移和持续学习,推动智能系统在实际应用中的广泛部署。
局限与展望
当前模型在技能整合和迁移方面仍存在不足,表现出碎片化和错误强化问题。基准任务偏向模拟环境,实际应用中复杂性更高。技能修补机制依赖模型原生能力,泛化能力有限,未来需引入更强的知识表示和推理机制。模型在多任务、多领域中的表现仍有待提升,需结合更先进的学习策略和知识管理技术。
通俗解读 非专业人士也能看懂
想象你在学习做菜。刚开始,你只会做几道简单的菜,比如炒蛋。随着你不断尝试新菜,遇到问题时,你会总结经验,改进配方。每次做完菜,你都在记笔记,下一次做得更好。慢慢地,你的菜谱变得丰富,能应对不同的场合。这个过程就像智能体学习技能一样,它从没有技能开始,通过不断尝试、修正和总结,逐步建立起自己的“菜谱库”。每次遇到失败,它会分析原因,修补技能,变得越来越擅长。这种持续学习和改进的过程,正是SkillFlow研究的核心思想。它让机器像厨师一样,自己发现问题、解决问题,不断变得更厉害。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,刚开始你什么都不会,只能用最基本的技能。每次玩完后,你会想:我还能怎么做得更好?于是你尝试不同的方法,发现哪些技能有效,哪些需要改进。每次失败后,你会总结经验,修正技能,然后用新的技能继续玩。慢慢地,你变得越来越厉害,能应对各种挑战。这就像机器人学习一样,它从没有技能开始,通过不断尝试、修补和学习,逐步变得更聪明。这个过程就像你在游戏中不断练习,积累经验,最终成为高手。SkillFlow的研究,就是让机器自己像你一样,学会发现问题、修补技能,不断变得更厉害。未来,这样的机器人可以自己学习新技能,解决更复杂的问题,就像你在游戏中变得越来越厉害一样。
原文摘要
As the capability frontier of autonomous agents continues to expand, they are increasingly able to complete specialized tasks through plug-and-play external skills. Yet current benchmarks mostly test whether models can use provided skills, leaving open whether they can discover skills from experience, repair them after failure, and maintain a coherent library over time. We introduce SkillFlow, a benchmark of 166 tasks across 20 families in which task construction within each family follows a Domain-Agnostic Execution Flow (DAEF) that defines an agent workflow framework, allowing these tasks to share a consistent workflow. Agents are evaluated under an Agentic Lifelong Learning protocol in which they begin without skills, solve tasks sequentially within each family, externalize lessons through trajectory- and rubric-driven skill patches, and carry the updated library forward. Experiments reveal a substantial capability gap. For Claude Opus 4.6, lifelong skill evolution improves task success from 62.65% to 71.08% (+8.43 points). However, high skill usage does not necessarily imply high utility: Kimi K2.5 gains only +0.60 points despite 66.87% skill usage, while Qwen-Coder-Next reaches only a 44.58% task completion rate and still regresses relative to the vanilla setting. SkillFlow contributes a structured testbed for this direction and an in-depth empirical analysis of skill discovery, patching, transfer, and their failure modes under lifelong evaluation.