SkillFlow:Benchmarking Lifelong Skill Discovery and Evolution for Autonomous Agents

TL;DR

SkillFlow基准测试自主体技能发现与演化,提升任务成功率8.43点。

cs.AI 🔴 高级 2026-04-19 33 次浏览
Ziao Zhang Kou Shi Shiting Huang Avery Nie Yu Zeng Yiming Zhao Zhen Fang Qishen Su Haibo Qiu Wei Yang Qingnan Ren Shun Zou Wenxuan Huang Lin Chen Zehui Chen Feng Zhao
自主学习 技能发现 终身学习 基准测试 机器人智能

核心发现

方法论

本研究提出SkillFlow基准,涵盖166个任务,分20个任务族,基于领域无关的执行流程(DAEF)设计任务架构。采用双智能体循环,第一为任务资产构建,第二为任务评审,结合轨迹和评分修正技能库。评估采用终身学习协议,模型从无技能开始,逐步解决任务,外化经验,修补技能,并持续更新技能库。实验中,Claude Opus 4.6模型在终身技能演化后,任务成功率由62.65%提升至71.08%。

关键结果

  • Claude Opus 4.6在终身学习下任务成功率提升8.43点,达71.08%,显著优于基线。Kimi K2.5虽技能使用率达66.87%,但提升仅0.60点,Qwen-Coder-Next任务完成率仅44.58%,表现甚至退步,显示模型在技能修补和迁移方面存在不足。
  • 不同模型表现差异明显,强模型如Claude Opus 4.6能稳定修正技能,提升能力;弱模型则难以整合经验,导致能力退化。技能使用率与实际效用不完全一致,反映模型在技能修补和迁移中的局限。
  • 通过分析发现,模型在技能碎片化、错误强化和技能修复不稳定等方面存在共性失败模式,提示未来需改进技能表示和修补机制。

研究意义

本研究填补了自主智能体在技能发现、修补与演化方面的研究空白,为终身学习和自主技能管理提供了系统化评测平台。该基准促进模型在复杂、多任务环境中自主构建和维护技能库,推动自主智能体向更高的自主性和适应性发展。其结果对机器人、自动化系统及AI应用中的持续学习具有重要指导意义,有助于实现更具弹性和可扩展的智能系统。

技术贡献

提出基于领域无关执行流程(DAEF)的任务架构,结合双智能体循环机制,系统性评估技能发现、修补、迁移和失败模式。引入终身学习协议,强调技能外化与持续更新,创新性地将技能修补融入连续任务流程。实验验证不同模型在技能演化中的表现差异,为未来模型设计提供了理论基础和实践指南。

新颖性

首次系统性建立基于DAEF的终身技能演化基准,结合轨迹和评分驱动的技能修补机制,突破传统静态技能评估的局限。与现有技能库方法不同,本研究强调技能的自主发现与持续演化,揭示模型在连续学习中的能力瓶颈,为自主智能体的长期能力积累提供新思路。

局限性

  • 当前模型在技能整合和迁移方面仍存在显著不足,表现出碎片化和错误强化的问题,限制了能力的稳定提升。
  • 基准任务虽覆盖多领域,但仍偏向模拟环境,实际应用中复杂性和不确定性更高,模型适应性待验证。
  • 技能修补机制依赖模型的原生能力,存在泛化能力不足和修补不稳定的风险,未来需引入更强的知识表示和推理机制。

未来方向

未来将探索更高效的技能表示与修补机制,提升模型在复杂环境中的迁移能力。加强多任务、多领域的终身学习能力,结合强化学习和元学习技术,推动自主智能体实现更稳定的能力积累。同时,扩展真实场景应用,验证模型在实际工业、服务和机器人系统中的表现。

AI 总览摘要

随着自主智能体在复杂任务中的应用不断扩大,如何实现其技能的自主发现、修补与演化成为研究热点。传统评测多关注模型对预定义技能的利用,而忽视了模型自主构建和持续优化技能的能力。为此,SkillFlow基准应运而生,涵盖166个任务,分布在20个任务族,基于领域无关的执行流程(DAEF)设计任务架构,支持跨任务技能迁移和演化。该基准采用双智能体循环机制,任务资产由一方构建,另一方评审,结合轨迹和评分反馈不断修补技能库。模型在无技能起点,通过连续任务解决、经验外化和技能修补,逐步建立起适应性强的技能体系。实验结果显示,Claude Opus 4.6模型在终身学习下,任务成功率由62.65%提升至71.08%,验证了技能演化的有效性。不同模型表现差异明显,强模型能稳定修正技能,持续提升能力;弱模型则存在碎片化和错误强化的问题,反映当前模型在技能整合方面的局限。研究揭示了模型在技能碎片化、错误强化和修补不稳定等方面的共性失败模式,为未来改进提供了方向。该基准不仅推动了自主技能管理的理论研究,也为工业机器人、自动化系统等实际应用提供了评估工具,助力智能体实现更高水平的自主学习和适应能力。未来,结合强化学习和元学习等技术,将进一步提升模型的技能迁移和持续演化能力,推动自主智能体向更复杂、更稳定的自主能力迈进。

深度分析

研究背景

近年来,随着大规模预训练模型(如GPT系列、Codex、Claude)的崛起,自主智能体在多任务环境中的应用逐渐成为研究焦点。早期工作如SkillsBench、MemorySkill等,强调技能的预定义和静态利用,但缺乏模型自主发现和演化能力。随着终身学习和持续适应的需求增加,研究逐步转向模型如何在连续任务中自主构建、修补和迁移技能。现有方法多依赖外部知识库或预定义技能集,难以实现真正的自主能力积累。SkillFlow的提出,旨在突破这一瓶颈,建立系统化的评测平台,推动模型在复杂、多任务环境中的自主能力。

核心问题

当前模型在技能发现、修补和迁移方面表现有限,难以实现持续能力的稳定增长。传统方法多依赖静态技能库,缺乏动态修补机制,导致能力碎片化、错误强化和迁移失败。如何设计一个能促使模型自主发现、修补和演化技能的系统,成为核心难题。这不仅关系到模型的自主性,也影响其在实际应用中的适应性和可靠性。解决这一问题需要建立统一的任务架构、有效的技能外化机制以及持续学习的评估体系。

核心创新

本研究创新点在于提出基于领域无关执行流程(DAEF)的任务架构,结合双智能体循环机制,实现技能的自主发现、修补和迁移。具体创新包括:1)设计统一的任务流程框架,支持跨任务迁移;2)引入轨迹和评分驱动的技能修补机制,增强模型的能力修正能力;3)建立终身学习协议,系统评估模型在连续任务中的能力演化。与现有静态技能库方法不同,本研究强调模型自主构建和持续优化技能,突破了技能碎片化和迁移难题,为自主智能体的长期能力积累提供了新路径。

方法详解

  • �� 任务架构设计:基于DAEF抽象任务流程,去除领域特定实体,保留操作类型和依赖关系。• 任务构建:从公开数据集筛选真实场景任务,利用双智能体循环生成任务资产和评审任务,确保任务多样性和稳定性。• 技能外化:模型在解决任务后,根据轨迹和评分反馈生成技能修补包,逐步建立技能库。• 终身学习协议:模型从无技能开始,连续解决任务,修补和迁移技能,更新技能库,评估能力演化。• 评估指标:任务成功率、技能使用率、修补效果和能力增长。• 实验流程:在多个模型上测试,包括Claude、Codex、Qwen等,比较静态与动态技能策略的表现。

实验设计

采用20个任务族,166个任务,涵盖财务、医疗、供应链等领域。模型在无技能起点下,逐任务解决,利用轨迹和评分修补技能。对比静态技能和终身演化策略,评估任务成功率、成本、技能利用率等指标。实验中,模型经过多轮修补,观察技能库的变化和能力的持续增长。通过不同模型的表现,分析技能修补的有效性和模型的适应性。

结果分析

Claude Opus 4.6模型在终身学习后,任务成功率从62.65%提升至71.08%,表现优于其他模型。技能使用率高达66.87%,但实际能力提升有限,显示模型在技能修补和迁移方面仍有不足。部分模型如Qwen-Coder-Next表现退步,提示模型在连续学习中的不稳定性。分析发现,模型在技能碎片化、错误强化和修补不稳定方面存在共性问题,未来需改进技能表示和修补机制。

应用场景

该基准可用于评估自主智能体在工业机器人、自动化流程、企业决策等场景中的能力演化。模型能自主发现和修补技能,适应复杂环境,提升自主性和鲁棒性。未来,结合强化学习和元学习技术,有望实现更高效的技能迁移和持续学习,推动智能系统在实际应用中的广泛部署。

局限与展望

当前模型在技能整合和迁移方面仍存在不足,表现出碎片化和错误强化问题。基准任务偏向模拟环境,实际应用中复杂性更高。技能修补机制依赖模型原生能力,泛化能力有限,未来需引入更强的知识表示和推理机制。模型在多任务、多领域中的表现仍有待提升,需结合更先进的学习策略和知识管理技术。

通俗解读 非专业人士也能看懂

想象你在学习做菜。刚开始,你只会做几道简单的菜,比如炒蛋。随着你不断尝试新菜,遇到问题时,你会总结经验,改进配方。每次做完菜,你都在记笔记,下一次做得更好。慢慢地,你的菜谱变得丰富,能应对不同的场合。这个过程就像智能体学习技能一样,它从没有技能开始,通过不断尝试、修正和总结,逐步建立起自己的“菜谱库”。每次遇到失败,它会分析原因,修补技能,变得越来越擅长。这种持续学习和改进的过程,正是SkillFlow研究的核心思想。它让机器像厨师一样,自己发现问题、解决问题,不断变得更厉害。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,刚开始你什么都不会,只能用最基本的技能。每次玩完后,你会想:我还能怎么做得更好?于是你尝试不同的方法,发现哪些技能有效,哪些需要改进。每次失败后,你会总结经验,修正技能,然后用新的技能继续玩。慢慢地,你变得越来越厉害,能应对各种挑战。这就像机器人学习一样,它从没有技能开始,通过不断尝试、修补和学习,逐步变得更聪明。这个过程就像你在游戏中不断练习,积累经验,最终成为高手。SkillFlow的研究,就是让机器自己像你一样,学会发现问题、修补技能,不断变得更厉害。未来,这样的机器人可以自己学习新技能,解决更复杂的问题,就像你在游戏中变得越来越厉害一样。

原文摘要

As the capability frontier of autonomous agents continues to expand, they are increasingly able to complete specialized tasks through plug-and-play external skills. Yet current benchmarks mostly test whether models can use provided skills, leaving open whether they can discover skills from experience, repair them after failure, and maintain a coherent library over time. We introduce SkillFlow, a benchmark of 166 tasks across 20 families in which task construction within each family follows a Domain-Agnostic Execution Flow (DAEF) that defines an agent workflow framework, allowing these tasks to share a consistent workflow. Agents are evaluated under an Agentic Lifelong Learning protocol in which they begin without skills, solve tasks sequentially within each family, externalize lessons through trajectory- and rubric-driven skill patches, and carry the updated library forward. Experiments reveal a substantial capability gap. For Claude Opus 4.6, lifelong skill evolution improves task success from 62.65% to 71.08% (+8.43 points). However, high skill usage does not necessarily imply high utility: Kimi K2.5 gains only +0.60 points despite 66.87% skill usage, while Qwen-Coder-Next reaches only a 44.58% task completion rate and still regresses relative to the vanilla setting. SkillFlow contributes a structured testbed for this direction and an in-depth empirical analysis of skill discovery, patching, transfer, and their failure modes under lifelong evaluation.

cs.AI