核心发现
方法论
SkillForge采用结构化技能表示、显式调用与效果追踪,结合多路径技能诱导和证据验证机制。通过在RL训练中引入技能调用标签,利用贝叶斯或指数滑动平均追踪技能成功率,结合多模态轨迹抽象与反思机制,不断优化技能库。核心算法包括基于GRPO的策略优化、多路径诱导的技能合成,以及基于效果的技能验证。技能库在多任务环境中动态扩展,确保技能质量。实验中,SkillForge在ALFWorld、WebShop和AppWorld环境中,成功实现技能的持续演化与验证,显著优于SkillRL,平均提升成功率6.3%。
关键结果
- 在ALFWorld任务中,SkillForge成功率达93.6%,比SkillRL提升3.7%;在WebShop中,成功率从72.7%提升至83.0%,平均得分提升10.5分;在AppWorld中,任务完成率由19.0%提升至23.8%,场景目标完成率从3.57%提升至14.3%。
- 引入显式技能调用和效果追踪显著改善技能利用效率, Ablation实验显示,去除技能验证或多路径诱导会导致性能下降约10%。
- 技能库在训练过程中逐步扩展,反思机制有效筛除低效技能,技能意图嵌入空间逐渐丰富,模型在不同规模(Qwen3-4B、Qwen3-30B)间迁移表现优异。
研究意义
该研究突破了RL中技能管理的瓶颈,提出持续验证与演化机制,有助于提升LLM代理在复杂、多任务环境中的泛化能力。通过引入结构化技能表示与效果追踪,增强了技能的可解释性和可靠性,为未来自主学习系统提供了理论基础与工程方案,有望推动智能体在自动化、机器人等领域的应用发展。
技术贡献
创新点在于引入显式技能调用与效果验证机制,结合多路径技能诱导与轨迹抽象,构建动态演化的技能库。算法上采用基于贝叶斯统计的技能效果追踪,结合多模态轨迹总结,优化策略与技能选择的联合训练。实现上,通过结构化技能表示与效果驱动的筛选机制,确保技能质量,提升学习效率。该框架兼容多模型规模,具备良好的扩展性与迁移能力,显著优于传统的技能存储与静态抽取方法。
新颖性
首次提出持续验证与演化的技能管理框架,打破以往技能库作为静态存储的局限。区别于SkillRL等方法,SkillForge引入效果驱动的技能筛选与多路径诱导机制,实现技能的动态扩展与优化,增强了技能的实用性与适应性,推动技能在RL中的持续演化研究。
局限性
- 当前方法对复杂环境中的长尾技能依赖较少,可能在极端任务中表现不足,且效果验证机制对噪声敏感,可能误判技能质量。
- 技能诱导与验证过程增加了训练复杂度和计算成本,尤其在大规模环境中,模型训练时间显著延长。
- 对技能表示的结构化设计依赖预定义模板,未来需探索更灵活的表示与自动化技能生成机制。
未来方向
未来将结合自监督学习与元学习技术,提升技能的自主演化能力。探索多模态、多任务环境中技能的泛化与迁移,增强模型的适应性。还计划引入更复杂的效果验证指标与多智能体协作机制,推动技能管理的理论体系完善,拓展到机器人控制、自动驾驶等实际应用场景。
AI 总览摘要
随着大规模语言模型(LLMs)在复杂决策任务中的广泛应用,强化学习(RL)成为训练智能体的核心技术。然而,现有RL方法多为片段式学习,难以跨任务积累可重用的知识。SkillRL等技能抽取方法虽能提取决策策略,但缺乏对技能效果的持续验证,导致技能库中潜藏低效或过时技能,影响整体性能。为解决这一问题,SkillForge提出了一套创新的技能演化框架,结合显式技能调用、效果追踪、多路径诱导与轨迹抽象,实现技能的动态验证与优化。该方法在ALFWorld、WebShop和AppWorld环境中经过大量实验,成功提升了任务成功率和效率,平均优于SkillRL 6.3%。通过持续的技能演化机制,SkillForge不仅增强了模型的适应性和鲁棒性,也为未来自主学习系统提供了理论基础。该研究的核心在于将技能管理从静态存储转向动态演化,确保技能的高质量与实用性,为智能体在多任务、多环境中的自主学习开辟了新路径。
深度分析
研究背景
近年来,随着LLMs的快速发展,基于强化学习的智能体在自动推理、任务执行等方面取得显著突破。代表性工作如ReAct、Reflection等,融合了推理与反思机制,提升了模型的自主性。然而,现有方法多依赖片段式学习,难以实现跨任务知识的积累与重用。技能抽取技术如SkillRL,通过从轨迹中提取决策策略,增强了模型的泛化能力,但未能有效验证技能的持续有效性,导致技能库中存在低效或过时技能。外部记忆机制虽能存储历史轨迹,但冗余信息多、难以提取高质量知识,限制了长期学习能力。整体来看,如何在保持模型灵活性的同时,建立可持续演化、验证的技能体系,成为当前研究的核心难题。
核心问题
核心问题在于RL代理中的技能管理缺乏有效的验证机制,导致技能库中潜藏大量低效或过时技能,影响学习效率和任务表现。传统方法多为静态存储或简单抽取,未能动态评估技能的实际效果,难以保证技能的高质量和适应性。如何在持续交互中实时验证技能效果,并据此优化技能内容,成为提升智能体自主学习能力的关键。该问题关系到模型的泛化能力、知识的可解释性以及系统的鲁棒性,亟需提出一种能在环境中持续演化、验证技能的机制。
核心创新
本研究的创新点在于引入持续验证机制,结合显式技能调用、多路径技能诱导与轨迹抽象,构建动态演化的技能库。具体创新包括:
1)显式技能调用:通过结构化标签,使技能调用行为可追踪、可优化;
2)效果追踪:利用贝叶斯或指数滑动平均统计技能成功率,动态评估技能质量;
3)多路径诱导:结合成功、失败、对比分析,合成新技能,丰富技能库;
4)轨迹抽象:利用大模型总结关键决策,提升技能的表达能力。这些创新共同实现了技能的持续演化与优化,显著优于传统静态存储方法。
方法详解
- �� 结构化技能表示:定义技能包括标题、意图、原则、适用条件、类别和状态标志,用于自包含管理。• 技能初始化:通过在环境中滚动策略,收集轨迹,利用教师模型提取成功策略和失败教训,构建初始技能库。• 技能检索:基于嵌入相似度,从技能库中检索相关技能,形成紧凑目录加入prompt。• 显式调用:在每个步骤,模型输出环境动作和可选技能调用标签,调用后返回完整技能内容,增强可追踪性。• 策略优化:结合轨迹中的奖励,采用GRPO算法,优化动作和技能调用决策。• 轨迹抽象:用大模型总结轨迹中的关键决策和技能调用,作为技能演化的基础。• 技能演化:每隔一定步数,利用成功轨迹生成新技能,结合失败和对比分析修正低效技能,更新技能库。• 证据验证:追踪技能效果,计算成功率和使用频次,结合模型反思,筛除低效技能,保证技能质量。
实验设计
在ALFWorld、WebShop和AppWorld三个环境中,评估SkillForge的性能。采用成功率、任务完成率和得分作为指标,比较不同模型规模(Qwen2.5-7B、Qwen3-4B、Qwen3-30B)。实验设置包括预训练模型、超参数(学习率1e-6、采样数G=8、KL系数1e-3),每隔5步进行技能库更新。对比基线包括SkillRL、ReAct、Reflection等,进行消融实验验证各模块贡献。通过大量训练,观察技能库的增长、技能意图空间的扩展,以及技能效果的持续改善。
结果分析
SkillForge在ALFWorld中成功率达93.6%,比SkillRL提升3.7%;WebShop成功率由72.7%提升至83.0%,得分提升10.5分;AppWorld任务完成率由19.0%提升至23.8%,场景目标完成率由3.57%提升至14.3%。消融实验显示,去除显式调用或技能验证会导致性能下降约10%。技能库在训练过程中逐步扩大,反思机制有效筛除低效技能,技能意图空间逐渐丰富,模型迁移表现优异,验证了方法的有效性与普适性。
应用场景
该方法适用于自主学习机器人、智能助手等场景,能显著提升多任务环境中的学习效率和适应性。通过持续验证和演化技能,系统能在复杂环境中自主优化行为策略,减少人工干预。未来可结合多模态信息,扩展到自动驾驶、工业自动化等领域,实现更高水平的自主决策与适应能力。
局限与展望
目前方法对极端环境或长尾技能的适应性有限,验证机制可能受噪声影响,导致误判。训练成本较高,尤其在大规模环境中,模型训练时间显著增加。技能表示依赖预定义模板,未来需探索更灵活的表示和自动化生成机制。此外,当前模型在极端任务中的泛化能力仍需提升,未来将结合元学习和自监督技术,增强技能的自主演化能力。
通俗解读 非专业人士也能看懂
想象你在经营一家工厂,工厂里有许多不同的工序(技能),每个工序都能帮你完成特定的任务。以前,你会把所有工序都记在一本手册里,遇到问题就翻一翻,但手册里的内容可能过时或不适用。现在,工厂引入了一套智能系统,它不仅能记住每个工序,还能根据实际情况不断验证这些工序是否有效。如果某个工序效果不好,它会自动修正或淘汰。这样,工厂的生产效率不断提升,工序也变得越来越智能化。这就像SkillForge一样,系统不断学习、验证和优化技能,让智能体在复杂环境中变得更聪明、更可靠。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,你需要学会很多技能,比如跳跃、躲避、攻击。以前,你只记住了一些技能,然后在游戏中随便用,但有时候用错了还会失败。现在,有个聪明的助手会帮你检查每个技能的效果,比如你用跳跃后成功了,或者被怪物打败了。这个助手会不断观察你用的技能,告诉你哪些技能有效,哪些需要改进。它还会根据你的失败经验,帮你创造新的技能,或者改良旧的技能。这样,你的游戏水平会越来越高,变得更厉害。这就像SkillForge一样,系统不断验证和优化技能,让你变得更强大、更聪明。
术语表
Skill (技能)
结构化的知识单元,包含目标、原则和适用条件,用于指导行为。技术上是决策策略的抽象表示。
在论文中,技能作为可调用的决策模块,用于增强RL代理的表现。
Effectiveness Tracking (效果追踪)
通过统计技能调用的成功率和使用频次,动态评估技能质量。技术上采用贝叶斯或指数滑动平均。
用于验证技能是否持续有效,筛除低效技能。
Trajectory Abstraction (轨迹抽象)
用大模型总结轨迹中的关键决策和技能调用,提取核心信息。
作为技能演化的基础,提升技能表达能力。
Multi-pathway Skill Induction (多路径技能诱导)
结合成功、失败和对比分析,合成新技能,丰富技能库。
实现技能的持续扩展与优化。
GRPO (Generalized Relative Policy Optimization)
一种强化学习策略优化算法,结合优势估计与策略剪裁,稳定训练。
用于优化带技能调用的策略。
开放问题 这项研究留下的未解疑问
- 1 如何在极端复杂环境中保证技能验证的鲁棒性?未来如何结合自监督学习提升技能的自主演化能力?
原文摘要
Large language model (LLM) agents are trained with reinforcement learning (RL) for complex decision-making tasks. However, most RL-trained agents remain episodic and cannot accumulate reusable knowledge across episodes. Recent skill-based approaches, such as SkillRL, attempt to address this issue by extracting skills from raw trajectories, but treat the skill bank as an append-only repository without verifying whether stored skills remain effective. In this paper, we propose SkillForge, a framework for continuous skill evolution that enables skills to be verified and refined through environment interaction. By making skill usage explicit during agent interaction, RL can directly optimize both environment actions and skill invocation decisions. SkillForge further introduces evidence-based skill verification and multi-pathway skill induction, allowing the skill bank to continuously grow while maintaining its quality. Extensive experiments on ALFWorld, WebShop, and AppWorld show that SkillForge consistently outperforms SkillRL, demonstrating the effectiveness of continuously verified skills in training stronger LLM agents.