SkillRL: Evolving Agents via Recursive Skill-Augmented Reinforcement Learning

TL;DR

SkillRL通过递归技能增强强化学习,在ALFWorld等任务中提升15.3%的性能。

cs.LG 🔴 高级 2026-02-09 4 次浏览
Peng Xia Jianwen Chen Hanyang Wang Jiaqi Liu Kaide Zeng Yu Wang Siwei Han Yiyang Zhou Xujiang Zhao Haifeng Chen Zeyu Zheng Cihang Xie Huaxiu Yao
强化学习 技能发现 递归进化 大语言模型 经验抽象

核心发现

方法论

SkillRL通过经验驱动的技能蒸馏机制构建分层技能库SkillBank,并采用自适应检索策略和递归进化机制,使技能库与代理策略在强化学习过程中共同进化。该方法显著减少了令牌占用,同时增强了推理能力。

关键结果

  • 在ALFWorld上,SkillRL的成功率达到89.9%,比GRPO提高了12.3%。
  • 在WebShop任务中,SkillRL的成功率为72.7%,显著优于基线方法。
  • 在七个搜索增强任务中,SkillRL平均得分为47.1%,超越了EvolveR的43.1%。

研究意义

SkillRL通过自动技能发现和递归进化,解决了现有方法中经验冗余和噪声问题,显著提升了大语言模型在复杂任务中的泛化能力。这一框架为强化学习领域提供了新的思路,尤其在需要高效经验转移的场景中。

技术贡献

SkillRL引入了经验蒸馏和递归进化机制,与现有方法相比,提供了更高效的技能抽象和策略优化方式。这种方法不仅提高了任务成功率,还增强了模型的推理能力和鲁棒性。

新颖性

SkillRL首次将技能发现与递归进化结合,形成动态进化的技能库,突破了传统经验存储方法的局限,提供了更高效的经验转移机制。

局限性

  • 在某些复杂任务中,技能库的构建和更新可能导致计算开销增加。
  • 技能检索的准确性依赖于任务描述的质量。

未来方向

未来研究可以探索更高效的技能检索算法,以及在更大规模任务上的应用,以进一步提升SkillRL的性能和适用性。

AI 总览摘要

SkillRL通过递归技能增强强化学习,显著提升了大语言模型在复杂任务中的表现。现有方法往往存储原始轨迹,导致冗余和噪声问题,阻碍了高层次行为模式的提取。SkillRL通过经验蒸馏机制构建分层技能库SkillBank,并采用自适应检索策略和递归进化机制,使技能库与代理策略在强化学习过程中共同进化。

在ALFWorld、WebShop和七个搜索增强任务上的实验结果表明,SkillRL达到了最先进的性能,超过强基线15.3%,并在任务复杂性增加时保持了鲁棒性。SkillRL的创新之处在于其自动技能发现和递归进化机制,解决了现有方法中经验冗余和噪声问题,显著提升了大语言模型在复杂任务中的泛化能力。

尽管SkillRL在多个任务中表现优异,但在某些复杂任务中,技能库的构建和更新可能导致计算开销增加。未来研究可以探索更高效的技能检索算法,以及在更大规模任务上的应用,以进一步提升SkillRL的性能和适用性。

深度分析

研究背景

近年来,大语言模型在复杂任务中表现出色,但其往往独立运行,无法从过去的经验中学习。现有基于记忆的方法主要存储原始轨迹,导致冗余和噪声问题,阻碍了高层次行为模式的提取。

核心问题

大语言模型在复杂任务中往往无法有效利用过去的经验,现有方法存储的原始轨迹冗长且噪声大,难以提取关键信息,导致模型难以在新任务中泛化。

核心创新

SkillRL通过自动技能发现和递归进化机制,形成动态进化的技能库,突破了传统经验存储方法的局限,提供了更高效的经验转移机制。

方法详解

  • �� 经验蒸馏机制:将多样化的轨迹转化为结构化技能。
  • �� 分层技能库SkillBank:区分通用技能和任务特定技能。
  • �� 递归进化机制:在强化学习过程中动态更新技能库。

实验设计

在ALFWorld、WebShop和七个搜索增强任务上进行实验,比较了SkillRL与多种基线方法的性能,使用成功率和平均得分作为主要评估指标。

结果分析

SkillRL在ALFWorld上成功率达到89.9%,在WebShop上为72.7%,在搜索增强任务中平均得分为47.1%,均显著优于基线方法。

应用场景

SkillRL适用于需要高效经验转移的复杂任务,如智能家居控制、自动驾驶等领域,能够显著提升任务成功率和模型鲁棒性。

局限与展望

在某些复杂任务中,技能库的构建和更新可能导致计算开销增加,技能检索的准确性依赖于任务描述的质量。

通俗解读 非专业人士也能看懂

想象一个厨师在厨房里工作。传统方法就像厨师每次都要从头开始做菜,而SkillRL就像厨师有一本食谱,里面记录了各种菜肴的做法。每次做菜时,厨师只需查阅食谱,就能快速找到所需的步骤和技巧。这不仅节省了时间,还提高了菜肴的成功率。SkillRL通过将复杂任务分解为可重复使用的技能,就像将复杂的菜肴分解为简单的步骤一样,使得模型能够更高效地完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每次都要从头开始学怎么过关,这样会很累吧?SkillRL就像是一个超级攻略,它把每次过关的经验都总结成简单的技巧,下次你遇到类似的关卡时,只要看看攻略就能轻松过关。这就像你在学校学数学,有了公式和解题技巧,做题就变得简单多了。SkillRL就是让大语言模型在复杂任务中也能像你用攻略一样轻松应对!

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过与环境交互获得奖励来学习最优策略。

SkillRL通过强化学习机制实现技能库的递归进化。

技能蒸馏 (Skill Distillation)

从复杂的经验中提取出可重复使用的技能,减少冗余和噪声。

SkillRL使用技能蒸馏机制构建分层技能库。

递归进化 (Recursive Evolution)

在强化学习过程中动态更新技能库,使其与代理策略共同进化。

SkillRL通过递归进化机制提高了模型的适应性。

技能库 (SkillBank)

一个包含通用技能和任务特定技能的分层结构,用于指导决策。

SkillRL的核心组件之一,用于存储和检索技能。

大语言模型 (Large Language Model)

一种基于深度学习的模型,能够理解和生成自然语言。

SkillRL在大语言模型中实现了技能增强。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的任务中高效应用SkillRL?目前的技能检索算法在复杂任务中可能存在瓶颈。
  • 2 如何进一步减少技能库的计算开销?在某些复杂任务中,技能库的构建和更新可能导致计算开销增加。

应用场景

近期应用

智能家居控制

SkillRL可以用于智能家居系统,通过学习用户习惯,提高设备的自动化和智能化水平。

远期愿景

自动驾驶

通过SkillRL的技能增强机制,自动驾驶系统可以更好地适应复杂路况,提高行驶安全性和效率。

原文摘要

Large Language Model (LLM) agents have shown stunning results in complex tasks, yet they often operate in isolation, failing to learn from past experiences. Existing memory-based methods primarily store raw trajectories, which are often redundant and noise-heavy. This prevents agents from extracting high-level, reusable behavioral patterns that are essential for generalization. In this paper, we propose SkillRL, a framework that bridges the gap between raw experience and policy improvement through automatic skill discovery and recursive evolution. Our approach introduces an experience-based distillation mechanism to build a hierarchical skill library SkillBank, an adaptive retrieval strategy for general and task-specific heuristics, and a recursive evolution mechanism that allows the skill library to co-evolve with the agent's policy during reinforcement learning. These innovations significantly reduce the token footprint while enhancing reasoning utility. Experimental results on ALFWorld, WebShop and seven search-augmented tasks demonstrate that SkillRL achieves state-of-the-art performance, outperforming strong baselines over 15.3% and maintaining robustness as task complexity increases. Code is available at this https://github.com/aiming-lab/SkillRL.

cs.LG