Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

TL;DR

提出BCSD框架,通过双向自蒸馏提升LLM外部技能利用率,实验在ALFWorld和WebShop中表现优异。

cs.AI 🔴 高级 2026-08-10 64 次浏览
Tianjun Pan Yuan Li Hongda Wang Linbo Jin Mengfei Song Lei Gao Qiming Shi Shaokang Fu Jiarong Zhao Chengyu Wang Chengfu Huo
强化学习 大语言模型 技能利用 自蒸馏 多视角

核心发现

方法论

BCSD结合自蒸馏与强化学习,设计双向技能-上下文视角。引入Meta-Skill指导高层次技能应用,利用剪枝视角突出任务相关技能。通过计算两个视角的token级概率差异,动态调节优势值,增强技能利用效果。采用GRPO作为优化基础,将两个视角的信号融合,提升策略对外部技能的利用效率。

关键结果

  • 在ALFWorld和WebShop上,BCSD在不同模型规模中均优于基线,Qwen2.5-7B模型成功率提升3.1个百分点,达到83.6%;WebShop成功率提升2.4个百分点,达78.1%。在Qwen2.5-3B模型中,成功率分别超越最优基线5.4和9.4点,表现显著优越。
  • 消融实验显示,Meta-Skill视角贡献最大,去除后性能下降明显,验证其在高层次指导中的关键作用。调节优势调度系数λ的合理性也被验证,适中值(如0.1)能显著提升训练效果。
  • 多视角信号的结合增强了策略的稳定性和泛化能力,模型在长序列任务中的技能利用表现优于单一视角方法,验证了双向自蒸馏的有效性。

研究意义

该研究突破了以往仅依赖任务奖励的强化学习训练方式,通过引入多视角自蒸馏,有效提升LLM在复杂任务中对外部技能的利用能力。这不仅丰富了技能利用的理论体系,也为实际应用中的多任务、多技能场景提供了技术支撑。未来,该方法有望在机器人、智能助理等领域实现更高效的技能迁移与调度,推动AI系统的自主学习能力迈上新台阶。

技术贡献

提出双向上下文自蒸馏框架,创新性地结合Meta-Skill和剪枝视角,利用token级差异调节优势值,增强外部技能的利用效率。引入多视角信号融合机制,改进了传统单视角自蒸馏的稳定性与可靠性。算法在GRPO基础上实现优势重调,兼顾奖励信号与上下文信息,提升策略的适应性与泛化能力。这为强化学习中的技能利用提供了新的技术路径。

新颖性

首次将双向上下文视角引入强化学习中的自蒸馏机制,系统性地提升LLM对外部技能的利用效率。区别于以往单一上下文或参数内化的方案,本方法通过Meta-Skill和剪枝视角的互补,解决了长序列任务中信号不可靠的问题,具有较强创新性和实用价值。

局限性

  • 当前方法依赖于预训练的Meta-Skill提取,可能在新任务或未覆盖的技能场景中表现不足,需进一步扩展Meta-Skill的泛化能力。
  • 计算成本较高,双视角信号的实时计算与融合增加了训练复杂度,限制了大规模应用的效率。
  • 在极端稀疏奖励或高度噪声环境下,优势调节机制可能失效,影响策略稳定性。

未来方向

未来将探索Meta-Skill的自动化生成与动态更新机制,结合多模态信息丰富Meta-Skill表达。还计划引入多任务学习框架,增强模型在多场景下的技能迁移能力。同时,优化算法以降低计算成本,提升大规模应用的实用性。

AI 总览摘要

在复杂任务中,如何有效利用外部自然语言技能一直是强化学习中的难题。传统方法多依赖稀疏奖励,难以捕捉策略对技能的实际利用效果。本文提出BCSD(双向上下文自蒸馏)框架,创新性地结合多视角自蒸馏机制,显著提升LLM在技能利用上的表现。

BCSD设计了两个互补的上下文视角:高层Meta-Skill指导策略如何应用技能,和剪枝视角突出任务相关技能。通过计算两个视角的token级概率差异,调节优势值,从而引导模型更准确地利用外部技能。该机制在ALFWorld和WebShop两个长序列任务中,经过多模型规模验证,均优于现有主流方法,成功率提升明显。

实验结果显示,Meta-Skill视角的引入是性能提升的关键,合理调节优势调度系数也极大改善训练效果。多视角信号融合增强了模型的稳定性和泛化能力,使得策略在复杂环境中表现更优。该方法不仅丰富了强化学习中的技能利用策略,也为未来多任务、多技能场景提供了技术基础。

尽管取得了显著进展,BCSD仍面临Meta-Skill泛化、计算成本高等挑战。未来工作将聚焦于Meta-Skill的自动化生成、多模态融合,以及算法效率的提升,以推动其在实际应用中的广泛落地。整体而言,BCSD为强化学习中外部技能的高效利用提供了新的思路和工具,具有重要的理论和实践价值。

深度分析

研究背景

近年来,随着大规模预训练模型的发展,LLM在多任务场景中展现出强大能力。技能增强方法主要分为两类:一类是外部技能存储与检索(如SkillRL、SkillEvolver),强调技能的可重用性;另一类是技能参数内化(如Skill-SD、SDAR),追求模型自主学习。尽管如此,技能的有效利用仍是瓶颈,尤其在长序列任务中,策略难以区分技能的实际贡献。现有方法多依赖稀疏奖励,导致技能利用不充分。自蒸馏技术的引入,为细粒度监督提供了新途径,但单一上下文信号存在不稳定和偏差问题。本文旨在通过多视角机制,提升技能利用的稳定性和效果,推动强化学习在复杂场景中的应用。

核心问题

核心问题在于,现有强化学习方法难以确保策略能有效利用外部提供的自然语言技能。稀疏奖励导致对技能应用的反馈不足,模型难以区分技能的有效性与否。此外,单一上下文的自蒸馏信号容易受到偏差和信息泄露影响,造成训练不稳定。如何设计一种机制,使模型在长序列、多技能环境中,既能充分利用外部技能,又能保持训练的稳定性,成为亟待解决的难题。这关系到智能系统的自主学习能力和迁移能力,具有重要的理论和实际意义。

核心创新

本研究的创新点主要在于引入双向上下文视角,结合Meta-Skill和剪枝视角,设计了BCSD框架。第一,Meta-Skill提供高层次策略指导,帮助模型理解技能的正确应用方式,解决单一上下文信号偏差问题;第二,剪枝视角过滤冗余信息,突出任务相关技能,减少干扰。这两视角通过token级差异调节优势值,动态引导模型学习。与传统单视角自蒸馏不同,BCSD实现优势的自适应调节,增强了模型的稳定性和泛化能力。算法在GRPO基础上创新性地融合多视角信号,为强化学习中的技能利用提供了新思路。

方法详解

  • �� 设计两个互补的上下文视角:一是引入Meta-Skill,提供高层次技能应用指导;二是通过外部LLM剪枝,生成任务相关的剪枝视角。
  • �� 在训练过程中,模型在两个视角下分别评估策略,计算每个token的概率差异(∆aug和∆pru),反映不同视角对策略的支持变化。
  • �� 利用差异值调节优势值(wi,t),实现优势的动态重调节,确保模型在利用技能时既考虑奖励信息,又考虑上下文信息。
  • �� 采用GRPO作为基础优化目标,将调节后的token优势值融合到策略梯度中,优化模型参数。
  • �� 定期更新Meta-Skill,确保其反映模型最新的技能利用状态,避免过时。
  • �� 通过多次实验验证不同参数设置的效果,确保方法的鲁棒性和泛化能力。

实验设计

在ALFWorld和WebShop两个长序列任务上,采用不同规模的Qwen模型(如Qwen2.5-7B、Qwen2.5-3B、Qwen3-1.7B)进行训练。比较基线包括Vanilla、Skill_Prompt、Skill_GRPO、Skill-SD、RLSD、SDAR等。指标主要为成功率和任务得分,采用150步训练,评估频率为每15步一次。通过消融实验验证Meta-Skill和剪枝视角的贡献,调节优势调度系数λ的影响,以及多视角信号融合的效果。还分析了训练动态、信号一致性和技能利用情况,确保方法的全面验证。

结果分析

BCSD在所有模型规模中均优于基线,Qwen2.5-7B模型成功率达83.6%,比最优基线高3.1个百分点;WebShop成功率达78.1%,超越最优基线2.4点。消融实验显示,去除Meta-Skill视角导致性能大幅下降,验证其关键作用。调节参数λ的最优值为0.1,能显著提升训练效果。多视角信号融合增强模型稳定性,长序列任务中表现优越,验证了双向自蒸馏的有效性。整体结果表明,该方法在复杂任务中显著提升技能利用效率,为未来多技能、多任务强化学习提供新思路。

应用场景

该技术可应用于智能助理、机器人自主学习、多任务系统等场景,尤其在需要复杂技能调度和迁移的环境中具有潜力。模型在训练中保持外部技能的显式性,便于后续编辑和调优,适合工业界的多场景应用。未来,结合多模态信息和自动Meta-Skill生成,有望实现更高效的技能迁移和自主学习能力,推动智能系统的广泛应用。

局限与展望

目前方法依赖预训练Meta-Skill,泛化到新任务或未覆盖技能场景存在挑战。计算成本较高,双视角信号的实时计算增加训练复杂度。在极端稀疏奖励或噪声环境下,优势调节机制可能失效,影响策略稳定性。未来需优化算法效率,增强模型泛化能力,解决实际部署中的成本与鲁棒性问题。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手里有一份食谱(技能),但每次做菜时,你都可以根据实际情况调整,比如多放点盐或者少放点油。传统方法就像是把食谱写在纸上,做完就不变了,不能随时改。现在,BCSD就像是有两个助手:一个告诉你怎样更好用食谱(Meta-Skill),另一个帮你过滤掉不重要的步骤(剪枝视角),让你做菜更快更好。两个助手一起帮你判断每一步是不是正确,最后你做的菜味道更棒,也更符合你的口味。这种方法让你在厨房里变得更灵活,能做出更多美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校里学做手工艺品,你有一本教程(技能),但每次做都不一样。有时候你会忘记一些步骤,或者觉得某些部分不重要。传统的方法就是死记硬背教程,做完就完事。现在,BCSD就像是有两个朋友在帮你:一个告诉你怎么用教程(Meta-Skill),让你知道哪些步骤最重要;另一个帮你删掉不必要的部分(剪枝视角),让你专注在关键步骤上。两个朋友会不断告诉你每一步是不是正确,帮助你做出更漂亮的作品。这样,你就能更灵活、更聪明地完成手工艺品,也能学到更多技能。

术语表

Meta-Skill(元技能)

一种高层次的技能指导,帮助模型理解如何有效应用外部技能。技术上是模型在训练中学习到的关于技能使用的策略。

在论文中,Meta-Skill用作指导模型在不同任务中正确利用技能的高层次信息。

自蒸馏(Self-Distillation)

模型利用自身的预测作为教师,进行细粒度监督,从而提升性能。技术上是模型在不同视角或状态下相互指导。

论文中采用双向自蒸馏机制,增强模型对技能的利用能力。

优势值(Advantage)

强化学习中,用于衡量某行动相对于平均水平的优劣。公式为A=Q−V。

在本文中,优势值经过调节,用于引导策略优化。

GRPO(Group Relative Policy Optimization)

一种基于群体奖励的策略优化算法,考虑多个样本的奖励均值和标准差。公式为A_GRPO=(r_i−r̄)/σ_r。

作为基础优化目标,结合优势调节机制提升技能利用。

Token(词元)

自然语言处理中的最小单位,可以是字、词或子词。模型通过预测词元生成文本。

论文中的token级信号用于细粒度调节策略。

开放问题 这项研究留下的未解疑问

  • 1 如何自动生成更具泛化能力的Meta-Skill,以适应未见任务或新技能场景,仍是未解难题。现有方法多依赖预训练,泛化能力有限。
  • 2 多视角信号融合的理论基础尚不完善,如何在不同任务中动态调节视角权重,提升鲁棒性,是未来研究方向。
  • 3 在极端稀疏奖励或高噪声环境下,优势调节机制的稳定性和效果仍需验证,需开发更鲁棒的调节策略。

应用场景

近期应用

智能助理技能调度

可应用于智能客服或个人助理,通过外部技能指导,提高多任务处理能力,增强用户体验。模型在训练中保持技能的显式性,便于后续编辑和调优。

机器人自主学习

机器人在复杂环境中利用外部技能进行自主决策,提升任务完成效率。结合BCSD,机器人能更好理解技能的应用场景,实现迁移学习。

远期愿景

多技能多任务系统

未来可发展为具有自主学习和技能迁移能力的多任务系统,广泛应用于工业自动化、智能制造等领域,推动AI系统的自主化。

原文摘要

External natural-language skills provide large language model (LLM) agents with reusable and editable guidance for solving complex tasks. Yet their effectiveness depends not only on skill quality, but also on whether the policy can translate the provided guidance into appropriate actions. However, methods specifically designed to improve this skill-utilization ability remain largely underexplored. In practice, skill-based agents are commonly trained with reinforcement learning objectives centered on task-level rewards, which offer limited supervision and struggle to capture subtle differences in how effectively the policy uses the provided skills. We propose BCSD (Bidirectional Context Self-Distillation), a framework that combines self-distillation with reinforcement learning to train LLM agents to use external skills more effectively. Unlike prior self-distillation methods that rely on a single privileged context, BCSD evaluates each trajectory from two complementary skill-context views. The augmented view introduces higher-level Meta-Skill guidance, while the reduced view prunes general guidance to highlight task-specific skills. Their complementary token-level signals are combined to rescale the RL advantage. Experiments on ALFWorld and WebShop demonstrate that BCSD achieves the strongest overall performance across model scales, enabling agents to utilize external skills more effectively. Ablation studies further verify the complementary contributions of the augmented and reduced context views. Code will be released to ensure full reproducibility.

cs.AI