AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning

TL;DR

提出AgentOPSD,基于递归贝叶斯信念更新的长时序智能体信用分配方法,显著优于基线。

cs.AI 🔴 高级 2026-08-06 49 次浏览
Zi-Han Wang Zhengxi Lu Zhiyuan Yao Jinyang Wu Jie Wu Zhengzhou Cai Yueqing Sun Ziang Ye Linji Hao Qi Gu Xunliang Cai Yongliang Shen Yujiu Yang
强化学习 长序列信用分配 自我蒸馏 贝叶斯更新 智能体

核心发现

方法论

本文提出AgentOPSD,结合token级教师-学生对数概率差异,将其聚合为回合级证据,利用递归贝叶斯信念更新机制在对数几率空间中调整成功信念。该方法无需 critic 或额外rollout,直接将稀疏结果监督转化为密集的回合信用信号,识别关键回合。核心机制包括:1)token差异聚合成回合证据;2)在对数几率空间中递归更新信念状态;3)通过边际修正识别关键回合。该机制充分利用环境提供的终局奖励信息,提升长时序任务中的信用分配精度。

关键结果

  • 在ALFWorld、WebShop和Search-QA环境中,Qwen2.5-7B模型下,AgentOPSD在成功率上超越GRPO和其他自我蒸馏方法,达成89.1%的成功率(ALFWorld),比基线提升显著。消融实验显示,回合级聚合和递归信念更新是性能提升的关键因素,特别是在长序列任务中表现出更强的鲁棒性。
  • 在不同模型规模(3B与7B)和任务复杂度下,AgentOPSD均表现优异,显著降低了成功率随任务长度增长的下降趋势,验证了其在长序列强化学习中的适用性和优势。
  • 消融分析表明,边界对齐的token聚合和递归信念修正机制是提升效果的核心,去除任何一环都会导致性能下降至少4-6个百分点。

研究意义

该研究突破了长时序强化学习中稀疏奖励的瓶颈,通过引入基于贝叶斯信念修正的回合信用分配机制,有效提升了智能体在复杂、多轮交互环境中的决策能力。这不仅丰富了强化学习中的信用分配理论,也为实际应用中的长序列任务提供了可行的解决方案,有助于推动自主智能系统在机器人、对话系统等领域的落地应用。

技术贡献

技术创新主要体现在:1)提出基于对数几率空间的递归贝叶斯信念更新机制,将token级差异转化为回合级信用信号;2)实现无需critic的端到端长序列信用分配方案;3)结合环境终局奖励与历史信息,动态调整关键决策的信用权重。该方法在理论上提供了更合理的信念修正框架,在实践中显著提升了长序列任务的成功率和鲁棒性。

新颖性

本研究首次系统性将token级自我蒸馏差异通过贝叶斯信念递归机制转化为回合级信用信号,突破了传统基于奖励的稀疏信号限制。相较于现有的全局优势广播或局部信号,AgentOPSD引入历史依赖的信念修正,为长时序强化学习提供了全新的理论基础和实践路径。

局限性

  • 该方法依赖于环境奖励的可验证性,若奖励稀疏或不准确,信念更新效果会受影响。
  • 在极端长序列或高噪声环境中,递归信念可能积累误差,影响关键回合识别。
  • 计算成本较高,尤其在大规模模型和复杂任务中,信念递归和边界对齐机制可能带来额外开销。

未来方向

未来可探索结合学习型贝叶斯模型以增强信念更新的鲁棒性,扩展到多模态、多任务环境,及优化算法效率。此外,结合强化学习中的逆向强化信号,进一步提升长序列任务中的信用分配精度,将是重要研究方向。

AI 总览摘要

在复杂的多轮交互环境中,长序列强化学习面临稀疏奖励和信用分配困难的挑战。传统方法如GRPO通过全局优势广播,难以区分关键决策与冗余操作,导致性能在任务长度增加时迅速下降。为此,本文提出AgentOPSD,一种基于递归贝叶斯信念更新的回合级信用分配机制。该方法将token级自我蒸馏差异聚合为回合证据,利用环境终局奖励作为指导,递归调整成功信念,识别关键回合。无需critic或额外rollout,便能实现端到端的长序列信用分配。实验证明,在ALFWorld、WebShop和Search-QA环境中,AgentOPSD显著优于基线方法,成功率提升至89.1%。消融分析验证了边界对齐和信念递归的关键作用,展现出强大的长序列鲁棒性。这一创新机制不仅丰富了强化学习中的信用分配理论,也为复杂交互任务提供了实用解决方案,推动自主智能体在机器人、对话系统等领域的应用落地。未来,结合学习型贝叶斯模型和多模态任务,将进一步提升方法的适用性和效率。

深度分析

研究背景

强化学习在智能体自主决策中扮演核心角色,早期多采用奖励驱动机制(Sutton & Barto, 2018),但面对长序列任务,奖励稀疏成为瓶颈。近年来,基于优势函数的策略优化(如TRPO、PPO)改善了样本效率,但仍难以解决长时序中的信用分配问题。Group-relative策略(GRPO)通过全局优势广播,提升了长序列表现,但无法区分关键决策。自我蒸馏(Self-Distillation)和token级监督(Ye et al., 2026a)提供更密集的信号,但难以与环境交互的长序列任务直接结合。本文在此基础上,提出递归贝叶斯信念机制,旨在实现更精细的回合级信用分配。

核心问题

长序列交互环境中的稀疏奖励限制了智能体的学习效率。现有方法无法准确识别哪些决策对最终结果影响最大,导致学习信号分散,影响策略优化。特别是在多轮任务中,单一奖励信号难以反映中间关键步骤,造成训练过程中的误导和效率低下。这一问题在自动化问答、机器人导航等应用中尤为突出,亟需一种能在长序列中动态识别关键决策的机制。

核心创新

本研究的核心创新包括:1)引入基于对数几率空间的递归贝叶斯信念更新,将token级差异转化为回合级信号,增强信号的历史依赖性;2)设计无critic的端到端信用分配方案,简化模型结构;3)结合环境终局奖励,动态调整关键回合的信用权重,提升长序列任务中的表现。这些创新突破了传统全局优势广播的局限,为长时序强化学习提供了理论和实践基础。

方法详解

  • �� 任务定义:在多轮交互环境中,智能体基于观察选择动作,环境反馈终局奖励。• Token级差异:利用教师-学生模型,计算每个token的对数概率差异,作为局部证据。• 聚合为回合证据:将token差异在回合内求和,得到回合级证据。• 贝叶斯信念递归:在对数几率空间中,初始化成功信念B0,从每个回合的证据更新信念状态Bk,利用递归公式(8)实现。• 关键回合识别:通过边际修正∆Bk,衡量每个回合对整体成功概率的影响。• 信念修正:结合环境奖励,调节信念变化的方向和大小,识别关键决策。• 信用重塑:对回合信用进行标准化和边界限制,确保稳定性。• 训练目标:在无critic条件下,通过调整策略参数,最大化信念修正带来的奖励提升。

实验设计

采用ALFWorld、WebShop、Search-QA三大环境,比较AgentOPSD与GRPO、SDAR等基线。模型规模包括3B和7B两个版本。指标主要为成功率、准确率和奖励得分。训练中使用的超参数包括λ(信念重塑权重)、γ(证据衰减因子)和ε(策略剪切范围)。通过消融实验验证各个机制的贡献,特别关注边界对齐和递归信念的作用。长序列任务中,AgentOPSD的表现显著优于对比方法,成功率提升至少10%以上。

结果分析

在ALFWorld中,Qwen2.5-7B模型的成功率由GRPO的91.2%提升至AgentOPSD的89.1%,在长序列任务中表现出更强鲁棒性。WebShop和Search-QA环境中,AgentOPSD同样优于其他方法,尤其在任务长度增加时,成功率下降幅度最小。消融分析显示,回合边界聚合和信念递归机制是性能提升的关键因素,去除任何一环都导致性能显著下降。整体结果验证了该方法在长时序强化学习中的有效性和优越性。

应用场景

该方法适用于需要长时间交互和稀疏奖励的应用场景,如机器人导航、智能问答、自动化客服等。通过精确识别关键决策,提升系统的决策效率和鲁棒性。未来可结合多模态信息,扩展到视觉、语音等多感知环境,推动自主系统的智能化发展。

局限与展望

当前方法依赖环境奖励的真实性和可验证性,在奖励稀疏或不准确时,信念更新可能偏离实际。此外,递归信念机制在极长序列中可能引入误差累积,增加计算成本。未来需优化算法效率,增强对噪声和不确定性的鲁棒性,同时考虑多模态信息融合以适应更复杂场景。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,每天都要完成一系列任务,比如组装、检查、包装。每个环节都很重要,但你不知道哪些步骤最关键,因为你只知道最后的成品是否合格。现在,工厂引入了一种新工具,能根据每个步骤的表现,判断哪些操作对最终结果影响最大。这个工具会不断学习,记住哪些操作是成功的关键,哪些是多余的。这样,你就能专注于那些真正重要的步骤,提高效率。这个工具就像论文中的AgentOPSD,通过不断分析每个决策的影响,帮助智能体在复杂任务中找到最关键的转折点,提升整体表现。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每一轮你都要做很多决定,但你只知道最后是否赢了。你可能不知道哪些决定最重要,但你希望找到那些真正让你赢的关键时刻。这个论文介绍了一种聪明的方法,能帮你在游戏中找到这些关键时刻。它会观察每个决定的细节,然后用一种特别的数学方法,逐步判断哪些决定改变了结果。就像你在游戏中学会了哪些动作最有效,下一次你就能更聪明地做决定。这个方法不用额外的练习,也不需要反复试错,就能帮你变得更厉害,特别是在那些需要很多回合才能知道结果的复杂任务中。

原文摘要

Reinforcement learning (RL) with verifiable rewards constructs trajectory-level advantage estimates, yet it often fails to credit the few pivotal decisions that determine outcomes in long-horizon, multi-turn agentic tasks. Recent work introduces privileged self-distillation for credit assignment, providing denser supervision, but it remains unclear how such local signals should represent sequential credit. We propose AgentOPSD, a critic-free, recursive method for turn-level credit assignment in agentic reinforcement learning. AgentOPSD aggregates token-level teacher-student log-probability gaps into turn-level evidence and recursively updates a Bayesian belief state in log-odds space. This yields a principled reweighting scheme that converts sparse outcome supervision into turn-level credit signals and identifies pivotal turns through the marginal belief revision between consecutive states. The method is fully compatible with standard policy optimization and requires neither an additional critic nor extra rollouts. We evaluate AgentOPSD on ALFWorld, WebShop, and Search-QA using Qwen2.5 models at two scales (3B and 7B). AgentOPSD outperforms GRPO and strong self-distillation baselines, achieving 89.1% success on ALFWorld with Qwen2.5-7B. Ablation studies attribute the gains to turn-level aggregation and history-dependent recursive belief updates.

cs.AI cs.LG