Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation
提出Observation-Calibrated Self-Distillation(OCSD),通过对比结构匹配的回放视图,改善大模型强化学习中的偏差问题,显著提升多任务性能。
核心发现
方法论
OCSD通过构建完整(Full)与观察消除(Observation-Ablated)两种结构匹配的回放视图,利用它们的分数差异提取观察残差,校正高不确定性步骤中的Token支持。具体包括:• 设计两种不同的回放视图,区别在于是否包含未来观察信息;• 计算两者对应Token的分数差异,得到观察残差;• 将残差应用于高不确定性步骤的GRPO更新中,保持轨迹方向不变;• 采用步级选择机制,优先校正不确定性高的步骤。该方法有效减少了未来观察引入的偏差,提升了模型对环境反馈的敏感性。
关键结果
- 在ALFWorld、WebShop和Search-QA三个任务上,OCSD在不同Qwen3模型(1.7B、4B、8B)规模中均优于强基线。以Qwen3-4B为例,OCSD在ALFWorld成功率达82.8%,比GRPO提升约12.2%;在WebShop中成功率达73.7%,超越原有方法;在Search-QA中,平均EM提升至43.1%。
- 消除未来观察的偏差后,模型的环境反馈对支持的相关性显著增强,AUROC指标从0.654提升至0.707,验证了校准残差的有效性。
研究意义
该研究突破了偏差源自未来观察的难题,为强化学习中利用环境信息提供了更精准的监督信号。OCSD不仅提升了多任务场景下的模型表现,也增强了模型在环境变化和分布外任务中的泛化能力,为智能体自主学习提供了新的技术路径。这一方法对未来自主系统、机器人和对话系统的训练具有重要推动作用。
技术贡献
创新点在于提出结构匹配的双视图对比机制,利用分数差异提取观察残差,有效校正偏差。结合高不确定性步骤的Token级调节,兼顾轨迹整体方向,提升了自我蒸馏的精度。方法融合了环境反馈的细粒度信息,增强了模型对环境变化的敏感性,提供了理论上的偏差控制保证,为大模型强化学习提供了新范式。
新颖性
首次提出利用结构匹配的回放视图对比,系统性地校正未来观察引入的偏差,解决了偏差归因困难的问题。与传统自我蒸馏仅依赖单一视图不同,OCSD通过双视图对比,显著提升了环境反馈的相关性,具有较强的创新性和实用价值。
局限性
- 该方法依赖于准确的视图匹配和环境反馈的可用性,在极端复杂或噪声环境中可能表现不佳;
- 高不确定性步骤的选择策略可能影响整体效果,需进一步优化参数设置;
- 在极大规模模型或极长序列中,计算开销仍有提升空间,未来需考虑效率优化。
未来方向
未来可探索多模态环境中的偏差校正机制,结合更复杂的环境反馈信号,提升模型的鲁棒性。还可研究自适应步级选择策略,动态调整校正强度,进一步增强泛化能力。此外,将OCSD应用于实际机器人或交互系统,验证其在真实场景中的实用性和稳定性。
AI 总览摘要
在大规模语言模型(LLM)驱动的智能体训练中,强化学习(RL)面临着稀疏奖励和偏差难题。传统方法如GRPO在多任务、多轮交互中,难以区分环境反馈与回放 scaffold 引入的偏差,导致模型对未来观察的支持存在误导。为此,本文提出Observation-Calibrated Self-Distillation(OCSD),通过对比结构匹配的完整(Full)与观察消除(Ablated)回放视图,提取观察残差,有效校正未来观察引入的偏差。该残差在高不确定性步骤中调节Token级别的支持,保持轨迹整体方向,显著提升模型性能。实验在ALFWorld、WebShop和Search-QA任务中,涵盖不同规模的Qwen3模型,均取得优异表现,成功率提升约12%以上,平均EM指标提升至43.1%。此外,校准残差与环境反馈的相关性增强,验证了方法的有效性。这一创新为强化学习中的偏差控制提供了新思路,推动自主智能体在复杂环境中的自主学习和泛化能力。未来,OCSD有望结合多模态信息,优化效率,并在实际机器人和交互系统中实现应用,开启智能体自主学习的新篇章。
深度分析
研究背景
近年来,基于大规模预训练模型的智能体在任务执行、对话和机器人控制中展现出巨大潜力。早期工作如Reinforcement Learning from Human Feedback(RLHF)和Group Relative Policy Optimization(GRPO)推动了模型在复杂环境中的应用,但仍面临奖励稀疏和偏差问题。自我蒸馏(Self-Distillation)技术逐渐被引入,用于细粒度监督,但在环境观察作为 privileged 信息时,支持信号易被 scaffold 影响,导致偏差难以校正。近年来,研究者开始关注如何利用未来观察信息改善模型,但偏差归因和校正仍是难点。
核心问题
核心问题在于,利用未来环境观察作为 privileged 信息时,回放视图中的支持分数受到 scaffold 和未来观察的双重影响,难以准确反映环境反馈。传统方法如OPSD在重评分时,无法区分支持变化源,导致偏差校正不充分,影响模型的泛化和鲁棒性。尤其在高不确定性步骤,偏差更为明显,限制了模型的性能提升。解决这一问题,成为强化学习中自主智能体发展的关键瓶颈。
核心创新
本研究提出了结构匹配的双视图对比机制,创新点包括:1)设计完整(Full)与观察消除(Ablated)两种回放视图,区别在于是否包含未来观察;2)通过分数差异提取观察残差,有效校正偏差;3)将残差应用于高不确定性步骤的Token级别调节,保持轨迹方向。此方法首次系统性利用结构匹配对比,解决了偏差归因难题,提升了环境反馈的相关性,增强模型的泛化能力。
方法详解
- �� 设计两种回放视图:Full视图包含未来观察信息,Observation-Ablated视图则用“Observation: not provided”替代;• 计算两视图中对应Token的分数差异,得到观察残差;• 将残差映射到[-1,1]范围内,作为校正信号;• 在高不确定性步骤中,选择Top 20%的步骤进行校正,利用残差调节Token支持;• 通过符号保持机制,确保轨迹整体方向不变,避免偏差反向;• 最终优化目标结合轨迹优势和校正支持,提升训练效果。
实验设计
在ALFWorld、WebShop和Search-QA三个任务上,采用不同规模的Qwen3模型(1.7B、4B、8B),比较OCSD与GRPO、OPSD等基线。训练过程中,采用步级选择(ρ=0.2)优先校正高不确定性步骤,指标包括成功率、EM、AUROC等。通过多轮实验验证,OCSD在所有任务中均优于对比方法,特别是在偏差校正和泛化能力方面表现突出。还进行了消融实验,验证结构匹配和残差调节的必要性。
结果分析
OCSD在ALFWorld成功率达82.8%,比GRPO提升约12%以上;WebShop成功率达73.7%,超越原有方法;Search-QA中平均EM达43.1%。AUROC指标从0.654提升至0.707,验证偏差校正的有效性。消融实验表明,结构匹配和步级选择是性能提升的关键因素,残差调节显著改善模型对环境反馈的敏感性。
应用场景
该方法适用于需要环境交互和环境反馈校正的智能体训练场景,如机器人导航、交互式问答和自主控制系统。通过校正未来观察引入的偏差,模型能更准确理解环境状态,提升任务完成率和鲁棒性。未来可结合多模态信息,扩展到视觉、声音等多感知场景,推动自主系统的智能化发展。
局限与展望
目前方法依赖于环境反馈的可用性和结构匹配的准确性,在噪声环境或极端复杂场景中可能表现不足。此外,计算开销虽低,但在超大模型或长序列中仍需优化。未来需研究更鲁棒的视图匹配机制和自适应校正策略,以应对更复杂的实际应用需求。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,准备一道复杂的菜肴。你会根据食谱(模型的目标)逐步操作,但有时候会遇到突发情况,比如调料用完了。这时,你可能会参考备用食谱(观察消除视图)来判断下一步怎么做。OCSD就像厨师比较两个食谱,一个完整的(包含所有调料信息),另一个省略了关键调料(未来观察),通过比较两个食谱的差异,判断哪些步骤真正依赖于调料信息,从而避免误导。这种方法帮助厨师更准确地掌握每个步骤的关键点,确保菜肴最终成功。类似地,OCSD通过对比两份回放,校正模型在环境中的偏差,让它更聪明、更稳健地完成任务。
简单解释 像给14岁少年讲一样
想象你在玩一款游戏,你的目标是完成任务,但游戏中会出现一些突然的变化,比如突然出现的障碍。为了应对这些变化,你可以参考之前的游戏录像(未来观察),但有时候录像里的一些内容可能会误导你,比如虚假的障碍信息。OCSD就像一个聪明的玩家,他会同时看两个录像:一个完整的录像(包括所有未来信息),另一个是去掉虚假信息的录像。然后,他会比较两个录像中的不同点,找出真正有用的线索,告诉自己哪些信息是真实的,哪些是虚假的。这样,他在下一次行动时,就能更准确地判断环境,避免被虚假信息误导,成功完成任务。这种方法让游戏中的决策变得更聪明、更可靠。
术语表
Self-Distillation(自我蒸馏)
一种模型训练技术,通过让模型用自己的输出作为监督,提升其表达能力;技术名,强调模型自我优化。
论文中用来细粒度调整模型支持。
Privileged Replay(特权回放)
利用未来环境观察作为额外信息,重评分生成内容以提供更密集的监督信号;技术名,增强模型学习。
用于生成支持分数的基础。
Observation-Calibrated Residual(观察校正残差)
通过对比匹配视图的分数差异,提取校正偏差的信号,改善模型支持的准确性;技术名,核心创新。
用于调节高不确定性步骤的支持。
GRPO(Group Relative Policy Optimization)
一种基于群体相对优势的策略优化方法,用于多轨迹强化学习,提升任务完成率;算法名。
作为基线方法进行比较。
AUROC(Area Under ROC Curve)
衡量模型区分正负样本能力的指标,值越接近1越好;性能评价指标。
用于评估支持信号与环境反馈的相关性。
开放问题 这项研究留下的未解疑问
- 1 未来观察信息的偏差校正机制在极端复杂环境中的表现仍待验证,尤其在高噪声和多模态场景下的适应性问题尚未解决。
- 2 目前方法依赖于结构匹配的回放视图,如何在动态变化的环境中实现更鲁棒的视图匹配,是未来研究的重要方向。
原文摘要
Large language model agents are commonly trained through reinforcement learning with sparse trajectory-level rewards, which offer limited guidance on how strongly individual tokens should be updated. On-Policy Self-Distillation (OPSD) addresses this by re-scoring generated tokens under a privileged replay view to obtain dense, token-level supervision. However, we identify a confounding issue: the resulting support may reflect both the privileged information contained in the replay view and score shifts induced by the replay scaffold, making it difficult to attribute the support specifically to that information. This issue is especially pronounced when future environment observations serve as privileged information, since replaying them requires reconstructing an extended scaffold that itself perturbs token scores. To resolve this confounding, we propose Observation-Calibrated Self-Distillation (OCSD), which contrasts two structurally matched replay views, Full and Observation-Ablated, differing only in whether the actual future observation is present, to derive an observation residual that discounts score changes shared by the replay scaffold. OCSD then applies this residual to modulate token-level GRPO updates at high-uncertainty steps, while preserving the trajectory-level update direction. Experiments on ALFWorld, WebShop, and Search-QA across three Qwen3 model scales show that OCSD consistently outperforms strong baselines. Diagnostic analyses further confirm that the calibrated residual aligns better with local environment feedback. Our code is publicly available at https://github.com/yiy1x/OCSD.