Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

TL;DR

提出影响校准(ICSD)改善自我蒸馏中的信任-效用失配,显著提升多任务性能。

cs.AI 🔴 高级 2026-08-15 68 次浏览
Qizhen Lan Xi Xiao Xiangchen Guan Mengchen Fan Moule Lin Jung Im Choi Lijing Zhu
强化学习 自我蒸馏 影响校准 策略优化 深度学习

核心发现

方法论

本文提出影响校准(ICSD)框架,通过测量每个标注token的目标影响,即在教师引导输出扰动下的第一阶响应,结合批次自适应校准,将非平稳信号转化为有界分配权重。ICSD利用已存在的策略梯度信息,无需额外模型前向,优化了教师信任与目标效用的匹配。具体步骤包括:• 计算教师引导输出扰动下的第一阶影响响应;• 采用中位数和偏差尺度进行批次自适应校准;• 通过exact action-turn mass matching确保总分配不变。该方法在ALFWorld、WebShop和Search-QA任务中,显著优于仅依赖信任的分配策略,提升了任务成功率和指标。

关键结果

  • 在ALFWorld任务中,ICSD将教师支持的目标反向tokens比例从60.1%降低至37.8%,同时在7B模型中达到96.1%的成功率,WebShop得分提升至93.1,均优于信任单一策略。
  • 在多模型和多任务环境中,ICSD提升了所有指标,平均性能提升超过3个百分点,验证其广泛适用性。
  • 消融分析显示,ICSD结合目标影响和信任信号,能有效减少目标反向支持,提升与RL梯度的余弦相似性,增强策略更新的局部一致性。

研究意义

该研究解决了自我蒸馏中信任-效用失配的问题,为强化学习中的策略优化提供了新的校准机制。通过引入目标影响的量化,增强了模型对当前任务目标的敏感性,提升了多任务、多模型环境中的泛化能力。此方法不仅改善了语言模型的训练效率,还为未来自主学习系统的鲁棒性和可解释性奠定基础,具有深远的学术和产业价值。

技术贡献

提出基于教师引导扰动的目标影响指标,结合批次自适应校准机制,创新性地实现了影响的连续校准,避免了参数空间的复杂逆运算。引入exact action-turn mass matching,确保分配总量不变,提升了算法的稳定性和可解释性。该方法在不增加模型前向成本的前提下,有效融合了教师信任与目标效用,为策略优化提供了新思路。

新颖性

首次提出基于教师引导扰动的目标影响指标,用于自我蒸馏中的分配校准,突破了信任信号不能反映目标支持度的限制。相较于传统基于不确定性或位置的信任估计,ICSD引入目标影响的量化,显著提升了分配的有效性和鲁棒性。这一创新为强化学习中的样本重用和策略调整提供了新范式。

局限性

  • 当前方法依赖于教师引导扰动的线性近似,可能在极端分布偏移或高噪声环境下表现不佳。
  • 在极大规模模型或极长序列任务中,校准和影响计算仍存在一定的计算成本。
  • 未来需探索多阶影响和非线性扰动对策略的影响,以进一步提升鲁棒性。

未来方向

未来将结合多阶影响估计和非线性校准机制,提升对复杂环境的适应能力。同时,考虑引入自适应扰动策略,增强模型对不同任务和数据分布的泛化能力。此外,将扩展到多模态和连续控制任务中,探索影响校准在自主系统中的应用潜力。

AI 总览摘要

在强化学习中,策略优化面临延迟奖励和稀疏信号的挑战。近年来,基于自我蒸馏的策略提供了丰富的局部指导,但信任信号未必反映当前目标的实际支持度,导致信任-效用失配问题。本文提出影响校准(ICSD)框架,通过量化每个token在教师引导扰动下的目标影响,结合批次自适应校准机制,有效调整了教师支持的分配策略。ICSD利用已存在的策略梯度信息,无需额外模型前向计算,便能在多任务、多模型环境中提升性能。在ALFWorld、WebShop和Search-QA任务中,ICSD显著优于传统信任基础的分配方法,成功率和指标均获得提升。具体表现为:在7B模型中,ALFWorld成功率达96.1%,WebShop得分93.1,均优于对比方法。消融分析显示,ICSD减少了目标反向tokens的支持比例,从60.1%降至37.8%,同时增强了策略与RL梯度的兼容性。该方法不仅改善了样本利用效率,也为未来强化学习中的样本重用和目标对齐提供了新思路。总之,ICSD通过引入目标影响的量化校准,有效缓解了信任-效用失配,为自主学习系统的鲁棒性和效率开辟了新路径。

深度分析

研究背景

强化学习中的策略优化常依赖奖励信号,但奖励稀疏延迟,限制了长序列任务的效率。近年来,基于自我蒸馏的方法引入密集的局部监督,改善了训练信号的密度。代表性工作如SDAR、Wang et al. 2026等,利用教师引导的偏好信息,提升模型性能。然而,现有方法多依赖信任估计,未能充分考虑支持信号对当前目标的实际贡献,导致信任-效用失配问题。这在多任务、多模型环境中尤为突出,限制了自我蒸馏的效果。

核心问题

核心问题在于如何合理分配教师支持的密集监督信号,使其真正促进当前策略的优化。传统方法多依据信任指标(如不确定性、位置、 divergence),但未能反映支持是否符合当前目标,导致大量目标反向tokens被支持,影响训练效率和效果。这种信任-效用失配,严重制约了自我蒸馏在复杂任务中的应用效果。解决该问题需要引入目标相关的影响度量,确保支持信号的实用性和有效性。

核心创新

本文的创新点在于:1)提出基于教师引导扰动的目标影响指标,量化每个token对目标的实际贡献;2)结合批次自适应校准机制,将非平稳影响信号转化为有界分配权重,避免极端偏差;3)引入exact action-turn mass matching,确保总支持量不变,提升算法稳定性。这些创新突破了传统信任估计的局限,为自我蒸馏提供了更精细的目标对齐手段。

方法详解

  • �� 计算教师引导输出扰动下的第一阶影响响应(影响指标);• 采用中位数和偏差尺度对影响分数进行批次校准,限制极端值;• 利用exact action-turn mass matching,确保支持总量不变;• 将校准后的影响指标作为分配系数,结合信任信号,调整每个token的支持比例;• 在策略更新中,仅通过已存在的梯度信息实现影响校准,无需额外模型前向。整个流程确保支持信号既反映信任,又符合目标效用,提升训练效果。

实验设计

采用ALFWorld、WebShop和Search-QA三个任务,比较ICSD与信任基础方法的性能。模型包括1.5B、3B、7B参数的Qwen系列,使用GRPO和GiGPO优化器。指标涵盖成功率、得分和准确率。通过消融分析验证影响指标的贡献,观察目标反向tokens比例变化,分析与RL梯度的相似性。实验设计确保多样性和代表性,验证ICSD的普适性和有效性。

结果分析

ICSD在所有任务中均优于信任单一策略,ALFWorld成功率提升至96.1%,WebShop得分达93.1,远超传统方法。消融分析显示,ICSD显著减少目标反向tokens比例,从60.1%降至37.8%,同时提升策略与RL梯度的余弦相似性0.192。多模型、多任务环境中,ICSD表现出强大的泛化能力和稳定性,验证了其在复杂强化学习场景中的潜力。

应用场景

该方法适用于需要密集局部监督的长序列任务,如对话系统、机器人控制和复杂策略学习。通过优化目标对齐,提升模型训练效率和鲁棒性。未来可结合多阶影响和非线性校准,扩展到多模态和自主系统中,推动自主学习的智能化发展。

局限与展望

当前方法依赖线性扰动近似,可能在高噪声或极端分布偏移环境中表现不足。对大规模模型和长序列任务,计算成本仍较高。未来需探索非线性影响建模和多阶校准,以增强鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在一家工厂里工作,工厂里有很多工人(模型),他们需要完成一项复杂的任务(比如组装一台电脑)。每个工人都依赖老师(教师模型)给出的建议,但老师的建议有时并不完全符合当前的生产目标。以前的方法只看老师的建议是否可信(信任),但没有考虑这些建议是否真的帮助工人完成任务(效用)。这就像工人听到老师说“这个零件应该用这个”,但其实这个零件在当前任务中并不重要。本文提出一种新方法,像工厂管理者一样,衡量每个建议对当前任务的实际帮助(影响),然后根据这个影响调整建议的分配。这样,工人就能更专注于真正重要的任务部分,效率更高,生产质量也更好。这就像用“影响校准”让工人听到的建议更贴合实际工作需要,从而整体提升工厂的生产效率。

简单解释 像给14岁少年讲一样

想象你在学校里做项目,老师会给你很多建议,但有些建议非常重要,有些则不那么关键。以前,你只听老师说“这个建议可信”就采纳,但其实,有些建议虽然可信,但对你完成项目帮助不大。现在,想象你有个聪明的朋友,他会告诉你每个建议到底对你完成项目的帮助有多大,然后帮你决定重点听哪个建议。这样,你就能用有限的时间和精力,专注在最重要的部分,项目做得更好。这就像论文里的“影响校准”,它帮模型判断每个老师建议对当前目标的实际帮助,从而更聪明地学习,效果更棒!

原文摘要

On-policy self-distillation (OPSD) gives language agents dense token-level supervision from a privileged self-teacher on the policy's own trajectories. Existing methods allocate this supervision mainly by teacher trust, but trust does not reveal whether emphasizing a token supports the current policy objective. We call this the trust-utility mismatch and introduce Influence Calibration for Self-Distillation (ICSD). For each supervised token, ICSD measures the first-order response of its importance-weighted RL surrogate contribution to a teacher-directed output perturbation. Batch-adaptive calibration converts this non-stationary signal into a bounded allocation weight while preserving the original auxiliary-loss mass within each action turn. These detached weights affect only the distillation loss and require no additional model pass. Across ALFWorld, WebShop, and Search-QA, ICSD improves all matched aggregate metrics over trust-only allocation under Group Relative Policy Optimization (GRPO) and Group-in-Group Policy Optimization (GiGPO), across two model families spanning 1.5B to 7B. At 7B, it reaches 96.1% ALFWorld success and a WebShop score of 93.1. Frozen-batch analyses show that ICSD reduces teacher-supported mass assigned to objective-opposed tokens from 60.1% to 37.8% and raises cosine compatibility with the RL gradient by 0.192. A companion repository is avail- able at https://github.com/lanqz7766/Influence-Calibration-for-On-Policy-Self-Distillation-in-Agentic-RL.

cs.AI cs.CL