核心发现
方法论
PCSD结合自适应窗口和指数衰减聚合,利用教师信号的局部持久性估算每个Token的可信度。通过趋势感知调制和Sigmoid门控,产生连续的蒸馏权重,与GRPO共同优化。该方法在ALFWorld和WebShop任务中显著优于基线,提升整体成功率和任务得分。
关键结果
- 在ALFWorld上,Qwen2.5-3B-Instruct模型使用PCSD后,整体成功率达90.6%,比GRPO高15.6个百分点,超越SDAR 6.2个百分点。WebShop任务中,Score达85.0,优于其他方法。在未使用推理时技能的情况下,表现依然优异,展现出强大的鲁棒性。
- 在不同模型规模和任务场景中,PCSD均展现出优越的适应性和稳定性,尤其在教师信号局部支持逐渐减弱时,有效过滤噪声,提升学习效果。
- 消融实验表明,局部持久性估算、趋势调制和自适应窗口机制是性能提升的关键因素,单独使用或缺失任何一环都导致性能下降。
研究意义
该研究突破了强化学习中稀疏奖励的瓶颈,通过引入持久性估算机制,有效识别可信教师信号,提升长序列任务中的信用分配效率。对自主智能体的训练具有重要推动作用,推动其在复杂交互环境中的应用落地,尤其适用于多模态、多轮对话等场景。
技术贡献
提出PCSD框架,创新性地结合局部持久性、趋势感知调制与指数衰减聚合机制,有效平衡Token级别的细粒度信息与整体鲁棒性。实现了教师信号的动态可信度估算,显著优于传统点估计和全局聚合方法,为强化学习中的自蒸馏提供新思路。
新颖性
首次提出利用教师信号的局部持久性作为可信度指标,结合趋势调制和自适应窗口,动态调节Token级蒸馏权重。这一机制突破了现有基于单点或全局聚合的局限,提供更精细且鲁棒的教师信号识别策略。
局限性
- PCSD在极端噪声环境下仍可能误判教师信号的可信度,尤其在教师支持极度不稳定时效果有限。
- 该方法依赖于教师信号的相对稳定性,若教师模型本身存在偏差或错误,可能引入误导。
- 在超大规模模型或极长序列中,计算局部持久性和趋势调制的成本较高,需优化算法效率。
未来方向
未来将探索多模态场景下的持久性估算,结合自监督信号增强鲁棒性。同时,考虑引入多层次持久性分析,提升复杂环境中的信号识别能力,推动自主智能体在实际应用中的广泛部署。
AI 总览摘要
在复杂的多轮交互任务中,强化学习面临奖励稀疏和延迟反馈的挑战,传统方法难以实现精细的信用分配。本文提出的PCSD(Persistent Consistency Self-Distillation)通过引入局部持久性估算机制,有效识别教师信号的可信区域,从而动态调节自蒸馏的权重。该方法结合自适应窗口、指数衰减和趋势调制,平衡Token级别的细粒度信息与整体鲁棒性,显著提升在ALFWorld和WebShop任务中的表现。实验证明,PCSD在不同模型规模和场景下均优于现有基线,尤其在教师信号逐渐减弱时表现出优越的过滤噪声能力。其创新点在于利用教师信号的局部持久性作为可信度指标,突破了传统点估计和全局聚合的局限,为强化学习中的长序列信用分配提供了新思路。该技术不仅推动了自主智能体的训练效率,也为多模态、多轮交互等复杂场景的应用奠定基础。未来,结合多模态信息和多层次持久性分析,将进一步增强系统的鲁棒性和适应性,推动自主智能体在实际环境中的广泛应用。
深度解读
原文摘要
Large language model agents have shown strong potential in complex interactive tasks, yet their reinforcement learning (RL) is often hindered by sparse rewards, as a long multi-turn trajectory may receive only a single outcome-level signal. On-policy self-distillation (OPSD) provides dense token-level supervision from a privileged teacher, but the teacher may not be reliable at every position. Existing methods commonly rely on isolated token-level discrepancies, which can be sensitive to noise, or assign a shared step-level weight that may overlook positional variation. We propose Persistent Consistency Self-Distillation (PCSD), which derives token-level distillation weights from the local persistence of teacher-favoring signals. PCSD combines adaptive windows with exponentially decayed aggregation to capture persistent relative teacher support, applies trend-aware modulation to attenuate locally declining support, and produces continuous weights through sigmoid gating. The resulting objective is jointly optimized with GRPO, combining dense teacher guidance with sparse environmental feedback. Without inference-time skills, PCSD achieves the best ALFWorld Overall results among all baselines on both backbones, exceeding GRPO by 15.6 and 13.3 points and SDAR by 6.2 and 5.5 points, while remaining competitive on WebShop and gaining 15.8 points over GRPO on unseen ALFWorld split.