ATOD: Annealed Turn-Aware On-Policy Distillation for Multi-Turn Agentic Tasks

TL;DR

ATOD结合退火调度与Turn级不确定性加权,有效提升多轮交互任务性能。

cs.AI 🔴 高级 2026-06-26 46 次浏览
Qitai Tan Zefang Zong Mo Li Yipeng Shi Yang Li Peng Chen
多轮交互 知识蒸馏 强化学习 调度策略 不确定性评估

核心发现

方法论

ATOD采用退火调度策略,将On-policy蒸馏(OPD)与强化学习(RL)结合,早期以OPD为主,逐步引入RL以增强探索。引入Turn级不确定性与分歧重加权(T-DUR),通过软门控机制优先处理高不确定或分歧大的回合。具体算法包括线性调度κ(s)、ρ(s),以及基于turn级别的动态重加权,优化多轮任务中的学习效率与性能上限。

关键结果

  • 在ALFWorld、WebShop、Search-QA三个数据集上,ATOD在不同学生模型规模(0.6B、1.7B、4B)均实现最高成功率,平均提升4.16点(相较OPD)和23.62点(相较GRPO),且多任务中达成或超越教师模型性能(平均超越2.16点)。
  • 对弱模型(如0.6B)效果尤为显著,成功率从几乎零提升至82.81%(ALFWorld),超越纯RL方法30%以上,验证了退火调度与T-DUR的协同作用。
  • 消融实验显示,去除调度或T-DUR会显著降低性能,验证其在平衡模仿与探索中的关键作用。

研究意义

该研究突破了多轮交互任务中蒸馏与强化的结合瓶颈,提供了一种高效、稳健的训练框架,显著提升小模型在复杂环境中的表现。对未来智能交互系统、机器人控制、自动问答等场景具有深远影响,有助于降低大模型部署成本,推动AI普适化。

技术贡献

提出退火调度策略,有效融合OPD与RL优势,避免早期探索不足与后期模仿瓶颈。引入Turn级不确定性与分歧重加权机制,细粒度调控教师指导,增强模型对关键回合的关注。实现多任务、多模型规模的统一优化,显著优于现有蒸馏与强化方法。

新颖性

首次将退火调度与Turn级不确定性重加权结合应用于多轮交互任务,创新性地解决了模仿与探索的平衡问题。相较于传统单一策略,提供了动态调节机制,提升了学习效率和最终性能。

局限性

  • 调度参数(κ、ρ)需手动设定,可能影响泛化能力,未来需自适应调参机制。
  • 在极端复杂或长序列任务中,调度与重加权可能仍不足以应对所有不确定性。
  • 训练成本较高,尤其在多轮交互中对模型的计算资源需求较大。

未来方向

未来将探索自适应调度策略,结合元学习优化参数调节。扩展T-DUR到更复杂场景,如多模态、多任务环境。同时,结合模型压缩与知识蒸馏技术,推动小模型在实际部署中的性能提升。

AI 总览摘要

随着大规模语言模型在多轮交互任务中的广泛应用,如何在保证性能的同时降低模型规模与推理成本成为关键挑战。传统的蒸馏方法如OPD在早期快速学习,但在接近教师性能后容易陷入瓶颈;而强化学习虽能突破模仿限制,但在稀疏奖励环境中效率低下。本文提出ATOD(Annealed Turn-aware On-policy Distillation),通过退火调度动态平衡OPD与RL,结合Turn级不确定性与分歧重加权机制,有效提升多轮任务中的学习效率与最终性能。在ALFWorld、WebShop和Search-QA三个基准中,ATOD在不同模型规模上均实现了优异表现,成功率平均提升4.16点(相较OPD)和23.62点(相较GRPO),且多任务中超越或接近教师模型。实验还验证了调度策略与T-DUR的关键作用,显示其在复杂交互环境中的广泛适用性。该方法不仅推动了多轮交互学习的技术边界,也为未来智能系统的自主学习提供了新思路。尽管存在调度参数调优和计算成本等挑战,未来的研究将聚焦于自适应调节机制与多模态扩展,期待其在实际应用中展现更大潜力。

深度分析

研究背景

近年来,随着大规模预训练语言模型(如GPT、BERT)的崛起,模型在静态文本生成方面已取得突破,但在多轮交互、工具调用等任务中仍面临挑战。早期研究主要集中在模仿学习和监督蒸馏(如Seq2Seq、Teacher-Student架构),提升模型效率。随后,强化学习(如PPO、GRPO)被引入优化环境奖励,增强模型自主探索能力。OPD作为一种结合模仿与强化的技术,通过令学生模仿教师的token分布,提升样本效率。尽管如此,单一策略难以兼顾早期快速学习与后期超越教师的需求,特别是在长序列、多轮交互中,稀疏奖励和误差累积成为瓶颈。近年来,研究逐渐关注细粒度调控与动态调度,旨在实现更高效的学习机制。

核心问题

多轮交互任务中,模型需要在模仿教师行为与自主探索之间找到平衡。早期模仿有助快速收敛,但限制模型创新;而纯RL虽能突破模仿瓶颈,但在稀疏奖励环境中效率低下,尤其对小模型影响更大。此外,长序列中关键回合的识别与强化仍缺乏有效机制,导致模型难以专注于关键决策点。这些问题限制了多轮任务中模型的性能提升与应用推广。

核心创新

本研究提出退火调度策略,将OPD与RL在训练过程中动态平衡,避免早期过度模仿或后期探索不足。引入Turn级不确定性与分歧重加权(T-DUR),通过软门控机制优先处理高不确定或分歧回合,提升模型对关键回合的关注。创新点在于结合动态调度与细粒度重加权,解决多轮交互中模仿与探索的矛盾,显著提升训练效率与性能上限。这一机制首次应用于多轮交互任务,突破了传统方法的局限。

方法详解

  • �� 设计退火调度:定义线性调节系数κ(s)、ρ(s),在训练过程中逐步减弱教师指导,增强环境奖励引导。• 引入T-DUR:计算每个回合的分歧(dk)与不确定性(hk),通过软融合(wk)动态调节教师监督强度。• 结合两信号:在每个token上,用优势函数At = κ(s)AOPDt + ρ(s)AGRPOt,调节学习目标。• 优化策略:采用GRPO的群相对优势,结合OPD的token级监督,避免单一策略局限。• 训练流程:在初期以OPD为主,逐步引入RL信号,利用调度参数实现平滑过渡。• 实现细粒度调控:利用turn级别的分歧与不确定性指标,动态调整教师指导力度,强化关键回合学习。

实验设计

在ALFWorld、WebShop、Search-QA三大数据集上,采用不同规模的Qwen模型(0.6B、1.7B、4B)作为学生,比较ATOD、OPD、GRPO等基线。指标包括成功率、平均轨迹长度等。通过消融实验验证调度参数、T-DUR机制的重要性。训练采用150步窗口,调节参数在不同任务中调整,以评估方法的稳健性。对比分析显示,ATOD在所有场景均优于对比方法,特别在弱模型上表现更为显著。

结果分析

实验结果显示,ATOD在ALFWorld成功率达82.81%,较OPD提升6.25点,超越教师模型2.16点;在WebShop和Search-QA中也取得优异成绩。对0.6B模型,成功率从0.78%提升至82.81%,实现100倍以上的提升。消融分析表明,调度和T-DUR机制是性能提升的关键因素,去除任何一项都显著降低效果。调度参数的动态调节确保模型在不同训练阶段都能保持最佳状态,验证了方法的有效性与鲁棒性。

应用场景

该方法适用于多轮交互系统、智能助理、机器人自主学习等场景。只需提供环境反馈与教师模型,即可显著提升小模型的表现,降低部署成本。未来,结合多模态信息,拓展到视觉、声音等多感知场景,将推动智能系统的自主学习能力,满足复杂环境下的应用需求。

局限与展望

调度参数需手动调优,可能影响泛化。长序列任务中,调度机制仍有限,难以应对极端复杂场景。训练成本较高,尤其在多轮交互中对计算资源要求大。未来需发展自适应调节策略,降低参数依赖,提升效率。

通俗解读 非专业人士也能看懂

想象你在教一个学生做复杂的拼图游戏。刚开始,你会给他很多提示,帮他快速理解拼图的基本规则。这就像用老师的指导(OPD)帮助他学习。随着时间推移,你希望他自己多尝试,找到更好的拼法,就像用奖励鼓励他探索(RL)。但如果你一直只给提示,他可能只会模仿,不会创新。于是,你设计了一个聪明的系统,既在开始时多指导,又在后面逐步放手,让他自己探索。系统还会特别关注那些不确定或容易出错的拼块,优先帮他解决这些难题。这样,他既能快速学会,又能不断超越老师的水平。

简单解释 像给14岁少年讲一样

想象你在教你的弟弟玩一款复杂的游戏。一开始,你会告诉他怎么玩,帮他快速入门,就像老师给提示一样。但你也希望他自己多试试,找到更好的方法,就像奖励鼓励探索。可是,如果你只告诉他怎么做,他就只会照着做,不会变聪明。于是,你设计了一个聪明的办法:一方面,刚开始多给提示,帮他学会基本操作;后来,慢慢减少提示,让他自己尝试。你还会特别关注那些看起来不确定或容易出错的步骤,优先帮他解决那些难点。这样,他既能快点学会,又能变得更厉害,超越你!

术语表

On-policy distillation (OPD)(策略内蒸馏)

一种通过模仿教师模型的token分布,提供密集监督的知识蒸馏方法,提升学生模型的学习效率。

论文中用以快速引导学生模仿教师行为,作为训练的早期策略。

退火调度(Annealed schedule)

在训练过程中逐步调整不同学习信号的权重,使模型由模仿向自主探索平滑过渡。

核心机制,用于平衡OPD与RL的贡献。

Turn-level Disagreement-Uncertainty Reweighting(T-DUR)

基于回合的分歧与不确定性指标,动态调节教师监督的强度,以优先处理关键或难点回合。

提升模型对关键决策点的关注,改善学习效果。

Group Relative Policy Optimization(GRPO)

一种基于群体相对优势的强化学习算法,利用样本组内的相对奖励进行策略更新。

作为强化信号,与OPD结合使用,提升探索效率。

成功率(Success Rate)

模型在任务中达到预定义目标的比例,衡量任务完成效果。

主要评估指标,用于比较不同方法的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何实现更高效的自适应调度机制,自动调节κ(s)与ρ(s),以适应不同任务和模型规模。
  • 2 在极端复杂或长序列交互中,调度与重加权机制的极限与优化策略仍待探索。
  • 3 多模态、多任务环境下,调度策略的泛化能力与扩展性不足,未来需研究跨模态调控机制。

应用场景

近期应用

智能助理优化

通过ATOD提升小型语言模型在多轮对话中的表现,实现更智能、更自主的交互,降低硬件成本。

机器人自主学习

应用于机器人自主决策系统,结合环境反馈与教师指导,增强机器人在复杂环境中的适应能力。

远期愿景

普适智能系统

推动小模型在多模态、多任务场景中的自主学习能力,逐步实现低成本、高性能的智能系统普及。

原文摘要

Training small language-model agents for long-horizon interactive tasks requires both fast imitation and reward-driven improvement. On-policy distillation (OPD) provides dense teacher guidance and typically improves rapidly in the early stage, but its gains saturate once the student approaches the teacher, limiting the final performance ceiling. Reinforcement learning (RL) directly optimizes environment rewards and encourages exploratory improvement toward a higher reward-defined ceiling, but sparse and delayed feedback makes early-stage learning much less efficient than OPD. In this paper, we propose ATOD (Annealed Turn-aware On-policy Distillation), a hybrid online distillation algorithm that explicitly exploits this complementarity. (1) ATOD uses an annealed OPD-RL schedule: OPD dominates early training to approach teacher-level behavior, while RL is gradually strengthened to drive reward-based exploration. (2) ATOD introduces Turn-level Disagreement-Uncertainty Reweighting (T-DUR), which softly gates the distillation sig- nal to prioritize turns with high disagreement or uncertainty in long trajectories. Experiments on ALFWorld, WebShop, and Search-QA show that ATOD consistently outperforms competing post-training baselines: across the three student sizes, ATOD improves average success rate by 4.16 points over OPD and 23.62 points over GRPO, while surpassing the corresponding teacher models by 2.16 points.

cs.AI