RetireOPD: Self-Retiring On-Policy Distillation for Agentic Reinforcement Learning

TL;DR

RetireOPD方法通过自适应退休策略提高RL模型成功率,ALFWorld提升18.8%。

cs.CL 🔴 高级 2026-09-18 14 次浏览
Yan Yu Zhengxi Lu Yizhou Liu Yichen Pan Aozhe Wang Qipeng Chen Hua Yang Wenqi Zhang Weiming Lu Qianglong Chen Yongliang Shen
强化学习 策略蒸馏 自适应退休 多轮对话 智能体训练

核心发现

方法论

RetireOPD方法首先优化一个技能条件教师模型,通过环境奖励进行训练,然后结合RL和OPD训练无技能学生模型。采用自适应退休策略,当学生与教师的差异不再缩小时,停止教师监督,仅用RL继续训练。

关键结果

  • 在ALFWorld上,RetireOPD比RL基线提高了14.1%到18.8%的成功率,WebShop准确率提高了11.8%到19.0%。
  • RetireOPD在所有设置中均超过其技能条件教师模型。
  • 在Qwen2.5模型上,RetireOPD在不同规模上均表现优异,证明其在多任务环境中的有效性。

研究意义

RetireOPD方法在强化学习领域提供了一种新的策略蒸馏方法,通过自适应退休策略解决了教师监督的阶段依赖性问题。该方法在多任务环境中表现出色,具有重要的学术和实际应用价值。

技术贡献

RetireOPD通过自适应退休策略和技能条件教师模型的优化,解决了传统策略蒸馏中教师模型不可靠的问题,提供了新的理论保证和工程可能性。

新颖性

RetireOPD首次提出自适应退休策略,区别于固定调度的传统方法,能够动态调整教师监督的时机,提高了模型的灵活性和有效性。

局限性

  • RetireOPD在某些任务中可能需要较长的训练时间以达到最佳效果。
  • 自适应退休策略的参数设置可能对不同任务的性能有显著影响。

未来方向

未来的研究可以探索RetireOPD在更多复杂任务中的应用,以及如何优化自适应退休策略的参数设置,以进一步提高模型性能。

AI 总览摘要

在多轮对话任务中,传统的强化学习方法往往面临稀疏奖励的问题,导致中间决策缺乏监督。RetireOPD方法通过引入自适应退休策略,结合技能条件教师模型的优化,解决了教师监督的阶段依赖性问题。

RetireOPD首先优化一个技能条件教师模型,通过环境奖励进行训练,然后结合RL和OPD训练无技能学生模型。自适应退休策略允许学生在与教师的差异不再缩小时,停止教师监督,仅用RL继续训练。这种方法在ALFWorld和WebShop等任务中表现出色,成功率和准确率均有显著提升。

RetireOPD不仅在学术研究中具有重要意义,还为实际应用提供了新的可能性。未来的研究可以探索其在更多复杂任务中的应用,以及如何优化自适应退休策略的参数设置,以进一步提高模型性能。

深度分析

研究背景

强化学习在多轮对话任务中面临稀疏奖励的问题,传统方法如GRPO和OPD虽然提供了部分解决方案,但在教师模型的可靠性和监督的时机选择上仍存在挑战。

核心问题

多轮对话任务中,如何有效利用教师模型进行策略蒸馏,同时避免教师监督对学生模型的长期限制,是一个重要且困难的问题。

核心创新

RetireOPD通过自适应退休策略和技能条件教师模型的优化,解决了教师模型不可靠和监督时机选择的问题,提高了模型的灵活性和有效性。

方法详解

  • �� 优化技能条件教师模型,通过环境奖励进行训练。
  • �� 结合RL和OPD训练无技能学生模型。
  • �� 采用自适应退休策略,当学生与教师的差异不再缩小时,停止教师监督,仅用RL继续训练。

实验设计

在ALFWorld和WebShop上进行实验,使用Qwen2.5模型的不同规模进行测试,比较了RetireOPD与传统RL和混合基线方法的性能。

结果分析

RetireOPD在ALFWorld上比RL基线提高了14.1%到18.8%的成功率,WebShop准确率提高了11.8%到19.0%。在所有设置中均超过其技能条件教师模型。

应用场景

RetireOPD可用于多轮对话任务中的智能体训练,适用于需要动态调整策略监督的场景。

局限与展望

RetireOPD在某些任务中可能需要较长的训练时间,自适应退休策略的参数设置对不同任务的性能有显著影响。

通俗解读 非专业人士也能看懂

想象一个学校,老师在课堂上教授学生各种技能。起初,老师会密切监督学生的学习进度,但随着学生逐渐掌握知识,老师会逐渐减少监督,直到学生完全独立。RetireOPD就像这样的老师,帮助学生在学习初期获得更多指导,但在学生能力提升后,允许他们独立探索。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的游戏,开始时有个高手教你怎么玩。随着你越来越熟练,这个高手会慢慢减少指导,直到你可以自己玩得很好。RetireOPD就是这样一个系统,帮助AI在学习初期获得指导,然后让它们独立发挥。

术语表

RetireOPD (自适应退休策略)

一种在策略蒸馏中动态调整教师监督时机的方法。

用于提高多轮对话任务中学生模型的灵活性。

GRPO (组相对策略优化)

一种强化学习算法,通过组内相对优势进行优化。

作为RetireOPD的基础RL方法之一。

OPD (策略蒸馏)

通过教师模型提供密集监督的策略蒸馏方法。

用于提高学生模型的学习效果。

ALFWorld

一个文本为基础的环境,用于测试多轮对话任务中的智能体。

RetireOPD的实验基准之一。

WebShop

模拟在线购物场景的环境,用于测试智能体的决策能力。

RetireOPD的实验基准之一。

开放问题 这项研究留下的未解疑问

  • 1 如何在更多复杂任务中应用RetireOPD,以进一步验证其有效性。
  • 2 自适应退休策略的参数设置如何影响不同任务的性能。

应用场景

近期应用

多轮对话系统

在多轮对话任务中应用RetireOPD,提高智能体的学习效率和灵活性。

远期愿景

智能体自主学习

通过RetireOPD实现智能体的自主学习和决策能力,减少对外部监督的依赖。

原文摘要

Multi-turn agents trained with reinforcement learning (RL) receive a single scalar reward per trajectory, which motivates self on-policy distillation (OPD) to supply dense token-level supervision from a self-teacher with privileged task skills, letting a skill-free student internalize them. This recipe, however, is undermined by two findings in agentic tasks: privileged information alone does not always make a teacher reliable, and the benefit of teacher supervision is stage-dependent. We therefore propose RetireOPD (Self-Retiring On-Policy Distillation), which first optimizes a decoupled, skill-conditioned teacher with environment rewards and then trains a skill-free student jointly with RL and OPD. Rather than following a predefined distillation schedule, RetireOPD adopts Adaptive Retirement: the student drops the teacher on its own once their discrepancy stops shrinking and it reaches a target fraction of the teacher's success rate, after which training proceeds with RL alone. Across Qwen2.5 models from 1.5B to 7B, RetireOPD improves ALFWorld success rate over RL baseline by 14.1% to 18.8% and WebShop accuracy by 11.8% to 19.0%, and surpasses its own skill-conditioned teacher in every setting.

cs.CL cs.AI