Denser $\neq$ Better: Limits of On-Policy Self-Distillation for Continual Post-Training

TL;DR

研究发现,SDPO在特定条件下加速领域内学习,但在跨域场景中表现不佳。

cs.LG 🔴 高级 2026-07-02 4 次浏览
Meng Wang Haohan Zhao Wenzhuo Liu Lu Yang Geng Liu Haiyang Guo Guo-Sen Xie Gaofeng Meng Hongbin Liu Fei Zhu
持续学习 自蒸馏 强化学习 模型遗忘 领域适应

核心发现

方法论

本文采用自蒸馏策略优化(SDPO)方法,结合教师信号的稳定性和密集的令牌级监督来加速领域内的专业化。通过对比GRPO和SDPO,研究了在持续后训练中的表现。

关键结果

  • SDPO在领域内任务上表现优异,如在MATH任务中提高了AIME准确率至56.42%。
  • 然而,SDPO在跨域任务中表现不佳,尤其是在中等距离的干扰任务中,如GPQA。
  • 实验表明,SDPO在多域训练中遗忘现象严重,尤其是当教师信号不稳定时。

研究意义

本研究揭示了在持续学习中,密集的自蒸馏并不能自动继承强化学习的保留优势。它强调了教师信号的稳定性和令牌级监督的可靠性对模型性能的重要性。

技术贡献

本文区分了持续后训练中的两个关键因素:策略数据和用于更新模型的目标。通过对比SDPO和GRPO,揭示了密集监督的局限性和潜在风险。

新颖性

首次系统性地分析了密集自蒸馏在持续后训练中的局限性,尤其是在跨域任务中的表现不佳。

局限性

  • SDPO在跨域任务中存在显著的遗忘现象,尤其是在中等距离的任务上。
  • 教师信号的不稳定性会导致模型崩溃。

未来方向

未来研究应关注如何在不增加遗忘风险的情况下提高SDPO的跨域泛化能力,以及优化教师信号的稳定性。

AI 总览摘要

持续后训练使基础模型能够在保持现有能力的同时获取新知识。然而,现有研究表明,策略学习可以减轻遗忘现象,尤其是策略自蒸馏被认为是一种有吸引力的方法。

本文通过自蒸馏策略优化(SDPO)重新审视了这一乐观观点。实验显示,当教师信号稳定且对齐良好时,SDPO可以加速领域内专业化,但在跨域场景中难以泛化。在持续后训练中,SDPO表现出更强的遗忘,甚至可能崩溃,而策略强化学习方法如GRPO则更为保守,能够更好地保留先前能力。

进一步分析表明,密集自蒸馏会在参数空间和响应空间中引起更大的漂移,并可能通过自我强化的教师-学生循环放大高频格式化伪影。这些发现表明,仅依靠策略数据不足以进行持续学习。密集自蒸馏可以在教师目标稳定且令牌级监督可靠时加速专业化,但不应被视为持续后训练的默认稳定器。

深度分析

研究背景

随着大语言模型的广泛应用,持续学习成为一个重要的研究方向。现有方法多依赖于策略强化学习以减轻遗忘现象,但策略自蒸馏作为一种新兴的方法,因其在减少对外部教师或显式奖励模型的依赖而受到关注。

核心问题

核心问题在于如何在持续学习中有效获取新知识而不遗忘旧知识。尤其是在多域场景下,模型需要在不同任务之间进行平衡,而现有方法在跨域泛化能力上存在不足。

核心创新

本文的创新在于系统性地分析了策略自蒸馏在持续后训练中的局限性,尤其是在跨域任务中的表现不佳。通过对比SDPO和GRPO,揭示了密集监督的潜在风险。

方法详解

  • �� 使用自蒸馏策略优化(SDPO)方法,结合教师信号的稳定性和密集的令牌级监督。
  • �� 对比GRPO和SDPO,研究在持续后训练中的表现。
  • �� 分析参数空间和响应空间的漂移,以及高频格式化伪影的放大效应。

实验设计

实验设计包括在单域和多域持续设置下进行后训练,比较GRPO、标准SDPO和SDPO变体的监督密度。评估在域内和通用基准上的专业化、保留和迁移能力。

结果分析

结果表明,SDPO在当前训练域上显著提高性能,但也增加了漂移、干扰甚至崩溃的风险。监督密度引入了一个权衡:它增强了局部学习信号,但也增加了敏感性、域不匹配和累积伪影。

应用场景

本文的研究结果对持续学习模型的设计具有重要意义,尤其是在需要跨域泛化的应用场景中。可以用于优化大语言模型的后训练策略。

局限与展望

SDPO在跨域任务中存在显著的遗忘现象,尤其是在中等距离的任务上。教师信号的不稳定性会导致模型崩溃。未来研究应关注如何在不增加遗忘风险的情况下提高SDPO的跨域泛化能力。

通俗解读 非专业人士也能看懂

想象一个工厂,工人们每天都在学习新的生产技术,但他们不能忘记旧的生产方法。SDPO就像是一种新的培训方法,帮助工人们快速掌握新技术,但有时会导致他们忘记旧的技能,尤其是在新旧技术相似但不完全相同的情况下。GRPO则更像是一种稳妥的培训方法,虽然学习速度较慢,但能更好地保留旧技能。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,学会了很多关卡的技巧。现在有一个新关卡,你想快速掌握它,但又不想忘记之前的技巧。SDPO就像是一个超级教练,能让你快速掌握新关卡,但有时会让你忘记之前的技巧,尤其是当新关卡和之前的关卡有点相似但又不完全一样的时候。GRPO则像是一个稳妥的教练,虽然学习速度较慢,但能确保你不会忘记之前的技巧。

术语表

自蒸馏策略优化 (SDPO)

一种使用模型自身作为教师的策略优化方法,通过密集的令牌级监督来加速学习。

用于加速领域内专业化,但在跨域任务中表现不佳。

群体相对策略优化 (GRPO)

一种策略优化方法,通过相对奖励来稳定强化学习。

与SDPO对比,用于研究在持续后训练中的表现。

持续后训练

一种使基础模型在保持现有能力的同时获取新知识的训练方法。

研究如何在不遗忘旧知识的情况下获取新知识。

密集监督

通过密集的令牌级监督来提高学习效率的方法。

在SDPO中用于加速领域内专业化。

跨域泛化

模型在不同任务之间进行平衡的能力。

研究SDPO在跨域任务中的表现不佳。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加遗忘风险的情况下提高SDPO的跨域泛化能力。
  • 2 如何优化教师信号的稳定性以提高SDPO的性能。

应用场景

近期应用

持续学习模型优化

可以用于优化大语言模型的后训练策略,尤其是在需要跨域泛化的应用场景中。

远期愿景

智能系统的自适应学习

未来可以应用于智能系统的自适应学习,使其在不同任务间更好地平衡新旧知识。

原文摘要

Continual post-training enables foundation models to acquire new knowledge while preserving existing capabilities. Recent work suggests that on-policy learning can mitigate forgetting, with on-policy self-distillation emerging as a particularly attractive approach. In this work, we revisit this optimistic view through self-distillation policy optimization (SDPO). Our experiments show that SDPO can accelerate in-domain specialization when teacher signals are stable and well aligned, but it struggles to generalize to out-of-distribution scenarios. In continual post-training, SDPO exhibits stronger forgetting and can even collapse, whereas on-policy reinforcement learning methods such as GRPO adapt more conservatively and better preserve prior capabilities. Further analyses reveal that denser self-distillation induces larger drift in both parameter space and response space, and can amplify high-frequency formatting artifacts through a self-reinforcing teacher--student loop. These findings suggest that on-policy data alone is insufficient for continual learning. Dense self-distillation can accelerate specialization when teacher targets are stable and token-level supervision is reliable, but it should not be treated as a default stabilizer for continual post-training. Our code is available at https://github.com/Moenupa/SDPO-CL.

cs.LG cs.CL