RLCSD: Reinforcement Learning with Contrastive On-Policy Self-Distillation

TL;DR

RLCSD结合对比策略,通过对正确与错误提示的对比,有效缓解偏好引起的风格漂移,提升推理模型性能。

cs.LG 🔴 高级 2026-06-10 15 引用 50 次浏览
Leyi Pan Shuchang Tao Yunpeng Zhai Lingzhe Zhang Zhaoyang Liu Bolin Ding Aiwei Liu Lijie Wen
强化学习 自我蒸馏 对比学习 推理模型 自然语言处理

核心发现

方法论

本文提出RLCSD(Reinforcement Learning with Contrastive on-policy Self-Distillation)方法,结合强化学习与对比策略,解决在on-policy自我蒸馏中出现的偏好引起的风格漂移问题。核心思想是通过对比正确提示与错误提示下的模型分布差异,抑制模型在训练中偏向风格化输出的倾向。具体实现包括:• 采样一组rollouts并由验证器划分为正确与错误两类;• 在相同模板下,分别用正确与错误提示生成教师分布,计算对比差异作为任务相关的信号;• 将对比信号经过归一化与调制,作为优势函数的调节因子,结合AORM(Advantage of the Original Model)实现稳定训练。实验在Qwen3(1.7B/4B/8B)和Olmo-3-7B-Think模型上,涵盖数学与逻辑推理任务,结果显示RLCSD在性能上持续优于GRPO及其他OPSD方法,训练稳定性显著提升。

关键结果

  • 在Qwen3(1.7B/4B/8B)模型上,RLCSD在数学推理任务中的pass@1提升了3-4个百分点,达到了88.8%、74.2%、66.9%,明显优于GRPO和其他对比方法。逻辑推理任务中,RLCSD的表现也优于基线,尤其在out-of-distribution测试中表现出更强的泛化能力。
  • 在训练稳定性方面,RLCSD保持了响应长度的稳定,避免了传统OPSD方法中常见的响应爆炸或提前收缩的问题。具体表现为在数学推理任务中,响应长度在整个训练过程中保持在合理范围内,训练过程中的entropy波动也显著减小。
  • 通过消融实验验证,对比策略的引入显著改善了模型对任务相关tokens的关注度,将|ec|指标的风格偏移(style drift)降低了约70%,使模型更专注于内容而非风格,从而提升了推理准确率和模型的鲁棒性。

研究意义

该研究突破了on-policy自我蒸馏中存在的偏好引起的风格漂移问题,为大规模推理模型的训练提供了新的思路。通过引入对比机制,有效缓解了模型在训练中出现的响应长度缩短、训练不稳定等问题,推动了推理模型在复杂任务中的应用潜力。此方法不仅提升了模型的性能,也为未来在多任务、多模态场景下的模型训练提供了理论基础和技术路径,有望在学术界和工业界引发广泛关注与应用。

技术贡献

本文的主要技术贡献在于:• 首次提出结合对比学习的强化学习自我蒸馏框架,有效抑制偏好引起的风格漂移;• 设计了对比差异(ectr)作为任务相关的细粒度信号,增强模型对内容的关注;• 将对比信号与AORM结合,提出稳定训练的调制机制,解决训练不稳定和响应缩短问题;• 实验验证表明,该方法在多个大规模模型和任务上均优于现有的OPSD方法,具有良好的泛化能力和实用价值。

新颖性

本研究的创新点在于引入对比机制,系统性解决偏好引起的风格漂移问题,区别于传统的单一分布差异优化方法。通过在正误提示之间构建对比,显著抑制了模型在训练中偏向风格化输出的倾向,首次实现了在大规模推理模型中的对比自我蒸馏,拓展了强化学习与对比学习的结合应用,为模型训练中的内容与风格控制提供了新思路。

局限性

  • 该方法依赖于验证器的准确性,验证器性能不足可能影响对比信号的质量,从而影响训练效果。
  • 在极端复杂或多模态任务中,构建有效的正负提示对比可能面临挑战,需进一步优化提示设计策略。
  • 对比机制引入额外的采样与计算成本,可能增加训练时间与资源消耗,需在效率与效果之间权衡。

未来方向

未来的研究方向包括:• 探索多模态任务中的对比自我蒸馏策略,结合视觉、语音等多模态信息;• 优化验证器设计,提高对比信号的鲁棒性与泛化能力;• 将该方法应用于更大规模的模型和更复杂的推理场景中,验证其在工业环境中的实用性与扩展性。

AI 总览摘要

在自然语言处理和推理模型的训练中,如何有效引导模型关注内容而非风格,成为提升模型性能的关键。传统的on-policy自我蒸馏(OPSD)方法通过模仿教师模型的分布,提供细粒度的学习信号,但在实际训练中常出现偏好引起的风格漂移问题。这一问题表现为模型输出逐渐变短、响应不稳定,严重影响推理任务的效果。针对这一挑战,本文提出了RLCSD(Reinforcement Learning with Contrastive on-policy Self-Distillation)方法,结合强化学习与对比学习机制,有效缓解风格漂移,提升模型的内容关注度和训练稳定性。

RLCSD的核心思想是在正误提示之间引入对比差异,通过比较正确提示与错误提示下模型的分布差异,抑制模型在训练中偏向风格化输出的倾向。具体实现包括:采样一组rollouts,利用验证器将其划分为正确与错误两类;在相同模板下,用正误提示生成教师分布,计算对比差异作为任务相关信号;将该信号经过归一化和调制,作为优势函数的调节因子,结合AORM实现训练的稳定性。实验在Qwen3(1.7B/4B/8B)和Olmo-3-7B-Think模型上,涵盖数学和逻辑推理任务,结果显示RLCSD在性能上持续优于现有的GRPO及其他OPSD方法,训练过程中响应长度保持稳定,模型的推理准确率显著提升。

这些结果表明,结合对比策略的自我蒸馏不仅能有效抑制风格漂移,还能增强模型在复杂推理任务中的泛化能力。该方法的提出,为大规模推理模型的训练提供了新的技术路径,有望在未来的研究和工业应用中发挥重要作用。通过系统性地解决偏好引起的风格漂移问题,RLCSD推动了模型内容关注度的提升,为智能系统的可靠性和解释性提供了有力保障。未来,结合多模态信息和更高效的验证机制,RLCSD有望在更广泛的任务场景中展现出更强的适应性和实用价值。

深度分析

研究背景

近年来,随着大规模预训练模型在自然语言处理中的广泛应用,推理能力的提升成为研究重点。早期方法主要依赖监督学习,难以应对长文本推理中的梯度稀疏问题。强化学习结合奖励机制(如RLHF)逐渐成为主流,代表性算法包括GRPO(Shao et al., 2024)等,利用验证器提供的奖励信号优化模型行为。然而,这些方法在训练过程中面临风格偏差、训练不稳定等挑战。自我蒸馏技术(Self-Distillation)通过模型内部的知识迁移,缓解了部分问题,但仍存在偏好引起的风格漂移,导致模型输出逐渐偏向短小、风格化的表达,影响推理质量。近年来,on-policy自我蒸馏(OPSD)被提出,试图在模型自身内部实现细粒度的学习信号,改善训练效果。代表性工作包括Zhao et al. (2026)等,利用正误提示构建分布差异,但未能根本解决风格漂移问题。本文在此基础上,提出结合对比学习的RLCSD方法,旨在系统性抑制偏好引起的风格漂移,推动推理模型的稳定性和性能提升。

核心问题

在大规模推理模型训练中,偏好引起的风格漂移成为一大难题。具体表现为模型在接受教师指导时,逐渐偏向短小、风格化的输出,忽略内容的深度与准确性。这种偏差源于教师在引导过程中对风格的偏好,导致模型输出变得过于简洁、断言式,削弱了推理的细粒度表达能力。传统方法虽能在一定程度上利用教师的分布信息,但未能有效抑制这种偏差,反而可能加剧风格的偏移,造成训练不稳定、响应长度提前收缩等问题。这不仅影响模型在复杂推理任务中的表现,也限制了模型的泛化能力。解决这一问题,要求在模型训练中引入机制,既能利用教师的知识,又能抑制风格偏差,确保模型输出内容的丰富性和稳定性。

核心创新

本文的创新点主要体现在:• 引入对比学习机制,通过正误提示的差异,系统性抑制偏好引起的风格漂移,提升内容关注度;• 设计了对比差异(ectr)作为细粒度的任务信号,有效减少风格偏移对训练的干扰;• 将对比信号与AORM优势结合,提出调制机制,保证训练稳定性和模型输出的内容丰富性;• 实验验证显示,该方法在多个大模型和任务上均优于现有OPSD技术,具有良好的泛化能力和实用潜力。

方法详解

  • �� 采样一组rollouts,利用验证器将其划分为正确与错误两类,形成正负提示集合;
  • �� 在相同模板下,分别用正提示和负提示生成教师分布,计算对应的分布差异(ec,t 和 ew,t);
  • �� 构建对比差异ectr,t = ec,t - ew,t,抑制共享的风格成分,强化内容相关信号;
  • �� 通过归一化(tanh)和调制(乘以λ)将ectr,t转化为调节因子rt;
  • �� 利用sign-preserving clamp,将rt应用于AORM优势函数,形成两路径的PPO样式损失,确保训练稳定;
  • �� 设计了排除目标rollout的提示池和多负提示的采样策略,增强对比信号的鲁棒性。

实验设计

在Qwen3(1.7B、4B、8B)和Olmo-3-7B-Think模型上,作者设计了数学与逻辑推理的任务,采用标准的验证器和奖励机制,比较包括GRPO、SDPO、SRPO等基线。训练过程中,关注模型的性能指标(如pass@1)和训练稳定性(响应长度、entropy波动)。通过不同模型规模和任务类型的对比,验证RLCSD在推理准确率、训练稳定性和响应长度方面的优越性。还进行了消融实验,验证对比差异(ectr)在减少风格偏移中的作用。

结果分析

在数学推理任务中,RLCSD在Qwen3-8B模型上,pass@1提升了3-4个百分点,达到88.8%、74.2%、66.9%,显著优于GRPO和其他OPSD方法。逻辑推理任务中,表现同样优越,尤其在out-of-distribution测试中表现出更强的泛化能力。训练稳定性方面,RLCSD保持响应长度稳定,避免了响应爆炸或提前收缩的问题。实验还显示,采用对比机制后,模型对内容相关tokens的关注度提升了70%以上,有效抑制了风格偏移,增强了推理的准确性和鲁棒性。

应用场景

该方法适用于需要高精度推理的场景,如数学题解、法律文本分析、科学研究等。通过引入对比机制,模型能更好地聚焦于内容而非风格,提升推理质量。工业界可以利用此技术优化问答系统、智能助理和自动推理工具,尤其在长文本、多步骤推理任务中表现优异。未来,结合多模态信息和更复杂的验证机制,有望实现更广泛的应用场景。

局限与展望

目前方法依赖验证器的准确性,验证器性能不足可能影响对比信号的质量。此外,在多模态或极复杂任务中,构建有效的正负提示对比仍具挑战性。对比机制引入额外计算成本,可能增加训练时间和资源消耗。未来需要优化提示设计、提升验证器效率,并探索在更大规模模型中的适应性。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,厨师(模型)需要按照食谱(任务)准备一道菜。传统的方法就像让厨师模仿大师(教师)的做法,学习如何调料和烹饪,但有时候厨师会偏向自己喜欢的风格,比如喜欢多放盐或少放糖,导致菜的味道变得不一样。为了解决这个问题,厨师可以同时尝试两种做法:一种是按照正确的食谱,另一种是故意做错的版本。然后,通过比较这两种做法的差异,厨师可以更清楚哪些步骤是真正影响菜味的内容,而不是风格上的偏好。这样,厨师就能更专注于做出符合食谱的菜,而不是只追求个人风格。这个过程就像在模型训练中,利用正确和错误提示的对比,帮助模型更好地理解任务内容,避免偏向风格化输出。最终,厨师(模型)变得更擅长做出符合要求的菜,也更稳定,不会因为偏好而变得不靠谱。

简单解释 像给14岁少年讲一样

想象你在学校里学做手工艺品,你的老师(模型)教你怎么做一只漂亮的风筝。以前,老师只让你模仿他做的样子,但有时候你会学到一些不太对的习惯,比如用太多胶水或者折错了地方。现在,老师想帮你学得更好,他会让你同时看两个不同的做法:一个是老师正确的示范,另一个是你自己做错的版本。然后,他会帮你比较这两个做法,告诉你哪些地方是关键,哪些是风格上的差别。这样,你就能更清楚地知道,真正重要的是风筝的结构和颜色,而不是用什么样的胶水或折法。这个方法就像让你在学习中多看不同的做法,然后挑出最重要的部分,避免只追求花哨的外表。最终,你做的风筝会变得更漂亮、更结实,也不会因为太喜欢某种花样而忽略了基本的结构。这就像模型学习一样,通过对比正确和错误的做法,让模型更专注于内容,而不是风格,从而变得更聪明、更稳定。

术语表

Self-Distillation(自我蒸馏)

一种模型通过内部知识迁移,将自身的不同版本相互指导,从而提升性能。技术上是让模型用自己的输出作为学习目标。

论文中提到的RLCSD方法利用自我蒸馏增强模型内容关注。

Contrastive Learning(对比学习)

一种通过比较正样本与负样本差异,强化目标特征的学习方法。常用于表示学习,提升模型区分能力。

本文引入对比学习机制,抑制模型偏向风格化输出。

AORM(Advantage of the Original Model)

基于验证器的优势估计,用于指导模型训练,衡量模型相较于平均水平的优劣。

作为调制因子,结合对比信号,确保训练稳定。

Privilege-Induced Style Drift(偏好引起的风格漂移)

模型在接受教师引导时,偏向短小、风格化输出的现象,影响推理质量。

论文重点解决的核心问题。

Verifiers(验证器)

自动评估模型输出正确性或质量的工具或机制。

用于划分正确与错误rollouts。

Rollouts(采样轨迹)

模型生成的连续输出序列,用于训练和评估。

在实验中采样多组rollouts进行对比分析。

KL Divergence(KL散度)

衡量两个概率分布差异的指标,反映模型输出的偏离程度。

早期OPSD方法采用反向KL优化。

Two-path PPO(双路径PPO)

一种强化学习优化策略,结合两个路径的梯度信息,提升训练稳定性。

本文采用该策略实现对比信号调制。

Response Length(响应长度)

模型生成的输出序列的长度。

训练中保持响应长度稳定是重要指标。

Out-of-distribution(分布外)

模型未在训练数据中出现的任务或样本。

实验中测试模型泛化能力。

开放问题 这项研究留下的未解疑问

  • 1 尽管对比机制有效缓解了风格漂移,但在多模态任务中,如何设计有效的正负提示仍是挑战,尤其是在图像、视频等非文本场景中。未来需要探索多模态对比策略,结合视觉、语音等信息,提升模型的泛化能力。
  • 2 验证器的性能直接影响对比信号的质量,但在复杂或噪声环境下,验证器的鲁棒性不足,限制了方法的普适性。未来研究应关注验证器的优化与自适应机制。
  • 3 当前方法在极端长文本或多步骤推理任务中,提示设计和采样效率仍有待提升。如何在保证效率的同时,增强对比信号的代表性,是未来的研究方向。
  • 4 对比学习引入的计算成本较高,尤其在大模型训练中,如何降低采样与计算负担,保持训练效率,是一个亟待解决的问题。
  • 5 该方法主要在特定任务(数学、逻辑推理)验证,未来应扩展到更多任务类型(如对话、摘要、多模态推理),验证其广泛适用性。

应用场景

近期应用

智能问答系统优化

利用RLCSD提升问答模型在数学、逻辑推理中的准确性和稳定性,增强用户体验,适用于教育、客服等场景。

自动推理与验证工具

在科研和法律等领域,结合RLCSD构建高精度推理系统,自动验证复杂推理链,减少人工干预。

多任务模型训练

在多任务环境中应用RLCSD,提升模型对不同任务的内容关注能力,增强模型的泛化和鲁棒性。

远期愿景

跨模态智能系统

结合视觉、语音等多模态信息,发展具有内容专注与风格控制能力的多模态推理模型,推动智能交互的未来。

自主学习与适应

实现模型在不断变化的环境中自主调节风格偏好,提升自我优化能力,推动AI系统的自主学习发展。

原文摘要

On-policy self-distillation (OPSD) provides dense, token-level supervision for reasoning models by aligning a model's own distribution with the distribution it produces under privileged context, typically a verified solution. However, we show that the learning signal drawn from this distributional gap concentrates on style tokens rather than task-bearing ones, as the hinted model tends to produce more direct, shorter outputs. We term this pathology \emph{privilege-induced style drift}, which destabilizes training or causes response length to shrink. To address this, we propose \textbf{RLCSD} (Reinforcement Learning with Contrastive on-policy Self-Distillation), which mitigates this drift by contrasting the teacher-student gap under a correct hint against that under a wrong hint, suppressing the style shift that conditioning on a hint tends to induce regardless of correctness, and yielding a signal that is more concentrated on task-bearing tokens. Experiments on Qwen3 (1.7B/4B/8B) and Olmo-3-7B-Think across mathematical and logical reasoning show that RLCSD consistently outperforms GRPO and prior OPSD methods. We further show that the contrastive principle is general: it plugs into existing OPSD methods to improve them, and its underlying insight extends to the broader cross-model on-policy distillation setting.

cs.LG cs.CL

参考文献 (20)

MiMo-V2-Flash Technical Report

Xi Xiao, Bing Xia, Bo Yang 等

2026 111 引用 ⭐ 高影响力 查看解读 →

DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning

Adam Suma, Sam Dauncey

2025 5070 引用 ⭐ 高影响力

Self-Distilled Reasoner: On-Policy Self-Distillation for Large Language Models

Siyan Zhao, Zhihui Xie, Mengchen Liu 等

2026 245 引用 ⭐ 高影响力 查看解读 →

Reinforcement Learning via Self-Distillation

Jonas Hubotter, Frederike Lubeck, L. Behric 等

2026 212 引用 ⭐ 高影响力 查看解读 →

On-Policy Distillation of Language Models: Learning from Self-Generated Mistakes

Rishabh Agarwal, Nino Vieillard, Yongchao Zhou 等

2023 688 引用 ⭐ 高影响力 查看解读 →

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Zhihong Shao, Peiyi Wang, Qihao Zhu 等

2024 8314 引用 ⭐ 高影响力 查看解读 →

UniSD: Towards a Unified Self-Distillation Framework for Large Language Models

Yiqiao Jin, Yiyang Wang, Lucheng Fu 等

2026 4 引用 ⭐ 高影响力 查看解读 →

Unifying Group-Relative and Self-Distillation Policy Optimization via Sample Routing

Gengsheng Li, Tianyu Yang, Junfeng Fang 等

2026 47 引用 ⭐ 高影响力 查看解读 →

Logic-RL: Unleashing LLM Reasoning with Rule-Based Reinforcement Learning

Tian Xie, Zitian Gao, Qingnan Ren 等

2025 228 引用 查看解读 →

Black-Box On-Policy Distillation of Large Language Models

Tianzhu Ye, Li Dong, Zewen Chi 等

2025 44 引用 查看解读 →

Group Sequence Policy Optimization

Chujie Zheng, Shixuan Liu, Mingze Li 等

2025 634 引用 查看解读 →

GLM-4.5V and GLM-4.1V-Thinking: Towards Versatile Multimodal Reasoning with Scalable Reinforcement Learning

GLM-V Team Wenyi Hong, Wenmeng Yu, Xiaotao Gu 等

2025 353 引用 查看解读 →

Qwen3 Technical Report

An Yang, Anfeng Li, Baosong Yang 等

2025 7376 引用 查看解读 →

DeepMath-103K: A Large-Scale, Challenging, Decontaminated, and Verifiable Mathematical Dataset for Advancing Reasoning

Zhiwei He, Tian Liang, Jiahao Xu 等

2025 231 引用 查看解读 →

Understanding R1-Zero-Like Training: A Critical Perspective

Zi-Yan Liu, Changyu Chen, Wenjun Li 等

2025 1246 引用 查看解读 →

DAPO: An Open-Source LLM Reinforcement Learning System at Scale

Qiying Yu, Zheng Zhang, Ruofei Zhu 等

2025 2412 引用 查看解读 →

Simple Statistical Gradient-Following Algorithms for Connectionist Reinforcement Learning

Ronald J. Williams

2004 10617 引用

HybridFlow: A Flexible and Efficient RLHF Framework

Guangming Sheng, Chi Zhang, Zilingfeng Ye 等

2024 2154 引用 查看解读 →

DistiLLM: Towards Streamlined Distillation for Large Language Models

Jongwoo Ko, Sungnyun Kim, Tianyi Chen 等

2024 135 引用 查看解读 →

Classifier-Free Diffusion Guidance

Jonathan Ho

2022 6948 引用 查看解读 →

被引用 (15)

Privileged Likelihood Is Not Automatically Value: Three Checks for Token Credit in On-Policy Self-Distillation

2026 1 引用 ⭐ 高影响力 查看解读 →

Trust Is Not Enough: Influence Calibration for On-Policy Self-Distillation in Agentic RL

Latent On-Policy Self-Distillation

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

Bidirectional Context Self-Distillation for Reinforcement Learning of Skill-Based LLM Agents

Matching Supervision to the Student's Learning Capacity: A Unified Framework for On-Policy Self-Distillation

Agentic Reinforcement Learning with Observation-Calibrated Self-Distillation

SAF-OPD: Stable Advantage Fusion for On-Policy Distillation

2026 1 引用 查看解读 →

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

Contrastive Reinforced Policy Optimization via Privileged Self-Distillation

Group-Reflective Self-Distillation for Agentic Reinforcement Learning

Weak-to-Strong On-Policy Distillation

2026 3 引用 查看解读 →

CriPO: Enhancing Rubric-based RL via Self-Distillation

2026 1 引用 查看解读 →

Recursive Self-Improvement in AI: From Bounded Self-Refinement to Autonomous Research Loops

2026 6 引用 查看解读 →

DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

2026 1 引用 查看解读 →