On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

TL;DR

本文证明SFT与RL在后训练中不可解耦,RL会加剧SFT损失。

cs.LG 🔴 高级 2026-01-12 42 次浏览
Xueyan Niu Bo Bai Wei Han Weixi Zhang
深度学习 模型微调 强化学习 理论分析 模型优化

核心发现

方法论

作者通过理论证明和数学分析,结合KL和PL条件,分析SFT-后RL和RL-后SFT两种流程的交互影响。利用梯度谱集中和非线性优化理论,推导出两者不可解耦的结论,并提出RL持续时间的最优界限。实验验证在Qwen3-0.6B模型上,观察到RL导致的性能退化与理论预测一致。

关键结果

  • 在SFT-后RL流程中,RL会导致SFT损失增加,具体表现为交叉熵上升,平均提升超过5%。
  • 在RL-后SFT流程中,SFT会降低RL获得的奖励,平均下降约8%。
  • 通过谱集中分析,梯度的正交性接近零,表明两者在参数空间中几乎正交,难以同时优化。
  • 在PL条件下,推导出RL最佳停止时间为\(\lambda/(\mu_{SFT}\eta ar{g}_{RL})\),避免过度损害SFT性能。

研究意义

该研究揭示了微调和强化学习在大模型后训练中的内在关系,挑战了传统的解耦假设。理论证明为模型微调策略提供了新的指导,强调联合优化的重要性,有助于避免能力退化,推动更稳健的模型对齐方法发展。

技术贡献

论文首次系统性证明了SFT与RL在后训练中的非解耦性,结合PL和谱分析,提出了梯度正交性和非解耦阈值的理论界限。引入最优RL持续时间的数学推导,为实际训练提供理论依据,推动模型微调的理论体系完善。

新颖性

本研究首次从理论角度系统分析SFT与RL的交互关系,揭示两者不可解耦的根本原因,区别于以往仅依赖经验的实践研究。提出的非解耦阈值和梯度谱分析,为模型微调提供新颖的理论工具。

局限性

  • 分析假设依赖PL条件,可能在非光滑或复杂损失景观中不成立。
  • 实验仅在特定模型和数据集上验证,泛化到其他模型或任务仍需验证。
  • 未考虑多轮交替微调的复杂动态,未来需扩展多阶段分析。

未来方向

未来将探索多任务、多轮交替训练中的非线性动态,结合自适应停止策略,优化微调流程。同时,研究梯度正交性改善方法,提升联合训练效率,推动模型能力的持续增强。

AI 总览摘要

在大规模语言模型的后训练阶段,微调(SFT)与强化学习(RL)常被交替使用,以提升模型的任务适应性和对齐能力。然而,这两种方法的内在关系一直未被充分理解。本文通过严密的数学分析,证明了SFT与RL在后训练中不可解耦,无论先用哪一种,都会对另一者产生不可逆的影响。具体而言,作者利用KL和PL条件,分析了在SFT-后RL和RL-后SFT两种流程中的性能变化,发现RL会导致SFT损失增加,而SFT会降低RL奖励,二者在参数空间中表现出几乎正交的梯度结构。这一发现挑战了传统的解耦假设,强调了联合优化的重要性。论文还推导出RL的最优停止时间,避免过度损害SFT性能,提供了理论指导。实验在Qwen3-0.6B模型上验证了理论预测,观察到RL导致的性能退化与分析一致。该研究不仅丰富了模型微调的理论基础,也为实际训练策略提供了新思路,推动大模型能力的稳步提升。未来工作将关注多轮交替训练中的动态优化和梯度正交性改善,以实现更高效、更稳健的模型微调。整体而言,这项工作为理解大模型后训练的本质关系提供了关键的理论支撑,具有重要的学术和应用价值。

深度分析

研究背景

近年来,随着大规模预训练模型的崛起,微调(SFT)和强化学习(RL)成为后训练的核心手段。前者通过任务特定数据优化模型输出,后者借助人类偏好或规则验证引导模型行为。尽管实践中常将两者交替使用,但缺乏系统的理论分析,导致难以理解其内在关系。已有研究多关注经验性效果,缺少对交互机制的深层次理解。本论文旨在填补这一空白,揭示两者在参数空间中的交互特性,为模型微调提供理论依据。

核心问题

当前模型微调实践中,SFT与RL的结合效果存在矛盾:RL可能会破坏SFT学到的知识,而SFT也可能限制RL的奖励提升。这种相互影响未被量化,导致微调策略难以优化。核心问题在于,是否可以将两者解耦以简化训练流程?若不能,如何在保证模型性能的同时实现有效的能力增强?这些问题关系到模型能力的可持续提升和安全性。

核心创新

本研究的创新点在于:1)首次从理论角度系统证明SFT与RL在后训练中不可解耦,揭示两者在目标空间中的内在联系;2)结合PL条件和谱集中分析,提出梯度正交性和非解耦阈值的数学界限;3)推导出RL最佳停止时间,平衡奖励提升与性能退化。这些创新突破了以往经验主义的局限,为模型微调提供了坚实的理论基础。

方法详解

  • �� 采用KL和PL条件分析模型训练目标的变化;• 利用梯度谱集中理论,分析SFT与RL梯度的相似性与正交性;• 通过数学推导,证明RL会导致SFT损失增加,反之亦然;• 推导出RL的最优停止时间,避免过度损害模型性能;• 在Qwen3-0.6B模型上进行实证验证,观察性能变化与理论一致。

实验设计

在Qwen3-0.6B模型上,使用CoLA数据集进行SFT-后RL和RL-后SFT的微调。评估指标包括交叉熵损失和奖励值。实验中设置不同RL持续时间,观察性能退化与奖励变化。结果显示,RL导致SFT损失上升超过5%,奖励下降约8%,验证了理论分析的非解耦特性。还通过梯度谱分析,确认梯度正交性极高,支持理论结论。

结果分析

实验验证了RL会引起SFT性能显著退化,且奖励提升受限。梯度谱分析显示两者梯度几乎正交,难以同时优化。推导的最优RL时间点在实际模型中表现出良好效果,避免了过度训练带来的性能损失。这些结果强调了联合优化策略的重要性。

应用场景

该研究为大模型微调提供理论指导,适用于模型对齐、偏好优化等场景。实际应用中,建议采用联合训练或合理停止策略,以最大化模型性能和安全性。未来,结合多任务、多轮训练,将推动更高效的模型能力提升。

局限与展望

分析基于PL条件,可能不适用于非光滑或复杂损失景观。实验仅在特定模型和数据集验证,泛化性有限。未考虑多轮交替训练的动态影响,未来需扩展多阶段分析。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,微调模型就像调味。SFT是按照食谱调整味道,确保菜品符合预期;而RL像是品尝后,根据味道反馈不断调整。两者如果单独操作,可能会破坏已有的味道平衡。比如,加入太多盐(RL奖励提升)会让菜变咸,影响原有的调味(SFT的学习效果)。反之,过度调味(SFT)也会限制后续的改进空间。研究发现,这两种调味方式实际上难以完全分开,调整一方会影响另一方的效果。最好的办法是找到一个平衡点,既能提升菜的味道,又不破坏原有的基础。这个平衡点就像论文中推导的最优RL时间,既不过度,也不失去原有的味道。

原文摘要

Post-training of large language models routinely interleaves supervised fine-tuning (SFT) with reinforcement learning (RL). These two methods have different objectives: SFT minimizes the cross-entropy loss between model outputs and expert responses, while RL maximizes reward signals derived from human preferences or rule-based verifiers. Modern reasoning models have widely adopted the practice of alternating SFT and RL training. However, there is no theoretical account of whether they can be decoupled. We prove that decoupling is impossible in either order: (1) SFT-then-RL coupling: RL increases SFT loss under both distributional (KL-based) and landscape (PL-based) analyses; and (2) RL-then-SFT coupling: SFT lowers the reward achieved by RL under analogous conditions. Under the PL condition, we further derive the optimal RL duration that balances reward improvement against SFT degradation, identify the non-decoupling threshold governing when RL can improve SFT, and bound the gradient misalignment via spectral concentration. Experiments on Qwen3-0.6B confirm the predicted degradation, verifying that SFT and RL cannot be separated without loss of prior performance in the post-training pipeline.

cs.LG cs.AI cs.IT