SFT Conflicts, RL Coexists: A Theoretical and Empirical Analysis of Multi-Task Learning for LLMs

TL;DR

本研究分析SFT与RL在多任务学习中的冲突与共存,发现RL引入稀疏正交参数更新,显著减少任务干扰。

cs.CL 🔴 高级 2026-08-04 54 次浏览
Kejian Zhu Zhuoran Jin Shangqing Tu Hongbang Yuan Yushi Bai Kang Liu Juanzi Li Jun Zhao
多任务学习 大模型 梯度干扰 参数更新 强化学习

核心发现

方法论

采用深度分析结合实验证明,RL在多任务训练中引起参数稀疏且正交的更新,利用梯度干扰理论,分析优势函数和策略源的影响。通过对比SFT与RL在不同任务上的参数变化、梯度内积和干扰界限,揭示其机制差异。

关键结果

  • 实验证明,RL引起的参数更新平均幅度为SFT的1/100,且任务间参数余弦相似度接近零(~10^-5),而SFT则高达~10^-1,导致严重干扰。
  • 在多阶段训练中,SFT性能平均下降23.1%,而RL则实现24.9%的稳定提升。单任务训练中,SFT在目标任务上提升4%,但在未训练任务上下降5.1%;RL则在目标任务提升6.8%,同时提升未训练任务2.3%。
  • 理论分析表明,SFT干扰由梯度范数控制,RL干扰由梯度方差界定,后者因优势归一化和策略在采样中的正交性而极小,支持多任务共存。
  • 提出Parallel-RL框架,将任务独立训练后合并参数,显著提升训练效率与任务解耦能力,验证其在多任务场景中的优越性。

研究意义

本研究突破了多任务学习中任务干扰的根源理解,为大模型多任务训练提供理论支撑。RL的参数更新机制促使模型在多任务环境中实现稳定共存,解决SFT在多阶段训练中的崩溃问题,推动通用人工智能的发展。此机制为未来多任务优化提供新思路,兼顾效率与性能平衡。

技术贡献

提出基于梯度干扰理论的分析框架,明确区分SFT与RL在参数更新中的本质差异。引入优势函数和策略源的理论分析,证明RL引起的梯度正交性及其界限,提供多任务训练的数学保证。创新性地提出Parallel-RL范式,实现在多任务环境中的参数解耦与优化,极大提升训练效率与模型稳定性。

新颖性

首次系统性分析了SFT与RL在多任务训练中的梯度干扰机制,揭示RL引入稀疏正交参数更新的根本原因。提出的理论界限和Parallel-RL范式,为多任务大模型训练提供新颖的理论基础和工程方案,区别于传统的模型融合或单任务优化方法。

局限性

  • 当前分析主要基于梯度范数和方差界限,未充分考虑模型规模扩大带来的实际训练成本。
  • RL在复杂多任务环境中的泛化能力和稳定性仍需进一步验证,特别是在真实应用场景中。
  • Parallel-RL的任务解耦机制在极端任务异质性场景下可能面临挑战,需结合任务选择策略优化。

未来方向

未来将探索更细粒度的任务表示与解耦机制,结合元学习和自适应策略优化多任务训练效果。同时,计划扩展理论分析到更复杂的RL算法和大规模模型,验证其在实际工业应用中的可行性与效果。

AI 总览摘要

在大规模语言模型的多任务训练中,任务间的干扰一直是制约模型性能提升的关键难题。传统的Supervised Fine-Tuning(SFT)在多任务环境下表现出严重的任务冲突,导致性能崩溃。而强化学习(RL)则展现出稳定的任务共存能力,激发了学界对其机制的深入探究。本研究结合理论分析与实验证明,RL引入的参数更新具有稀疏性和正交性,显著降低了任务间的梯度干扰。具体而言,RL的梯度干扰由方差界限控制,而SFT则受梯度范数影响,导致干扰严重。通过对优势函数和策略源的分析,揭示了RL在多任务训练中的优势机制。基于此,提出Parallel-RL范式,将任务在参数空间中解耦,显著提升训练效率和模型稳定性。实验结果显示,Parallel-RL在多任务场景中不仅保持单任务性能,还大幅度提高训练效率,验证了理论分析的正确性。这一发现为大模型多任务训练提供了新思路,有望推动通用人工智能的实现。然而,当前研究仍存在模型规模扩大带来的计算成本问题,以及在极端异质任务环境中的适应性挑战。未来,将结合元学习和自适应策略,进一步优化多任务解耦机制,推动RL在实际工业中的应用落地。整体来看,本研究为理解和解决多任务学习中的梯度干扰提供了深刻的理论基础,为未来大模型的高效、多任务训练开辟了新路径。

深度解读

原文摘要

Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL) exhibit fundamentally different behaviors in enhancing multi-task reasoning for large language models (LLMs). Our preliminary experiments revealed a phenomenon: SFT suffers from severe task conflicts under multi-stage training, whereas RL enables stable coexistence across diverse tasks. Empirically, we trace this to the parameter level, observing that RL induces sparse and approximately orthogonal updates across tasks. We provide a theoretical explanation for this mechanism by analyzing multi-task gradient interference. Our results reveal a distinction: interference in SFT is norm-limited, scaling with the absolute gradient magnitude, whereas interference in RL is variance-limited, bounded by the gradient variance induced by advantage normalization and on-policy optimization. This small variance bound yields near-orthogonal optimization directions across tasks. Leveraging this insight, we propose Parallel-RL, a paradigm that decouples multi-task training, significantly improving efficiency and flexibility.

cs.CL cs.LG