Linear Dynamics in the RLVR Training of Large Language Models

TL;DR

RLVR训练中参数和输出表现出高度线性,利用低阶滤波机制实现训练加速与性能提升。

cs.LG 🔴 高级 2026-01-08 29 次浏览
Tianle Wang Jiayu Liu Zhongyuan Wu Shenghao Jin Wei Chen Hao Xu Ning Miao
深度学习 强化学习 大模型 训练动力学 线性规律

核心发现

方法论

本文采用轨迹级分析,系统测量不同模型、算法和配置下参数与输出的变化轨迹,利用线性回归评估R^2值,结合理论模型揭示高方差噪声引导的低维稳定漂移机制。通过控制实验验证线性关系的普适性,并提出基于轨迹线性化的模型外推方法。核心算法包括GRPO、REINFORCE++等,利用teacher-forced评估确保输出测量的准确性。

关键结果

  • 在多模型(如DeepSeek-R1-Distill、Open-Nemotron-1.5B、Qwen3系列)和多算法(GRPO、GSPO、REINFORCE++)中,参数和输出的轨迹R^2值均超过0.7,表现出强烈线性特征,且该规律在不同配置下高度稳健。
  • 通过轨迹外推技术,模型性能与连续训练相当,甚至在某些任务(如数学推理、代码生成)中提升4.2%的平均性能,训练速度提升6.1倍,有效绕过模型崩溃点。
  • 高方差噪声在训练中起关键作用,低频模式的学习受阻,模型趋向沿稳定低维方向优化,验证了线性关系的因果机制。

研究意义

揭示RLVR训练中的线性动力学,为理解大模型微调的内部机制提供新视角,有助于提升训练效率、模型稳定性和可控性。模型外推技术可显著降低训练成本,推动大规模模型的快速部署和应用,具有深远的理论与实践意义。

技术贡献

提出轨迹层面线性规律的系统观察,结合理论分析阐释高方差噪声如何形成低维稳定漂移。创新性地将线性外推应用于模型参数和输出预测,实证验证其在多任务中的有效性,开启了基于训练轨迹的模型加速与优化新路径。

新颖性

首次系统性发现RLVR训练轨迹在参数与输出空间的高度线性特性,揭示其根源在于噪声驱动的低阶滤波机制,超越以往仅关注单步或宏观行为的研究,提供了理论基础与实用工具。

局限性

  • 当前分析主要基于特定RL算法和模型架构,未来需验证更复杂场景的普适性;线性外推在极端噪声或非平稳环境下的表现尚未充分评估;模型崩溃点的预测仍存在一定误差,需进一步优化。

未来方向

未来将探索线性规律在多任务、多模态和更大规模模型中的适用性,结合自适应外推策略提升预测精度,研究线性动力学在模型泛化和鲁棒性中的作用,推动训练理论的深层理解。

AI 总览摘要

近年来,强化学习与验证奖励(RLVR)成为大模型微调中的关键技术,显著提升了模型在推理和编码任务中的性能。然而,关于其内部训练动力学的理解仍然有限,尤其是模型参数和输出的变化轨迹。本文通过系统的轨迹级分析,发现无论模型规模、算法或配置如何,RLVR训练过程都表现出令人惊讶的高度线性特征。参数和输出的变化在训练过程中呈现出R^2值超过0.7的强烈线性关系,揭示了噪声驱动的低阶滤波机制,形成稳定的低维漂移方向。这一发现不仅丰富了对RLVR训练机制的理解,也为模型外推和加速提供了理论基础。实验证明,基于轨迹线性化的参数外推能在保持性能的同时,将训练时间缩短6.1倍,而输出空间的线性外推还能在模型崩溃点前超越实际训练的模型,平均性能提升4.2%。这些成果为大模型的高效训练与部署提供了新思路,具有重要的理论价值和实践潜力。未来工作将聚焦于扩展线性规律的适用范围,结合自适应外推策略,推动大模型训练的理论创新与技术突破。

深度分析

研究背景

随着大规模预训练模型的兴起,微调技术不断演进,强化学习与验证奖励(RLVR)成为提升模型推理能力的重要手段。早期工作如OpenAI的RLHF,主要关注奖励模型的设计与优化,但对训练过程中的动力学缺乏系统理解。近年来,研究逐步揭示参数空间的稀疏性、几何路径和Rank-1主导的线性特性,试图解释模型在推理任务中的高效学习机制。然而,这些研究多停留在微观或宏观层面,缺乏对训练轨迹的系统分析。本文通过轨迹级分析,发现参数和输出在训练中表现出高度线性,挑战了Transformer模型非线性的认知,开启了新的理解视角。

核心问题

尽管RLVR在性能上取得突破,但其内部训练动力学仍是“黑箱”。特别是,模型参数和输出的变化轨迹缺乏系统理解,限制了训练优化和模型外推的潜力。如何解释训练中的线性规律?其机制是否普遍?这些问题关系到模型的可控性、训练效率和未来的可扩展性。现有研究多关注单步或宏观行为,缺少轨迹层面的系统分析,导致对训练稳定性和模型能力演化的理解不足。

核心创新

本文的创新点包括:1)系统性发现RLVR训练中参数与输出的高度线性,R^2值普遍超过0.7;2)提出高方差噪声作为线性动力学的根源,利用低阶滤波机制解释稳定漂移;3)基于线性轨迹,开发参数和输出空间的外推方法,实现训练加速和性能提升;4)结合理论分析,验证线性关系的因果机制,为未来训练优化提供理论支撑。这些创新推动了对大模型训练动力学的深刻理解,开启了轨迹外推的实用新路径。

方法详解

  • �� 轨迹采样:在多模型、多算法环境中采集参数与输出的训练轨迹。• 线性回归:对每个参数和输出进行逐步线性拟合,计算R^2值评估线性程度。• 理论分析:建立高方差噪声引导的低阶滤波模型,解释轨迹线性化的机制。• 实验验证:通过控制不同噪声水平、优化器、初始化等,验证线性规律的普适性。• 轨迹外推:利用早期轨迹线性模型预测未来参数和输出,验证性能保持或提升。• 结合实际任务(数学、编码)进行性能评估,确保方法的实用性。

实验设计

实验涵盖13个不同配置,包括模型规模(1.5B-32B)、架构(Llama、Qwen)、算法(GRPO、GSPO、REINFORCE++)和数据集。每个配置采集训练中间点,计算参数和输出的R^2值,验证线性规律的稳健性。还通过控制噪声水平,验证噪声引导的线性机制。利用轨迹外推在多个基准(AIME24/25、MATH500、LiveCodeBench)上测试预测效果,比较实际训练与外推模型的性能差异。实验还包括不同优化器和初始化条件的对比,确保结论的普适性。

结果分析

参数和输出轨迹的R^2值普遍超过0.7,显示出强烈线性关系。轨迹外推在多个任务中实现性能与连续训练相当,甚至提升4.2%。训练速度提升6.1倍,验证了线性规律的实用价值。噪声分析表明高方差信号促使模型沿低阶方向稳定漂移,验证了机制假设。不同模型和配置下,线性特性保持一致,证明其普适性。

应用场景

该研究为大模型训练提供了高效外推和加速工具,可用于快速模型部署、模型集成和持续学习。通过轨迹线性化,减少训练时间和资源消耗,特别适合资源有限的场景。未来,结合自适应外推策略,有望实现更智能的训练调度和模型优化,推动AI在工业界的广泛应用。

局限与展望

当前分析主要基于特定RL算法和模型架构,未来需验证在更复杂、多模态环境下的适用性。线性外推在极端噪声或非平稳环境中的表现尚未充分评估。模型崩溃点的预测误差可能影响实际应用效果,需进一步优化。

通俗解读 非专业人士也能看懂

想象你在一家工厂里工作,工厂每天都在生产不同的产品。工厂的机器会不断调整自己的操作方式,试图做得更快更好。虽然每次调整都带来一些变化,但你会发现,工厂的整体生产流程其实变得越来越像一条直线——每次改进都沿着之前的方向前进,没有突然偏离。这是因为工厂的调整受到很多噪声和干扰,但这些噪声实际上帮助工厂集中在一个稳定的方向上,逐步优化。类似地,在大模型的RLVR训练中,参数和输出也表现出这种“沿直线前进”的规律。研究发现,模型的变化轨迹非常线性,甚至可以用简单的线性模型预测未来的状态。这意味着我们可以用少量的早期训练数据,预测模型未来的表现,从而大大节省训练时间。这就像提前知道工厂未来的生产线走向,提前做好准备一样,极大提高了效率和稳定性。

简单解释 像给14岁少年讲一样

想象你在学校里学习新技能,比如弹吉他。刚开始练习时,你会不断尝试不同的弾法,有时候会走偏,但慢慢地,你发现只要坚持沿着某个方向练习,就会变得越来越熟练。其实,虽然每次练习都带点随机,但整体上你的弹奏变得越来越像一条直线——你在不断改进,没有突然走偏。这就像科学家发现的一个秘密:在训练大模型时,参数和输出的变化也像沿着一条直线在前进。研究发现,这种线性关系很强,可以用简单的线性模型预测未来的表现。这样一来,我们就可以用早期的训练结果,提前知道模型未来的表现,节省很多时间和资源。就像你提前知道自己什么时候能弹出一首好歌一样,模型也可以提前预测自己会变得多厉害。这让训练变得更快、更稳定,也更容易控制。未来,这个发现可以帮助我们更快地训练出强大的AI,像提前知道未来一样,提前做好准备!

原文摘要

Reinforcement learning with verifiable rewards (RLVR) has driven significant performance gains in reasoning-oriented large language models (LLMs), yet its internal training dynamics remain largely a black box. In this work, we perform a comprehensive trajectory-level analysis of RLVR and uncover a striking regularity: across various model families, RL algorithms, and training configurations, RLVR consistently enters a robust linear regime, where both parameter weights and output log-probabilities, measured rigorously via teacher-forced evaluation, evolve in a highly linear manner ($R^2 > 0.7$). Through controlled experiments and theoretical analysis, we demonstrate that this linearity is not a coincidence, but stems from the high-variance, noisy nature of RLVR training signals, which act as a low-pass filter to concentrate optimization along a stable, low-dimensional drift. Moreover, we show that this linear structure is not merely descriptive but powerfully predictive and actionable. Specifically, weight-space extrapolation matches the performance of standard RL optimization while achieving a 6.1x training speedup through periodic re-grounding. Meanwhile, output-space extrapolation serves as a lightweight intervention that effectively bypasses late-stage model collapse, consistently outperforming standard RL across mathematical and coding benchmarks, with an average performance improvement of 4.2%. Our code is available at https://github.com/Miaow-Lab/RLVR-Linearity.

cs.LG cs.CL