Effective Learning Rate Governs Loss Dynamics in Language Model Pretraining

TL;DR

ELR(有效学习率)主导语言模型预训练中的损失动态,匹配ELR实现轨迹崩溃。

cs.LG 🔴 高级 2026-08-26 70 次浏览
Zihan Liu Ruiheng Zheng Shaobo Zhang Changxin Tian Kunlong Chen Zhiqiang Zhang Lei Wu
深度学习 优化算法 预训练 模型动力学 ELR

核心发现

方法论

本文提出通过匹配ELR(η/∥W∥F)调度,实验证明不同学习率和参数范数轨迹在损失动态上高度一致。采用多模型、多数据集、多优化器的对比实验,结合归一化设计和LR-范数变化尺度分析,验证ELR在损失崩溃中的核心作用。引入控制干预,分析权重衰减和Hyperball调度对ELR的影响,建立ELR调度与损失动态的关系模型。利用拟合的函数缩放定律(FSL),实现跨范数控制方法的迁移,揭示延迟加速现象由ELR调度引起。

关键结果

  • 在不同模型(如Llama-124M、Qwen3-MoE-586M)和优化器(AdamW、Muon、Signum)中,通过匹配ELR调度,损失轨迹的平均崩溃误差仅为几×10^-3,远低于随机种子引起的变化(约10^-2),表现出极高的鲁棒性。
  • 在实际范数控制(权重衰减、Hyperball)中,只调节学习率以匹配ELR,仍能重现目标损失轨迹,验证ELR在调控损失中的主导作用。
  • 利用ELR调度的拟合FSL成功实现不同范数控制方法间的迁移,预测延迟加速现象,表明ELR是连接学习率调度、范数调控与损失动态的统一坐标系。

研究意义

该研究突破了传统对学习率和范数控制的孤立理解,提出ELR作为统一调控变量,极大简化模型训练的理论框架。其在预训练模型中的应用,为优化调度、模型稳定性和迁移学习提供了新思路,有望推动大规模模型训练的效率和鲁棒性提升。

技术贡献

技术创新在于提出ELR作为损失动态的核心调控参数,建立ELR调度与损失的高精度崩溃关系,发展跨范数控制的迁移能力,结合拟合的函数缩放定律(FSL)实现调度策略的泛化。引入归一化设计和调度尺度分析,丰富了优化理论基础,为未来自适应调度提供了理论支撑。

新颖性

首次系统性验证ELR在语言模型预训练中的普适性,超越了尺度不变性假设,揭示其在不同模型、数据集和优化器中的调控作用。创新性在于将ELR作为连接学习率、参数范数与损失动态的统一坐标,提出可迁移的缩放定律,解决了范数控制与训练动态的关系难题。

局限性

  • 实验主要集中在特定模型规模和数据集,尚未验证在超大模型或不同任务中的普适性。
  • ELR崩溃的高精度依赖于归一化设计和调度尺度,可能在某些非标准配置下表现不佳。
  • 对ELR调度的动态机制理解仍不充分,未来需深入分析其微观动力学基础。

未来方向

未来将探索ELR调度的自适应策略,结合动态归一化机制,提升训练效率与稳定性。同时,扩展到超大模型和多任务场景,验证其泛化能力。深入分析ELR的微观动力学,结合理论模型,推动调度策略的理论发展。

AI 总览摘要

近年来,深度学习中的预训练模型,尤其是大型语言模型(LLMs),在性能提升的同时也带来了训练过程中的复杂动力学问题。传统上,学习率(LR)和参数范数被视为影响训练的两个独立因素,但其实际作用机制尚不完全清楚。本文通过系统性实验,揭示了ELR(有效学习率)——即LR与参数范数的比值——在损失动态中的核心调控作用。研究发现,当不同训练配置中的ELR保持一致时,损失轨迹几乎完全重合,表现出极高的崩溃精度(误差仅几×10^-3),远优于随机种子变化的水平。这一现象被称为ELR崩溃,表明ELR是连接学习率调度和范数控制的统一坐标。实验还验证了在实际范数调控(如权重衰减和Hyperball)中,只调节学习率以匹配ELR,即可重现目标损失轨迹,强调ELR在调控中的主导作用。进一步,利用拟合的函数缩放定律(FSL),实现了跨范数控制方法的迁移,揭示了延迟加速现象的根源——由ELR调度引起的动态变化。综上,ELR成为理解和优化大规模预训练模型的关键变量,为未来调度策略和模型迁移提供了理论基础和实践指南。

深度分析

研究背景

深度学习模型的训练动力学一直是研究热点,尤其是在大规模预训练模型中。早期工作如Loshchilov和Hutter(2019)提出的AdamW优化器,强调权重衰减对模型稳定性的重要性。近年来,Norm控制机制(如Hyperball和Spectral Norm)被引入以调节参数范数,改善训练效果。然而,关于学习率调度与范数控制如何共同影响损失动态,仍缺乏统一理解。现有研究多关注单一因素的作用,缺少系统性分析。本文试图填补这一空白,提出ELR作为连接两者的核心变量,揭示其在不同模型、数据集和优化器中的普适性。

核心问题

核心问题在于,学习率和范数控制是否是两个独立的调节维度,还是通过某个共同变量——ELR——共同调控损失动态。传统观点认为,两者作用机制不同,但缺少定量证据。若ELR确实是主导因素,则可以简化训练调度,提升模型性能和稳定性。该问题的解决,将有助于理解大规模模型训练的本质动力学,优化调度策略,减少调参成本。

核心创新

主要创新包括:1)提出ELR作为损失动态的核心调控变量,突破尺度不变性假设,验证其在非尺度不变模型中的适用性;2)通过匹配ELR调度,实现不同训练配置的损失轨迹崩溃,提供量化的崩溃误差指标;3)结合拟合的函数缩放定律(FSL),实现跨范数控制方法的迁移,揭示延迟加速现象的根源;4)引入归一化设计和调度尺度分析,丰富优化理论基础,推动调度策略的自适应发展。

方法详解

  • �� 构建ELR定义:ηeffk := ηk/∥Wk∥F,作为调度核心参数。
  • �� 设计多样学习率(线性上升、下降、正弦)和范数调控(权重衰减、Hyperball)方案。
  • �� 通过匹配ELR调度,比较不同配置的损失轨迹,计算崩溃误差(平均几×10^-3)。
  • �� 引入归一化设计(QK-Norm、RMSNorm)增强崩溃精度,分析调度尺度对崩溃的影响。
  • �� 利用干预实验验证ELR在实际范数调控中的主导作用,调整学习率以匹配ELR调度。
  • �� 拟合函数缩放定律(FSL),用ELR参数化,预测不同范数控制方法的损失动态。
  • �� 进行跨模型、数据集、优化器的系统验证,确保结论的普适性。

实验设计

  • �� 采用Llama-124M、Qwen3-MoE-586M等模型,训练数据包括FineWeb、C4、OpenWebText。
  • �� 使用AdamW、Muon、Signum优化器,调节学习率和范数控制参数。
  • �� 设计多种学习率调度(线性、正弦)和范数调控(权重衰减、Hyperball)方案。
  • �� 通过ELR匹配,评估损失轨迹崩溃误差,比较不同配置的崩溃精度。
  • �� 进行归一化设计的消融实验,分析调度尺度对崩溃的影响。
  • �� 利用拟合的FSL模型,验证跨范数控制方法的迁移能力,测试延迟加速现象的解释。

结果分析

  • �� 在多模型和优化器中,ELR匹配实现的损失轨迹崩溃误差仅为几×10^-3,远低于随机种子变化的10^-2,显示出极高的鲁棒性。
  • �� 实际范数调控中,只调节学习率以匹配ELR,即可重现目标损失轨迹,验证ELR的主导作用。
  • �� 拟合的ELR-参数化FSL模型,成功实现不同范数控制方法间的迁移,预测延迟加速现象,验证ELR作为统一调控变量的有效性。

应用场景

  • �� 该研究为大规模预训练模型的调度策略提供理论基础,可用于提升训练效率和模型稳定性。
  • �� 在工业界,优化ELR调度可降低调参成本,增强模型迁移能力,推动AI在自然语言处理、计算机视觉等领域的应用。

局限与展望

  • �� 目前实验主要集中在中等规模模型,尚未验证在超大模型或多任务场景中的适用性。
  • �� ELR崩溃的高精度依赖归一化设计,可能在非标准配置下表现不佳。
  • �� 对ELR调度的微观动力学理解仍不充分,未来需结合理论模型深入分析。

通俗解读 非专业人士也能看懂

想象你在开一家工厂,生产各种商品。工厂的效率取决于两个因素:一是工人工作的速度(学习率),二是工厂的规模(参数范数)。如果工厂调整工人速度和规模,但保持一个叫做ELR(有效工作速率)的比值不变,那么生产效率的变化就会保持一致。也就是说,不管你怎么调节工人速度或工厂大小,只要这个比值不变,生产线的表现就不会变。这就像你在调节洗衣机的转速和衣服的量,只要转速和衣服的比例保持不变,洗衣效果就一样。这个发现帮助我们理解,训练模型时,调节学习率和参数范数实际上是通过ELR这个“效率比”在控制模型的学习过程。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,你的角色升级速度取决于两个因素:你用的技能强度(学习率)和你拥有的装备等级(参数范数)。如果你调整技能强度和装备等级,但保持一个叫做ELR(有效升级速率)的比例不变,你的升级速度其实没有变。就是说,不管你怎么调节技能和装备,只要这个比例不变,升级的快慢就一样。这就像你在厨房做饭,火力大小和食材的量都可以调节,但只要火力和食材的比例不变,菜的熟度就一样。这告诉我们,训练模型其实是通过这个“效率比”在调节,保持它不变,就能让训练效果稳定。

原文摘要

We uncover ELR collapse in language model pretraining: learning rate (LR) and parameter norm govern loss dynamics primarily through their ratio, the effective learning rate (ELR). When ELR is matched across runs, their loss trajectories collapse throughout training despite substantially different LRs and parameter norms. Across optimizers, architectures, datasets, and model scales, mean collapse errors are typically a few x 10^-3, below the seed-to-seed variation measured in a representative configuration. Systematic ablations identify normalization design and the timescale of LR-norm variation as key determinants of collapse precision. Controlled interventions further show that weight decay and Hyperball shape loss dynamics primarily through the ELR schedules they induce. Replacing LR with ELR enables a fitted functional scaling law (FSL) to transfer across norm-control methods. The resulting ELR-based FSL also explains delayed acceleration, a recurring effect of norm control. Together, these results establish ELR as a common coordinate linking LR scheduling, norm control, and loss dynamics.

cs.LG