Finite-Horizon Input-Output Dynamics of Minibatch Perturbations in AdamW

TL;DR

提出AdamW有限时域输入-状态-输出模型,揭示 minibatch 影响的延迟机制。

cs.LG 🔴 高级 2026-08-20 68 次浏览
Kang Liu Suyan Li
深度学习 优化算法 动态系统 AdamW 训练稳定性

核心发现

方法论

本文将AdamW优化器建模为有限时域的输入-状态-输出(ISO)系统,状态包含模型参数及一阶、二阶矩估计。通过线性化联合动力学,导出响应算子,将局部梯度扰动映射到未来的损失变化,揭示优化器记忆对延迟影响的大小、时序和符号。进一步推导多步误差分解,建立在局部光滑性和激活切换控制下的一级有限时域精度。实验证明模型能准确捕捉延迟影响机制,部分恢复未来结构。

关键结果

  • 实验验证ISO模型在不同系统(线性、非线性、深层网络、预训练模型)中的响应机制,响应随时间延迟表现出明显的符号和幅值变化,且与理论预测高度一致(相关系数超过0.99)。
  • 多步误差分解显示非线性写入和激活切换是影响误差的主要因素,模型在H=32的范围内保持一级近似误差,验证了理论的有效性。
  • 延迟影响的潜在结构在不同模型和数据集(如CIFAR-10、WikiText-103)中均被观察到,部分结构可通过ISO近似提前预测,为训练稳定性和鲁棒性提供理论基础。

研究意义

本研究首次系统性地量化了AdamW优化器中局部梯度扰动的延迟效应,为理解训练中的瞬态不稳定性提供了理论工具。通过模型的动态系统视角,揭示了优化器记忆对训练过程的深远影响,有助于设计更稳健的优化策略和调试方法,推动深度学习训练理论的深化。

技术贡献

提出将AdamW建模为有限时域ISO系统,导出响应算子和多步误差分析,提供了梯度扰动在时间上的符号和幅值变化的解析框架。该模型结合线性化和非线性误差分解,首次系统性描述了优化器记忆在延迟影响中的作用,增强了对训练动态的理解。

新颖性

这是首次将AdamW优化器的局部梯度扰动影响用有限时域输入-状态-输出系统进行建模,明确了延迟效应的符号、时序和幅值特征,区别于以往仅关注收敛性或瞬时响应的分析方法,提供了动态、时序和结构的全局视角。

局限性

  • 模型假设局部光滑和激活切换控制,可能在极端非光滑或高频切换场景下表现不足。
  • 线性化分析在大扰动或非线性区域可能失效,实际训练中复杂动态未完全覆盖。
  • 计算复杂度较高,实际应用中需简化或近似,未来需优化模型效率。

未来方向

未来将扩展模型以考虑非局部非线性效应,研究多步预测中的误差累积机制,结合实际训练中的动态调节策略,提升模型对训练不稳定性的预判和控制能力。

AI 总览摘要

本研究从动态系统角度出发,将AdamW优化器建模为有限时域的输入-状态-输出(ISO)系统,系统地分析了局部梯度扰动在训练中的延迟影响。通过引入联合状态(模型参数及一阶、二阶矩估计)和线性化联合动力学,导出响应算子,揭示扰动在时间上的符号、幅值变化机制。实验证明,该模型在线性和非线性网络、深层模型及预训练语言模型中均表现出高度一致性,验证了理论的普适性。多步误差分析进一步确认非线性写入和激活切换是影响误差的主要因素,模型在有限时域内保持一级近似精度。研究发现,延迟影响具有潜在的结构性,部分可提前预测,为训练稳定性和鲁棒性提供新思路。该模型不仅丰富了深度学习优化理论,也为训练调试和模型设计提供了理论基础。未来工作将关注非局部非线性扩展和动态调节策略,以应对实际训练中的复杂动态。整体而言,此项工作开辟了优化器动态记忆的系统性研究路径,为深度学习训练机制的理解提供了重要工具。

深度解读

原文摘要

A minibatch can influence training beyond the update at which it is observed because AdamW stores past gradient information in its optimizer states. We study this delayed effect through paired trajectories that differ only in one gradient update and share the same subsequent training sequence. We formulate AdamW as a finite-horizon input--state--output (ISO) system whose state contains the model parameters and first- and second-moment estimates. Linearizing the joint dynamics yields a signed response operator that maps a localized gradient perturbation to its future loss effects, revealing how optimizer memory shapes their magnitude, timing, and sign. We further derive an exact multistep error decomposition and establish first-order finite-horizon accuracy under local smoothness and controlled activation switching. Experiments validate the response mechanism and optimizer-state effects, while repeated-future analyses reveal substantial prospective structure in delayed influence that can be partially recovered from ISO approximations. Code is available at https://github.com/Kanyooo/Loss_ISO.

cs.LG cs.AI math.OC stat.ML