Characterizing Optimizer-Dependent Training Dynamics Through Hessian Eigenvector Displacement and Localization

TL;DR

本研究通过Hessian特征分析优化器对训练动态的影响,发现SGD趋于稳定方向,Adam表现出Eigenvector重组与局部化。

cs.LG 🔴 高级 2026-06-29 44 次浏览
Marcelina Marjankowska Valerio Modugno Paolo Barucca
深度学习 优化器 Hessian谱 特征动态 训练稳定性

核心发现

方法论

采用多层感知机在分类任务中追踪Hessian的特征演变,利用Eigenvector位移和局部化指标(逆参与比)分析训练过程中的参数空间变化。通过Lanczos算法高效计算特征向量,比较不同优化器(SGD、Adam、SAM)在训练中的Eigenvector动态,结合随机模型作为基准,揭示优化器对Hessian特征空间的影响机制。

关键结果

  • SGD在训练后期趋于稳定主导的曲率方向,Eigenvector位移逐渐减小,局部化程度降低,表明参数空间的平坦区域被逐步探索。相比之下,Adam在整个训练过程中Eigenvector持续重组,表现出明显的Eigenvector迁移和局部化现象,局部化指标(IPR)在Adam中显著升高,说明少数参数对主导曲率贡献巨大。
  • 在MNIST和FashionMNIST数据集上,Eigenvector displacement在SGD中趋于饱和(变化幅度<0.01),而Adam中变化持续,且Eigenvector局部化在Adam中达到IPR≈0.1,远高于SGD的近零值。这些差异在不同学习率和批次大小下均稳健存在,验证了优化器对训练几何路径的深刻影响。
  • Eigenvector与梯度、参数更新的对齐分析显示,SGD的更新与主导Eigenvector保持较高一致性(对齐度>0.8),而Adam的对齐度低于0.1,表明Adam引入了更复杂的Eigenvector重组机制,可能促进探索不同的局部极小值区域。

研究意义

本研究通过Eigenvector动态揭示了不同优化器在训练中的几何路径差异,为理解深度网络训练的本质提供了新的视角。Eigenvector的稳定性与局部化特性不仅影响模型泛化能力,也为优化算法设计提供理论依据。揭示Eigenvector重组与局部化机制,有助于开发更高效、鲁棒的训练策略,推动深度学习模型的理论研究与实践应用的深度融合。

技术贡献

提出Eigenvector位移与局部化指标,系统分析不同优化器在训练中的Hessian特征演变,首次在mini-batch训练中揭示Adam引入的Eigenvector重组和局部化现象。结合Lanczos算法和随机模型,量化Eigenvector动态,为深度学习训练几何路径提供新的定量工具。此研究丰富了Hessian谱分析的理论体系,为优化器设计和模型压缩提供理论基础。

新颖性

首次系统性追踪训练过程中单个Hessian主导Eigenvector的演变,揭示Adam引入的Eigenvector重组与局部化机制,区别于以往只关注Eigenvalues或Eigen空间稳定性的研究。提出Eigenvector displacement和IPR指标,为训练动态提供更细粒度的几何描述,填补了深度学习训练几何路径研究的空白。

局限性

  • 本研究主要基于多层感知机模型,复杂网络结构(如Transformer、ResNet)中的Eigenvector动态可能存在差异,需进一步验证。
  • Eigenvector的重组机制在极端超参数(如超大学习率)或特殊任务(如生成模型)中的表现尚未充分探究,未来需扩展分析范围。
  • 高效计算Eigenvector在大规模模型中的成本较高,未来需发展更低成本的近似算法以支持更大模型的分析。

未来方向

未来将结合Eigenvector动态与训练稳定性、泛化性能的关系,探索Eigenvector局部化与模型鲁棒性之间的联系。还计划将Eigenvector分析扩展到不同网络结构和优化策略,研究Eigenvector重组在模型压缩和剪枝中的应用潜力。此外,结合理论分析与实证研究,推动Eigenvector动态在自动调参和优化器设计中的实际落地。

AI 总览摘要

深度神经网络的训练过程复杂且高维,理解其几何特性一直是研究难点。传统上,Hessian谱被用来分析模型的局部曲率,关联模型的泛化和优化行为。然而,Eigenvalues只描述了曲率的大小,Eigenvectors则揭示了参数空间中具体的方向信息。本研究通过追踪多层感知机在分类任务中的Eigenvector动态,发现不同优化器引发的训练路径存在显著差异。

具体而言,采用Eigenvector位移和局部化指标,揭示SGD在训练后期趋于稳定的主导方向,而Adam则表现出持续的Eigenvector重组和局部化现象。这些差异反映了优化器在探索参数空间中的不同策略。实验结果显示,Adam中的Eigenvector局部化程度高,少数参数对主导曲率贡献巨大,可能导致模型在某些区域过度依赖特定参数。

这些发现不仅丰富了对训练几何路径的理解,也为优化器设计提供了新思路。Eigenvector的稳定性和局部化特性可能影响模型的泛化能力和鲁棒性。未来,结合Eigenvector分析与模型压缩、剪枝等技术,有望推动深度学习在实际应用中的性能提升。尽管如此,当前研究仍局限于小型模型,未来需扩展到更复杂网络结构,探索Eigenvector动态在大规模模型中的表现与潜在应用。

深度解读

原文摘要

Hessian spectral properties are a standard tool in analysing neural-network training, with eigenvalues linked to sharpness, generalization, and optimization dynamics. Eigenvalues quantify curvature magnitude, while eigenvectors identify which parameters generate that curvature. In this work, we study how the leading Hessian eigenvectors evolve during training and how they affect the learning trajectories. We track the training dynamics of multilayer perceptrons on a classification problem and measure eigenvector dynamics through two complementary statistics: (i) displacement over time, inspired by analyses of glassy systems, and (ii) localization via the inverse participation ratio. The metrics are compared against a random null model of the Hessian induced by the architecture. Our results reveal clear optimizer-dependent behaviour. SGD leads to progressively more stable leading curvature directions, while Adam exhibits substantially stronger reorganization of eigenvectors throughout training. We also observe a localization phenomenon under Adam, where a small subset of parameters contributes disproportionately to the leading curvature directions. These results suggest that Hessian eigenvector dynamics capture key differences in optimizer behaviour and the resulting training trajectories.

cs.LG