SubZero+: Efficient Zeroth-Order LLM Fine-Tuning via Large Learning Rates

TL;DR

SubZero+通过大学习率提升零阶优化稳定性,在SuperGLUE上优于现有基线。

cs.LG 🔴 高级 2026-08-16 34 次浏览
Ziming Yu Shuyao Xiao Xingyu Zhao Sike Wang Pan Zhou Peiyu Zang Xiangda Yan Yongjie Yang Jia Li
零阶优化 大语言模型 学习率 稳定性 SubZero+

核心发现

方法论

SubZero+通过在层特定的低秩子空间中进行多查询梯度估计,使用子空间Adam优化器进行自适应更新,并通过QR分解进行符号校正来提高稳定性。此方法在不增加显著内存开销的情况下,扩大了稳定学习率范围。

关键结果

  • SubZero+在SuperGLUE上对1.3B到32B模型进行实验,表现优于现有的零阶基线,并缩小了与一阶方法的差距。
  • 在OPT-1.3B模型上,SubZero+的准确率达到66.3%,超过SubZero的65.5%和MeZO的64.6%。
  • 在Qwen2.5-32B模型上,SubZero+的平均准确率为87.4%,比SubZero高2.3%。

研究意义

SubZero+的提出解决了零阶优化中高方差梯度估计导致的收敛不稳定问题,显著提高了大语言模型微调的稳定性和效率。其方法在不需要反向传播的情况下,提供了一种内存高效的微调方案,具有重要的学术和工业应用价值。

技术贡献

SubZero+通过引入多查询梯度估计和子空间Adam优化器,提供了新的理论保证和工程可能性。其QR分解的符号校正消除了实现依赖的方向模糊性,显著提高了优化稳定性。

新颖性

SubZero+首次在零阶优化中结合多查询梯度估计和子空间自适应优化,突破了多查询悖论,提供了更稳定的优化路径。

局限性

  • SubZero+对学习率仍然敏感,尽管其范围有所扩大。
  • 在某些高维参数空间中,可能仍会出现收敛不稳定的情况。

未来方向

未来研究可以探索进一步减少梯度估计方差的方法,以及在更大规模模型上的应用。

AI 总览摘要

SubZero+通过在零阶优化中引入多查询梯度估计和子空间Adam优化器,解决了现有方法中高方差梯度估计导致的收敛不稳定问题。该方法在SuperGLUE基准上对1.3B到32B模型进行实验,表现优于现有的零阶基线,并缩小了与一阶方法的差距。

SubZero+的核心技术包括在层特定的低秩子空间中进行多查询梯度估计,使用子空间Adam优化器进行自适应更新,以及通过QR分解进行符号校正。这些技术的结合提高了优化的稳定性和效率,尤其是在大语言模型的微调中。

实验结果显示,SubZero+在多个任务上均取得了优于现有方法的表现,特别是在OPT-1.3B和Qwen2.5-32B模型上的实验中,SubZero+的准确率分别达到66.3%和87.4%。尽管如此,SubZero+对学习率仍然敏感,未来研究可以探索进一步减少梯度估计方差的方法。

深度分析

研究背景

零阶优化是一种无需反向传播的优化方法,适用于大语言模型的微调。现有的零阶方法面临高方差梯度估计的问题,导致收敛不稳定。SubZero通过在层特定的低秩子空间中进行梯度估计,减少了方差,但仍对学习率敏感。

核心问题

零阶优化的核心问题在于高方差梯度估计导致的收敛不稳定,尤其是在大语言模型的微调中。随着参数维度的增加,方差问题愈加严重,限制了零阶优化的应用。

核心创新

SubZero+通过多查询梯度估计和子空间Adam优化器,解决了零阶优化中的高方差问题。其QR分解的符号校正消除了实现依赖的方向模糊性,提高了优化稳定性。

方法详解

  • �� 在层特定的低秩子空间中进行多查询梯度估计,减少方差。
  • �� 使用子空间Adam优化器进行自适应更新,提高训练效率。
  • �� 通过QR分解进行符号校正,确保投影矩阵的Haar分布。

实验设计

实验在SuperGLUE基准上进行,涉及1.3B到32B的模型。使用OPT、LLaMA和Qwen等模型,比较SubZero+与现有零阶基线的表现,评估其在全参数微调和LoRA方案下的效果。

结果分析

SubZero+在多个任务上表现优于现有零阶基线,特别是在OPT-1.3B和Qwen2.5-32B模型上的实验中,SubZero+的准确率分别达到66.3%和87.4%。

应用场景

SubZero+适用于大语言模型的微调,尤其是在内存受限的环境中。其方法在不需要反向传播的情况下,提供了一种内存高效的微调方案。

局限与展望

SubZero+对学习率仍然敏感,尽管其范围有所扩大。在某些高维参数空间中,可能仍会出现收敛不稳定的情况。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,SubZero+就像一个智能厨师助手。它不需要你一步步指导,而是通过观察你的动作来学习如何更好地帮助你。它会在你需要的时候提供建议,比如调整火候或添加调料,而不需要你告诉它每一个步骤。这个助手通过在不同的菜肴中积累经验,逐渐提高自己的能力,帮助你在厨房中更加高效地工作。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级复杂的游戏,SubZero+就像一个聪明的游戏助手。它能帮你在不需要按下所有按钮的情况下,找到通关的最佳路线。它会观察你的游戏风格,然后给你一些建议,比如什么时候该加速或者减速。这样一来,你就能更快地通关,而不需要每次都从头开始摸索。是不是很酷?

术语表

Zeroth-Order Optimization (零阶优化)

一种无需反向传播的优化方法,适用于大语言模型的微调。

用于减少大语言模型微调中的内存开销。

SubZero+

一种改进的零阶优化框架,通过多查询和子空间优化提高稳定性。

在SuperGLUE基准上表现优于现有零阶基线。

QR Decomposition (QR分解)

一种矩阵分解方法,用于生成正交矩阵。

用于确保投影矩阵的Haar分布。

Haar Distribution (Haar分布)

一种概率分布,确保矩阵的旋转不变性。

用于消除实现依赖的方向模糊性。

SuperGLUE

一种用于评估自然语言理解模型的基准测试。

用于评估SubZero+的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步减少零阶优化中的梯度估计方差?
  • 2 在更大规模模型上,SubZero+的性能如何?
  • 3 如何优化SubZero+在高维参数空间中的表现?

应用场景

近期应用

大语言模型微调

SubZero+可以在内存受限的环境中高效微调大语言模型,适用于需要快速适应新任务的场景。

远期愿景

通用人工智能

通过提高零阶优化的稳定性,SubZero+为实现更高效的通用人工智能提供了可能性。

原文摘要

Zeroth-order (ZO) optimization enables backpropagation-free fine-tuning of large language models, but existing ZO methods suffer from high-variance gradient estimators, making convergence unstable and highly sensitive to learning rates. We propose SubZero+, an improved SubZero framework that improves stability in three complementary ways: (i) multi-query gradient estimation within layer-specific low-rank subspaces to reduce variance without exhibiting the multi-query paradox; (ii) a subspace Adam optimizer that performs adaptive updates using in-subspace multi-query gradient statistics; and (iii) a sign correction for QR-based subspace construction to ensure Haar-distributed projection matrices, eliminating implementation-dependent orientation ambiguity. Experiments on models from 1.3B to 32B across SuperGLUE, under both full-parameter tuning and LoRA, show that SubZero+ consistently outperforms prior ZO baselines, enlarges the stable learning-rate range, and narrows the gap to first-order methods with minimal extra memory overhead.

cs.LG