Super-Tuning: From Activation-Aware Pruning to Sparse Fine-Tuning

TL;DR

Super方法通过Wanda评分实现稀疏微调,在Math17K上表现优异。

cs.LG 🔴 高级 2026-07-10 45 次浏览
Ivan Ilin Philip Zmushko Peter Richtárik
大语言模型 参数高效微调 稀疏更新 LoRA Wanda评分

核心发现

方法论

Super方法利用Wanda风格的激活加权幅度评分实现稀疏参数高效微调。通过校准过程计算评分,选择少量权重进行微调。Supra方法结合稀疏更新与LoRA,使用简单的预算分配规则保持参数预算。

关键结果

  • Super/Supra在Llama-3.2-1B和Meta-Llama-3-8B上的Math17K实验中表现最佳,平均准确率最高。
  • PaFi风格的支持作为训练自由稀疏基线,低评分支持在幅度和Wanda风格排序下有效。
  • 实验表明简单的剪枝启发排序可以提供有用的固定稀疏支持,尤其是与低秩适配器结合时。

研究意义

该研究为大语言模型的参数高效微调提供了一种新的方法,显著减少了计算资源和存储需求,尤其适用于资源受限的环境。通过结合稀疏和低秩更新,解决了传统微调方法的高成本问题。

技术贡献

提出了一种新的稀疏参数高效微调方法,结合了Wanda评分和LoRA适配器,提供了新的理论保证和工程可能性。与现有方法相比,Super和Supra在参数预算下实现了更高的准确率。

新颖性

首次将剪枝启发的排序应用于参数高效微调,提供了一种训练自由的稀疏支持选择方法,与现有的基于梯度的选择方法相比具有独特优势。

局限性

  • Super方法在某些模型规模和训练计划下表现不如预期,可能需要进一步优化。
  • 稀疏支持的选择可能不适用于所有任务,尤其是复杂任务。
  • 需要更多实验验证不同模型和任务下的适用性。

未来方向

未来研究可以探索不同模型规模和任务下的稀疏支持选择策略,优化Wanda评分的计算过程,并结合其他适配器方法以提高性能。

AI 总览摘要

大语言模型的微调成本高昂,因为全参数更新需要大量内存、计算和存储。Super方法通过Wanda风格的激活加权幅度评分实现稀疏参数高效微调,选择少量权重进行微调。Supra方法结合稀疏更新与LoRA,使用简单的预算分配规则保持参数预算。在Llama-3.2-1B和Meta-Llama-3-8B上的Math17K实验中,Super/Supra表现最佳,平均准确率最高。该研究为大语言模型的参数高效微调提供了一种新的方法,显著减少了计算资源和存储需求,尤其适用于资源受限的环境。未来研究可以探索不同模型规模和任务下的稀疏支持选择策略,优化Wanda评分的计算过程,并结合其他适配器方法以提高性能。

深度分析

研究背景

大语言模型在自然语言处理领域取得了显著进展,但其微调成本高昂,尤其是在资源受限的环境中。传统微调方法需要更新所有参数,导致高计算和存储需求。参数高效微调方法通过更新少量参数来解决这一问题,其中LoRA通过注入低秩可训练矩阵实现了效率与性能的平衡。

核心问题

大语言模型的微调成本高昂,尤其是在资源受限的环境中。传统的微调方法需要更新所有参数,导致高计算和存储需求。如何在不影响性能的情况下减少微调成本是一个关键问题。

核心创新

Super方法利用Wanda风格的激活加权幅度评分实现稀疏参数高效微调,选择少量权重进行微调。Supra方法结合稀疏更新与LoRA,使用简单的预算分配规则保持参数预算。这些方法显著减少了计算资源和存储需求。

方法详解

  • �� 使用Wanda风格的激活加权幅度评分选择稀疏支持
  • �� 结合LoRA适配器实现低秩更新
  • �� 使用简单的预算分配规则保持参数预算
  • �� 在Math17K数据集上进行实验验证

实验设计

实验在Llama-3.2-1B和Meta-Llama-3-8B模型上进行,使用Math17K数据集进行算术推理任务。比较了不同适配器配置的平均准确率,验证了Super/Supra方法的有效性。

结果分析

Super/Supra在Math17K实验中表现最佳,平均准确率最高。PaFi风格的支持作为训练自由稀疏基线,低评分支持在幅度和Wanda风格排序下有效。实验表明简单的剪枝启发排序可以提供有用的固定稀疏支持。

应用场景

该方法适用于资源受限的环境,尤其是在需要个性化或快速部署模型的场景中。通过减少计算资源和存储需求,提高了大语言模型的微调效率。

局限与展望

Super方法在某些模型规模和训练计划下表现不如预期,可能需要进一步优化。稀疏支持的选择可能不适用于所有任务,尤其是复杂任务。需要更多实验验证不同模型和任务下的适用性。

通俗解读 非专业人士也能看懂

想象一个工厂,传统的微调方法就像要重建整个工厂,而Super方法则只需调整几个关键机器。通过选择少量重要的机器进行调整,工厂可以在不影响生产效率的情况下节省资源。这就像在厨房里,只需调整几个关键调料就能改变整个菜肴的风味。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,通常你需要升级所有角色才能赢得比赛。但Super方法就像只需升级几个关键角色就能获胜!这不仅节省了时间,还让你有更多资源去探索其他游戏。是不是很酷?

术语表

Super

一种稀疏参数高效微调方法,利用Wanda评分选择少量权重进行微调。

用于减少大语言模型的微调成本。

Supra

结合稀疏更新与LoRA的混合适配器方法。

用于保持参数预算的同时提高微调效率。

Wanda评分

一种激活加权幅度评分,用于选择稀疏支持。

用于Super方法的稀疏支持选择。

LoRA

一种低秩适配器方法,通过注入低秩矩阵实现参数高效微调。

用于减少微调成本。

Math17K

一个用于算术推理任务的数据集。

用于验证Super/Supra方法的有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何优化Wanda评分的计算过程以提高选择精度?
  • 2 在不同模型规模和任务下,稀疏支持选择策略的适用性如何?
  • 3 如何结合其他适配器方法以进一步提高性能?

应用场景

近期应用

资源受限环境

适用于需要快速部署和个性化模型的场景,减少计算资源和存储需求。

远期愿景

大规模模型优化

通过优化稀疏支持选择策略,提高大规模模型的微调效率。

原文摘要

Large language models (LLMs) remain expensive to fine-tune because full-parameter updates require substantial memory, compute, and per-task storage. We study whether saliency signals originally developed for pruning can be reused to choose where a model should adapt. We propose Super, a sparse parameter-efficient fine-tuning (PEFT) method that fixes a small trainable support using a Wanda-style activation-weighted magnitude score [Sun et al., 2023] computed from a calibration pass. We then introduce Supra, a hybrid adapter that combines this sparse update with LoRA while preserving a matched trainable-parameter budget through a simple budget-splitting rule. In single-seed Math17K arithmetic experiments on Llama-3.2-1B and Meta-Llama-3-8B, the best Super/Supra variants achieve the highest average accuracy among the tested schedule-selected adapter configurations. We also include a PaFi-style magnitude-only support as a closest training-free sparse baseline and find that low-score supports under both magnitude and Wanda-style orderings can be effective. These results suggest that simple pruning-inspired orderings can provide useful fixed sparse supports for PEFT, especially when combined with low-rank adapters.

cs.LG cs.CL