Sparse Model Soups: A Recipe for Improved Pruning via Model Averaging

TL;DR

Sparse Model Soups方法通过模型平均改进剪枝,提升泛化和OOD性能,同时保持稀疏性。

cs.LG 🔴 高级 2023-06-29 35 次浏览
Max Zimmer Christoph Spiegel Sebastian Pokutta
模型剪枝 稀疏性 模型平均 泛化性能 OOD鲁棒性

核心发现

方法论

Sparse Model Soups (SMS)通过在每次剪枝-再训练循环中从平均模型开始,结合稀疏性和模型平均的优势。IMP被扩展为在剪枝后生成多个共享稀疏结构的模型,随后进行平均。

关键结果

  • 在CIFAR-100上,SMS在98%稀疏度下将WideResNet-20的准确率提升至73.05%,比单一模型提高1%以上。
  • 在ImageNet上,SMS在90%稀疏度下的ResNet-50准确率达到74.96%,显著优于IMP和IMPm×。
  • 在OOD数据集ImageNet-C上,SMS提高了2.5%的鲁棒性,显示其对分布外数据的适应能力。

研究意义

SMS方法解决了稀疏模型平均导致稀疏性下降的问题,显著提升了剪枝模型的泛化能力和分布外鲁棒性。该方法可直接应用于现有剪枝框架,具有模块化和并行化的优势,为稀疏模型的实际部署提供了新的可能性。

技术贡献

SMS提出了一种全新的剪枝后模型平均框架,通过共享稀疏连接性和逐阶段模型平均,显著提升了IMP的性能。该方法还扩展了剪枝-训练领域,适配多种最先进的剪枝方法。

新颖性

SMS首次将模型平均与稀疏性结合,解决了稀疏模型平均导致稀疏性丧失的问题,并通过逐阶段平均实现性能提升。

局限性

  • 在高稀疏度下,模型平均的效果显著下降,可能由于随机性导致模型分歧。
  • SMS需要额外的计算资源来训练多个模型,尽管可以并行化。
  • 在某些极端剪枝场景中,性能提升可能有限。

未来方向

未来研究可探索SMS在更高稀疏度下的稳定性,优化模型平均策略,并将其应用于更多任务如强化学习和大规模语言模型。

AI 总览摘要

稀疏神经网络通过剪枝显著减少存储和计算需求,但模型平均常导致稀疏性下降。Sparse Model Soups (SMS)通过在每次剪枝-再训练循环中从平均模型开始,解决了这一问题,同时提升了泛化和分布外性能。

SMS基于Iterative Magnitude Pruning (IMP)框架,生成多个共享稀疏连接性的模型,通过平均构建单一模型。实验显示,SMS在CIFAR-100和ImageNet等数据集上显著优于传统IMP和扩展版本IMPm×,并在OOD数据集上表现出更强的鲁棒性。

尽管SMS在高稀疏度下的性能有所下降,但其模块化、并行化的设计为稀疏模型的实际部署提供了新方向。未来研究可进一步优化其在极端稀疏场景下的稳定性,并探索其在其他任务中的潜力。

深度分析

研究背景

神经网络的过参数化导致存储和计算成本高昂。剪枝技术通过移除冗余参数生成稀疏模型,显著降低了这些成本。模型平均(如Model Soups)通过参数平均提升了泛化性能,但在稀疏模型中,平均过程会破坏稀疏性。

核心问题

稀疏模型的平均会导致稀疏性下降,增加计算成本,同时可能降低模型性能。如何在保持稀疏性的同时利用模型平均的优势是一个关键挑战。

核心创新

SMS通过在每次剪枝-再训练循环中从平均模型开始,确保稀疏连接性的一致性,同时利用模型平均提升性能。这种方法首次将稀疏性与模型平均结合,解决了稀疏性下降的问题。

方法详解

  • �� 使用IMP进行剪枝,生成稀疏模型
  • �� 在剪枝后,生成多个共享稀疏连接性的模型
  • �� 使用不同的超参数(如批次顺序、权重衰减)对模型进行再训练
  • �� 对再训练后的模型进行参数平均,生成单一模型
  • �� 在下一轮剪枝-再训练循环中,从平均模型开始

实验设计

实验使用CIFAR-100、ImageNet等数据集,评估SMS在稀疏度和泛化性能上的表现。基线包括IMP、IMPm×和IMP-RePrune。实验还包括OOD鲁棒性和公平性分析。

结果分析

SMS在CIFAR-100上以98%稀疏度实现73.05%准确率,比IMP高出2%。在ImageNet上,SMS在90%稀疏度下达到74.96%,显著优于IMPm×。

应用场景

SMS可用于部署高效稀疏模型,适用于边缘设备和资源受限场景。其模块化设计便于集成到现有剪枝框架中。

局限与展望

SMS在高稀疏度下的性能提升有限,且需要更多计算资源。此外,其对随机性的稳定性在极端条件下可能不足。

通俗解读 非专业人士也能看懂

想象你在厨房做饭(训练模型),你需要减少食材浪费(剪枝)。SMS就像一个智能食谱,每次做饭前都会总结上次的经验(模型平均),确保每道菜都用最少的食材(稀疏性)做到最好。

简单解释 像给14岁少年讲一样

想象你在玩游戏,SMS就像一个超级队友,每次打完Boss后都会总结经验,升级装备(模型平均)。它还能让你用更少的金币(稀疏性)打出更高的伤害!

术语表

Iterative Magnitude Pruning (IMP)

一种剪枝方法,通过逐步移除低权重参数生成稀疏模型。

SMS基于IMP生成共享稀疏连接性的模型。

Model Soups

通过平均多个模型参数生成单一模型的方法。

SMS结合了Model Soups的思想以提升稀疏模型性能。

Out-of-Distribution (OOD)

指分布外数据,与训练数据分布不同。

SMS在OOD数据集上表现出更强的鲁棒性。

Sparsity

模型中非零参数的比例。

SMS通过保持稀疏性降低计算成本。

Weight Decay

一种正则化方法,通过惩罚权重大小防止过拟合。

SMS在再训练阶段使用不同的权重衰减超参数。

开放问题 这项研究留下的未解疑问

  • 1 SMS在极端稀疏条件下的稳定性仍需进一步研究。
  • 2 如何优化模型平均策略以适应更多任务仍是开放问题。
  • 3 SMS在大规模语言模型中的性能尚未验证。

应用场景

近期应用

边缘设备部署

SMS可用于生成高效稀疏模型,降低边缘设备的计算和存储需求。

分布外鲁棒性

SMS在OOD数据上表现优异,可用于安全关键应用,如自动驾驶。

远期愿景

通用稀疏模型框架

SMS可成为通用框架,适配不同任务和网络架构,推动稀疏模型研究。

原文摘要

Neural networks can be significantly compressed by pruning, yielding sparse models with reduced storage and computational demands while preserving predictive performance. Model soups (Wortsman et al., 2022) enhance generalization and out-of-distribution (OOD) performance by averaging the parameters of multiple models into a single one, without increasing inference time. However, achieving both sparsity and parameter averaging is challenging as averaging arbitrary sparse models reduces the overall sparsity due to differing sparse connectivities. This work addresses these challenges by demonstrating that exploring a single retraining phase of Iterative Magnitude Pruning (IMP) with varied hyperparameter configurations such as batch ordering or weight decay yields models suitable for averaging, sharing identical sparse connectivity by design. Averaging these models significantly enhances generalization and OOD performance over their individual counterparts. Building on this, we introduce Sparse Model Soups (SMS), a novel method for merging sparse models by initiating each prune-retrain cycle with the averaged model from the previous phase. SMS preserves sparsity, exploits sparse network benefits, is modular and fully parallelizable, and substantially improves IMP's performance. We further demonstrate that SMS can be adapted to enhance state-of-the-art pruning-during-training approaches.

cs.LG cs.AI