Advancing Weight and Channel Sparsification with Enhanced Saliency

TL;DR

提出增强重要性评分的IEE方法,提升稀疏剪枝性能,在ImageNet上ResNet50达+1.3%准确率。

cs.LG 🔴 高级 2025-02-06 46 次浏览
Xinglong Sun Maying Shen Hongxu Yin Lei Mao Pavlo Molchanov Jose M. Alvarez
模型剪枝 稀疏训练 重要性评分 结构化稀疏 深度学习

核心发现

方法论

本文提出的IEE框架通过将模型划分为活跃结构和探索空间,结合迭代的利用与探索策略,优化参数重要性评分。利用冻结活跃结构、短期训练探索空间参数,评估其潜在贡献,再依据统一的重要性指标(如幅值或Taylor分数)进行参数的剪枝与生长。该方法在保持结构一致性的同时,显著提升稀疏模型的性能,兼容无结构和结构化稀疏,适用于多种深度模型和数据集。

关键结果

  • 在ImageNet上,ResNet50模型通过90% ERK稀疏率实现Top-1准确率提升1.3%,训练成本降低70%以上,优于RigL和HALP等SOTA方法。
  • 在MobileNetV1上,结构化剪枝结合Taylor评分,达成更优的延迟-准确率折衷,训练成本显著减少,推理速度提升。
  • 无结构稀疏方面,利用幅值和Taylor评分,提升稀疏模型在CIFAR-10和ImageNet上的性能,超越现有动态稀疏训练方法。

研究意义

该研究突破了剪枝中重要性评分的局限,通过引入迭代利用-探索机制,有效缓解评分不准带来的性能下降问题,为深度模型的高效压缩与部署提供新思路。其兼容结构化与无结构稀疏,提升模型性能的同时大幅降低训练成本,推动稀疏学习在实际硬件中的应用落地,具有重要的理论和工程价值。

技术贡献

创新点在于提出统一的利用-探索框架,结合短期探索与参数重评,优化重要性评分的可靠性。引入“重激活”策略,允许探索空间参数短暂训练,提供潜在性能预览。该方法兼容多种重要性指标,显著提升稀疏模型的性能表现,减少训练成本,突破了现有动态稀疏训练中评分不一致和结构限制的瓶颈。

新颖性

首次提出利用短期“重激活”探索空间参数的迭代机制,统一剪枝与生长的重要性评分,有效缓解评分偏差,适用于结构化与无结构稀疏,显著优于RigL等动态稀疏训练方法,推动稀疏剪枝技术的实际应用。

局限性

  • 该方法依赖于预设的重要性指标,虽然简单如幅值或Taylor评分,但在某些复杂模型或任务中仍可能受限于评分的准确性。
  • 探索空间的短期训练虽提供潜在性能预览,但增加了训练复杂度,尤其在大规模模型上可能带来额外计算负担。
  • 目前主要验证在图像分类任务,迁移到其他任务(如目标检测、语音识别)仍需进一步验证。

未来方向

未来将探索多指标融合的多维重要性评估机制,结合强化学习或元学习优化探索策略,提升模型自适应能力。同时,计划将该框架扩展到多任务、多模态场景,推动稀疏模型在边缘设备和实际部署中的广泛应用。

AI 总览摘要

深度神经网络的高速发展带来了模型规模和计算成本的持续攀升,限制了其在资源受限环境中的应用。剪枝技术作为模型压缩的重要手段,虽已取得显著进展,但依赖于不完美的重要性评分,导致性能受限。本文提出的增强重要性评分的迭代利用-探索(IEE)框架,通过将模型划分为活跃结构和探索空间,结合短期参数重训练,优化参数的重要性评估。该方法在保持结构一致性的基础上,有效缓解评分偏差,兼容无结构与结构化稀疏,显著提升模型性能。实验结果显示,在ImageNet上,ResNet50模型通过90% ERK稀疏率实现Top-1准确率提升1.3%,训练成本降低70%以上,优于RigL和HALP等SOTA方法。MobileNetV1的结构化剪枝也取得了更优的延迟-准确率折衷。无结构稀疏方面,利用幅值和Taylor评分,提升在CIFAR-10和ImageNet上的性能,超越现有动态稀疏训练技术。该研究不仅提供了高效的模型压缩方案,也为未来稀疏学习的研究提供了新思路,推动深度学习模型的实际部署与应用。未来工作将结合多指标、多任务场景,进一步提升模型的自适应能力和泛化性能。

深度分析

研究背景

深度学习模型的不断扩大带来了巨大的计算和存储挑战。剪枝技术通过移除冗余参数,实现模型压缩和加速,已成为研究热点。早期方法如SNIP、GraSP、RigL等,依赖于参数幅值、Hessian信息或梯度信息进行重要性评估,取得一定效果。然而,这些方法普遍存在评分不准、结构限制和训练成本高的问题。结构化剪枝如通道剪枝,能带来硬件加速,但难以兼容复杂模型。动态稀疏训练如RigL试图在训练过程中动态调整稀疏结构,但存在评分不一致、短视策略等瓶颈。近年来,研究者开始关注如何提升重要性评分的可靠性,结合多指标、多阶段优化,推动稀疏模型的实用化。

核心问题

现有剪枝方法多依赖单一指标,难以准确识别重要参数,导致剪枝后性能下降。同时,动态稀疏训练中的评分不一致和短视策略限制了模型的潜力。如何在保证模型性能的同时,降低训练成本,提升稀疏结构的探索效率,成为亟待解决的问题。尤其是在结构化剪枝中,梯度信息难以反映参数重要性,限制了方法的实用性。此外,现有方法多缺乏有效的探索机制,难以充分挖掘潜在的稀疏结构。

核心创新

本文提出的IEE框架创新在于引入利用-探索的迭代机制,结合短期参数重训练,为重要性评分提供性能预览。通过“重激活”探索空间参数,短暂训练后依据统一指标(如Taylor评分)重新评估参数重要性,实现剪枝与生长的闭环优化。这一机制缓解了评分偏差,兼容结构化与无结构稀疏,显著提升模型性能,降低训练成本。该方法还引入硬件感知的稀疏策略,结合Knapsack优化,确保结构满足延迟约束,兼具理论创新与工程实用性。

方法详解

  • �� 将模型参数划分为活跃结构ΘK和探索空间ΘP。• 利用预设重要性指标(幅值或Taylor评分)评估参数。• 在每个迭代周期中,先训练ΘK H步,评估其重要性。• 根据重要性指标,剪除ΘK中最不重要的参数,加入ΘP。• 短期冻结ΘK,训练ΘP Q步,评估其潜在贡献。• 依据统一指标,选择ΘP中最重要的参数,加入ΘK,完成一次利用-探索循环。• 重复上述步骤,逐步优化稀疏结构,直至训练结束。• 结合硬件感知策略,确保稀疏结构满足延迟约束。

实验设计

在ImageNet上,使用ResNet50和MobileNetV1验证方法,比较不同稀疏率下的Top-1准确率、FLOPs和训练成本。采用Taylor评分和幅值作为重要性指标,结合硬件感知的HALP方案,进行结构化剪枝。无结构稀疏在CIFAR-10和ImageNet上验证,超越RigL等动态训练方法。设置不同的更新周期和探索次数,进行消融实验,分析每个组件对性能的贡献。评估指标包括准确率提升、训练成本降低和推理速度提升,验证方法的普适性和优越性。

结果分析

在ImageNet上,ResNet50模型通过IEE实现90% ERK稀疏率,Top-1准确率提升1.3%,训练成本降低70%,优于RigL和HALP。MobileNetV1在结构化剪枝中表现出更优的延迟-准确率折衷,训练成本显著减少。无结构稀疏方面,利用幅值和Taylor评分,模型在CIFAR-10和ImageNet上的性能均优于对比方法。消融实验显示,重激活探索空间参数和统一指标评估是性能提升的关键。整体结果表明,IEE框架在模型压缩和性能提升方面具有广泛应用潜力。

应用场景

该方法适用于需要模型压缩和加速的场景,如边缘设备、移动端和实时推理系统。只需预训练模型或从零开始训练,结合硬件感知策略,可实现高效稀疏模型部署。未来,结合多指标和强化学习,能进一步提升模型的自适应能力,支持多任务、多模态应用,推动深度学习模型的实际落地。

局限与展望

目前方法依赖于单一重要性指标,可能在复杂任务中表现有限。探索空间的短期训练增加了计算负担,尤其在大规模模型中。主要验证在图像分类任务,迁移到其他领域(如目标检测、自然语言处理)仍需验证。未来需优化指标融合策略,降低计算复杂度,并扩展到多任务场景。

通俗解读 非专业人士也能看懂

想象你在整理一个大型仓库,里面堆满了各种商品。每次整理时,你会先把重要的商品放到显眼位置,不重要的商品放到角落。但如果你只看商品的大小(比如越大越重要),可能会错过一些其实很有用的小商品。于是,你决定用一种聪明的方法:先把所有商品都稍微整理一下,看看哪些商品可能还会用到,然后再根据实际情况调整,把重要的商品放在前面,次要的放到后面。这个过程不断重复,仓库变得越来越整齐,存取也更快。这就像论文中的方法,把模型的参数当作商品,通过不断评估和调整,找到最重要的参数,让模型变得更快、更小,但性能依然很强。

简单解释 像给14岁少年讲一样

你知道学校里有很多书,有些书很重要,有些书用得少。老师想把重要的书放在前面,方便大家学习,但如果只看书的厚度(越厚越重要),可能会漏掉一些其实很关键的薄书。于是,老师决定用一种聪明的方法:先把所有书都拿出来,稍微翻阅一下,看看哪些书可能还会用到,然后再根据实际情况,把重要的书放到前面,不重要的放到后面。这个过程会反复几次,书架变得越来越合理,找书也更快。这就像论文里的方法,把模型里的参数当作书,通过不断评估和调整,找到最重要的参数,让模型变得更快、更小,但性能还很棒。

原文摘要

Pruning aims to accelerate and compress models by removing redundant parameters, identified by specifically designed importance scores which are usually imperfect. This removal is irreversible, often leading to subpar performance in pruned models. Dynamic sparse training, while attempting to adjust sparse structures during training for continual reassessment and refinement, has several limitations including criterion inconsistency between pruning and growth, unsuitability for structured sparsity, and short-sighted growth strategies. Our paper introduces an efficient, innovative paradigm to enhance a given importance criterion for either unstructured or structured sparsity. Our method separates the model into an active structure for exploitation and an exploration space for potential updates. During exploitation, we optimize the active structure, whereas in exploration, we reevaluate and reintegrate parameters from the exploration space through a pruning and growing step consistently guided by the same given importance criterion. To prepare for exploration, we briefly "reactivate" all parameters in the exploration space and train them for a few iterations while keeping the active part frozen, offering a preview of the potential performance gains from reintegrating these parameters. We show on various datasets and configurations that existing importance criterion even simple as magnitude can be enhanced with ours to achieve state-of-the-art performance and training cost reductions. Notably, on ImageNet with ResNet50, ours achieves an +1.3 increase in Top-1 accuracy over prior art at 90% ERK sparsity. Compared with the SOTA latency pruning method HALP, we reduced its training cost by over 70% while attaining a faster and more accurate pruned model.

cs.LG cs.CV