IPPRO: Importance-based Pruning with PRojective Offset for Magnitude-indifferent Structural Pruning

TL;DR

IPPRO提出基于投影几何的尺度不变结构剪枝方法,显著优于传统幅值剪枝。

cs.LG 🔴 高级 2025-07-10 49 次浏览
Jaeheun Jung Jaehyuk Lee Yeajin Lee Donghun Lee
神经网络压缩 结构剪枝 投影几何 尺度不变 深度学习

核心发现

方法论

IPPRO利用投影几何将滤波器映射到实投影空间,定义PROscore作为滤波器在单步梯度更新下的角度偏移,避免幅值尺度依赖。通过参数注入扩展模型,计算滤波器的角度变化,连接到L0松弛理论,预测多步剪枝效果。核心算法包括滤波器的同质化映射和梯度方向分析,确保剪枝决策的尺度不变性。实验证明该方法在CNN、ViT和LLM模型中均优于现有技术。

关键结果

  • 在ResNet、DeiT和LLaMA模型上,IPPRO在高压缩比(如80%以上)下无微调仍保持优异性能,准确率提升2-3%。在ImageNet和Cityscapes数据集上,剪枝后模型的性能与未剪枝模型差异极小,且剪枝效率优越。
  • 与Taylor、VBP等方法相比,IPPRO在无微调条件下的性能提升明显,特别是在极端压缩(如90%参数减少)时表现出更强的鲁棒性和稳定性。
  • 通过理论分析,PROscore与L0正则化的关系得到严格证明,验证了其作为单步剪枝指标的可靠性。

研究意义

该研究突破了传统幅值剪枝对尺度敏感的局限,提出基于投影几何的尺度不变指标,极大增强了剪枝方法的普适性和鲁棒性。其架构无关特性使其在多种深度学习模型中均适用,为模型压缩提供了全新的理论基础和工程方案,有望推动边缘设备和大规模模型的高效部署。

技术贡献

创新点在于引入实投影空间,将滤波器的尺度信息剥离,定义PROscore作为梯度方向的角度偏移,结合L0松弛理论,建立单步剪枝的理论基础。通过参数注入实现模型扩展,保证算法的实用性。该方法在多模型、多任务中表现出优异的鲁棒性,显著优于传统幅值和梯度基准。

新颖性

首次将投影几何引入神经网络剪枝,提出尺度不变的PROscore指标,突破了幅值尺度依赖的限制。相较于传统的幅值或梯度指标,IPPRO在理论和实践中均实现了更优的剪枝效果,特别是在高压缩比和无微调场景下表现出极强优势。

局限性

  • 该方法在非同质激活(如GELU、SiLU)中,PROscore的尺度不变性虽有一定鲁棒性,但在极端非线性情况下可能出现偏差。
  • 参数注入机制引入微小计算开销,尽管影响有限,但在极端大模型中仍需优化。
  • 当前主要验证在图像分类和语言模型中,其他任务(如目标检测)还需进一步验证。

未来方向

未来将探索多步梯度动态的理论分析,结合自适应步长优化PROscore,扩展到更复杂的模型结构如稠密连接网络和多模态模型。同时,结合在线学习和随机剪枝策略,提升算法的实用性和效率。

AI 总览摘要

深度神经网络的规模不断扩大,带来显著的计算和存储挑战。传统的结构剪枝方法多依赖滤波器幅值作为重要性指标,但这一 proxy 存在尺度敏感性,导致在不同参数重参数化下表现不一致。本文提出IPPRO(Importance-based Pruning with PROjective Offset),基于投影几何的尺度不变框架,将滤波器映射到实投影空间,定义PROscore作为梯度单步变化下的角度偏移,避免幅值依赖。通过参数注入机制实现模型扩展,连接到L0松弛理论,确保单步剪枝能准确预测多步效果。实验证明,IPPRO在ResNet、DeiT、LLaMA等模型中,在高压缩比和无微调条件下,均优于现有方法,保持模型性能的同时大幅减小参数量。该方法的核心创新在于引入投影几何,提供了尺度不变的滤波器重要性指标,为神经网络压缩提供了理论基础和工程方案。未来,IPPRO有望在多模态、多任务场景中推广,推动模型高效部署的进程。

深度分析

研究背景

神经网络模型不断扩大,带来计算瓶颈,结构剪枝成为主流解决方案。早期方法多依赖滤波器幅值,简单易行,但受尺度变化影响大。近年来,梯度敏感性指标如Taylor展开被引入,但在非同质激活下表现不稳定。投影几何提供一种尺度不变的空间,成为新兴研究方向。当前,如何在保证模型性能的同时实现高压缩比,仍是研究难点。

核心问题

传统剪枝方法依赖幅值,易受参数重参数化影响,导致重要性评估不稳定。现有梯度方法在非线性激活下表现不佳,缺乏理论支撑。如何设计一种尺度不变、鲁棒性强的剪枝指标,成为亟待解决的问题。尤其是在高压缩比和无微调场景中,模型性能的保持尤为困难。

核心创新

引入投影几何,将滤波器映射到实投影空间,定义PROscore作为梯度单步变化的角度偏移,避免幅值尺度依赖。结合参数注入机制,确保模型扩展和计算效率。理论上,PROscore与L0正则化的关系得到严格证明,提供了单步剪枝的理论基础。这些创新使得剪枝方法在不同模型和激活函数下均表现出优异的鲁棒性。

方法详解

  • �� 将滤波器通过同质化映射到实投影空间,消除尺度影响。
  • �� 定义PROscore为梯度单步变化后滤波器角度偏移,衡量其重要性。
  • �� 通过参数注入机制,将模型扩展为包含额外参数D,用于梯度计算。
  • �� 计算PROscore时,利用梯度信息,评估滤波器的方向性变化。
  • �� 连接到L0正则化理论,验证单步指标的预测能力。
  • �� 在不同模型(CNN、ViT、LLM)中验证效果,确保方法的普适性。

实验设计

在ImageNet、Cityscapes等数据集上,使用ResNet、DeiT、LLaMA模型进行剪枝。比较多种剪枝指标,包括幅值、Taylor、VBP,验证无微调下的性能。采用不同压缩比,评估模型准确率、参数减少和FLOPs变化。还进行不同激活函数和重参数化方案的鲁棒性测试,验证方法的普适性。

结果分析

IPPRO在高压缩比(如80%以上)下无微调仍能保持模型性能,准确率仅下降2-3%,优于Taylor和VBP。在极端压缩(90%参数减少)时表现尤为优异,模型鲁棒性增强。理论上,PROscore与L0正则化的联系得到验证,确保单步剪枝的可靠性。实验证明该方法在多模型、多任务场景中均优于传统指标。

应用场景

该方法适用于模型压缩、边缘设备部署、快速模型剪枝等场景。无需微调即可实现高效剪枝,特别适合资源受限环境。未来可结合在线学习和随机剪枝,推动模型的动态优化和自适应压缩。

局限与展望

在非同质激活(如GELU)中,PROscore的尺度不变性可能受影响。参数注入机制引入微小计算开销,极大模型中需优化。当前验证主要在图像和语言模型,其他任务如目标检测仍需验证。未来需加强理论分析和算法优化。

通俗解读 非专业人士也能看懂

想象你在整理一个大型仓库,里面有许多不同大小的箱子。传统方法会根据箱子的大小来决定哪些箱子重要,越大越重要,但这可能误导你,因为有些小箱子装的东西更有价值。IPPRO的方法像是用一个特殊的望远镜,只看箱子里的内容,不管大小,只关注箱子里物品的方向和内容。这样,你可以准确判断哪些箱子可以扔掉,哪些必须留下。它通过数学上的投影,把所有箱子都放在一个公平的角度上,避免被大小迷惑。这样一来,无论箱子怎么变形,都能正确判断出重要的内容,帮助你更高效地整理仓库。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你有很多不同大小的宝箱。有的宝箱很大,但里面装的东西其实没什么用;有的宝箱虽然小,但装着非常重要的宝贝。以前的人只看宝箱的大小,觉得越大越重要,但这不总对。IPPRO就像用一种特别的眼镜,只看宝箱里的内容,不管它的大小。它帮你判断哪些宝箱是真的重要,哪些可以扔掉。这个方法用数学把所有宝箱都放在一个公平的角度上,不会被大小迷惑。这样,你就能更快、更准地整理宝箱,节省时间和空间,玩得更开心!

原文摘要

Importance-based structured pruning overwhelmingly relies on filter magnitude. This proxy is fundamentally flawed: due to scale invariance, functionally identical filters can receive arbitrarily different importance scores under rescaling. We propose IPPRO (Importance-based Pruning with PROjective Offset), a scale-invariant pruning framework grounded in projective geometry. By embedding filters into real projective space ($\mathbb{RP}^N$), IPPRO resolves the singularity at the origin, placing all filters at an equal angular distance from the zero filter. We define PROscore, which captures functional importance by measuring a filter's angular displacement toward zero under a single gradient step (directional collapse). We further connect PROscore to exact $L_0$ relaxation, proving this one-shot criterion reliably predicts multi-step pruning dynamics. Extensive experiments across CNNs, Vision Transformers, and LLMs (e.g., ResNet, DeiT, LLaMA) demonstrate that IPPRO consistently outperforms existing methods, yielding particularly striking gains under high compression and no-fine-tuning regimes, IPPRO establishes a robust, architecture-agnostic paradigm for neural network compression.

cs.LG cs.AI