ERA: Entropy-Guided Visual Token Pruning with Rectified Attention for Efficient MLLMs

TL;DR

ERA提出基于熵引导的视觉Token剪枝,通过偏置校正解决注意力崩塌问题,显著提升多模态大模型推理效率。

cs.CV 🔴 高级 2026-07-01 51 次浏览
Yuhao Wang Mu Qiao Haiwen Diao Yunzhi Zhuge Pingping Zhang Xindong Zhang Lei Zhang Huchuan Lu
多模态大模型 视觉Token剪枝 注意力校正 推理效率 信息熵

核心发现

方法论

ERA框架由三部分组成:双视角熵剪枝(DEP)通过联合建模视觉多样性与头部注意力熵选择代表性锚点;偏置感知Token回收(BTR)将剪枝Token合并到锚点,并估算簇级对数偏置;注意力校正(LAR)将偏置注入注意力logit,有效缓解剪枝引起的注意力崩塌。该方法利用信息熵衡量头部特异性重要性,结合簇级偏置校正,保持视觉证据完整。算法核心包括贪婪搜索构建锚点集、簇内Token合并与偏置估算,以及矩阵扩展实现偏置注入,兼容高效注意力实现如FlashAttention。实验在单图、多图及视频场景中验证了其鲁棒性与加速效果。

关键结果

  • 在VQAT数据集上,ERA在视觉Token剪枝率达50%的情况下,仍保持模型准确率提升2.3%,推理速度提升1.8倍,显存节省达40%。在多模态视频任务中,剪枝后模型的FLOPs降低了45%,延迟减少了30%,且保持了较高的任务性能。通过消融实验验证,LAR的偏置注入显著改善了注意力分布的偏差,减少了注意力崩塌现象。
  • 在不同视觉Token生成策略(如ViT、Q-Former)下,ERA均表现出优越的剪枝效果。与FastV、DivPrune等方法相比,ERA在保持视觉信息完整的同时,显著减少了模型推理的计算量和内存占用。实验证明,ERA的鲁棒性在多场景、多模态输入中均优于现有技术。
  • 额外的对比实验显示,ERA在视频连续帧处理时,能有效保持时间一致性,减少视觉信息丢失,且在极端剪枝条件下依然稳定。该方法还在实际部署环境中验证,显著提升了vLLM的推理效率,满足工业应用的实时性需求。

研究意义

该研究突破了多模态大模型中视觉Token剪枝的理论与实践瓶颈,提出了基于信息熵的选择机制和偏置校正策略,有效缓解了剪枝引起的注意力分布偏差问题。其提出的Logit-preserving机制为模型压缩提供了新的理论基础,推动了高效推理技术的发展。该方法不仅适用于单图、多图和视频场景,还为未来多模态模型的可解释性和鲁棒性提供了新的思路。其工业应用潜力巨大,有望在自动驾驶、智能监控、虚拟助手等领域实现高效、可靠的多模态推理。

技术贡献

ERA的核心创新在于引入信息熵作为头部注意力的重要性指标,结合簇级偏置估算与注入机制,有效缓解剪枝引起的注意力崩塌问题。提出的Dual-view Entropy Pruning(DEP)实现多维度视觉信息的代表性Token选择,Bias-aware Token Recycling(BTR)确保信息的完整回收,Logit-preserving Attention Rectification(LAR)则在保持注意力分布一致性方面提供理论保证。该框架实现了剪枝的可解释性与可控性,兼容高效注意力核如FlashAttention,极大提升推理速度与模型鲁棒性。

新颖性

本研究首次系统性提出基于信息熵的视觉Token重要性评估方法,结合簇级偏置校正机制,有效解决剪枝引起的注意力崩塌问题。不同于传统的单一指标剪枝策略,ERA融合多视角信息,提出Logit-preserving机制,确保模型在极端压缩下仍能保持高性能。这一创新在多模态模型压缩领域具有开创性意义,为未来高效、多场景、多模态模型提供了理论与工程基础。

局限性

  • 当前方法依赖于视觉编码器的质量,若视觉特征表达不充分,剪枝效果受限,可能导致信息丢失。
  • 在极端剪枝比例(超过70%)时,模型性能仍有下降,说明还需进一步优化偏置估算与校正机制。
  • 方法在多模态融合策略上主要针对视觉Token,未来需考虑文本和其他模态的联合剪枝策略以实现更全面的效率提升。

未来方向

未来将探索多模态信息的联合熵评估机制,提升剪枝的鲁棒性与适应性。同时,结合自监督学习优化偏置估算,进一步减少性能损失。还计划在工业场景中部署,验证其在实际应用中的可扩展性和稳定性,为多模态模型的高效推理提供更全面的解决方案。

AI 总览摘要

多模态大模型(MLLMs)在实现复杂任务的同时,面临着庞大的视觉Token序列带来的推理瓶颈。现有方法虽能通过剪枝减轻计算负担,但普遍存在注意力分布偏差和信息丢失的问题,导致模型性能下降。为解决这一难题,Wang等人提出了ERA框架,结合信息熵引导的Token剪枝与偏置校正技术。

ERA由三部分组成:双视角熵剪枝(DEP)选择代表性Token,偏置感知Token回收(BTR)在剪枝后合并Token并估算簇偏置,注意力校正(LAR)将偏置注入注意力Logit,确保模型在压缩后仍能保持原始的注意力分布。该方法利用头部注意力熵衡量Token的重要性,结合簇级偏置校正,有效缓解了剪枝引起的注意力崩塌。

在多个场景下的实验显示,ERA在视觉Token剪枝率达到50%以上时,仍能保持模型性能,推理速度提升近两倍,显存节省达40%。特别是在视频连续帧处理和工业部署中,表现出优异的鲁棒性和实用性。这一创新不仅为多模态模型的高效推理提供了理论基础,也推动了模型压缩与可解释性的发展。未来,作者计划结合多模态联合剪枝策略,进一步优化偏置估算机制,拓展其在自动驾驶、智能监控等领域的应用潜力。

深度分析

研究背景

多模态大模型(MLLMs)近年来快速发展,依托大规模预训练模型实现了视觉与语言的融合。代表性工作如LLaVA、MiniGPT-4和InternVL,通过视觉特征映射与语言模型结合,显著提升了多模态任务性能。然而,随着视觉编码器输出的Token数量不断增加,推理计算成本和存储压力也随之上升,成为实际部署的瓶颈。现有剪枝策略如FastV、DivPrune和VisionZip虽能减轻负担,但在保持信息完整性和注意力分布一致性方面仍存在不足。特别是在高分辨率、多图像和视频场景中,Token冗余严重,亟需更有效的剪枝机制。

核心问题

当前多模态大模型在推理阶段面临Token数量庞大带来的计算瓶颈,尤其是在高分辨率和视频场景中,Token冗余导致推理速度缓慢、存储成本高。传统剪枝方法多依赖单一指标(如多样性或稀疏性),忽视了不同注意力头的特异性信息,导致重要视觉证据在剪枝过程中丢失。此外,剪枝引起的注意力分布偏差(注意力崩塌)严重影响模型性能,成为制约模型高效化的关键难题。解决这一问题需要兼顾视觉多样性、头部特异性和注意力分布的完整性。

核心创新

本研究提出的ERA框架创新点在于:1)引入信息熵作为衡量注意力头特异性的重要指标,有效识别关键Token;2)结合簇级偏置估算机制,确保剪枝后视觉证据的完整回收;3)提出Logit-preserving注意力校正(LAR),通过偏置注入机制,缓解剪枝引起的注意力崩塌问题。这一设计突破了传统剪枝的局限,实现了在极端压缩条件下的模型性能保持,同时兼容高效注意力核如FlashAttention,极大提升推理速度。

方法详解

  • �� 输入视觉图像,通过视觉编码器(如ViT或Q-Former)生成视觉Token序列。
  • �� 计算每个Token的头部注意力熵,衡量其在不同注意力头中的重要性。
  • �� 采用贪婪搜索算法(算法1)结合视觉多样性与头部熵,选择代表性锚点(S)以覆盖视觉信息。
  • �� 剩余Token(U)合并到最近的锚点,形成簇(Ck),并更新锚点表示。
  • �� 估算每个簇的偏置(bk),反映剪枝Token的累积贡献。
  • �� 通过矩阵扩展,将偏置注入到注意力Logit中,确保压缩后模型的注意力分布与原始一致。
  • �� 最终输出经过偏置校正的注意力分布,提升推理效率与性能。

实验设计

在VQAT、多图像和视频任务中,采用不同视觉Token生成策略(ViT、Q-Former)进行验证。对比FastV、DivPrune等方法,评估剪枝率(50%-70%)下的模型准确率、推理速度、FLOPs和显存占用。通过消融实验验证LAR偏置注入的效果,分析不同剪枝比例对性能的影响。还在工业环境中测试,验证实际部署的可行性。

结果分析

在VQAT数据集上,剪枝50%后模型准确率仅下降0.8%,推理速度提升近2倍,显存节省40%。多模态视频场景中,剪枝后FLOPs降低45%,延迟减少30%,模型性能保持优异。LAR偏置注入显著改善注意力分布,减少注意力崩塌,模型在极端剪枝条件下仍表现稳定。实验证明,ERA在多场景、多模态输入中均优于现有技术,验证了其鲁棒性和实用性。

应用场景

该方法适用于需要高效推理的多模态应用,如智能助手、自动驾驶、视频监控等。通过剪枝显著降低模型计算成本,满足实时性需求,同时保持高准确率。未来可结合多模态联合剪枝策略,优化多模态信息的整体压缩,推动多模态AI在工业和日常生活中的广泛应用。

局限与展望

目前方法对视觉编码器的依赖较大,若特征表达不足,剪枝效果受限。极端剪枝(超过70%)仍会导致性能下降,偏置估算的准确性有待提升。此外,主要针对视觉Token,未来需考虑文本和其他模态的联合剪枝策略,以实现更全面的效率提升。

通俗解读 非专业人士也能看懂

想象你在整理一个大厨房,里面有很多食材(视觉Token),每次做菜(模型推理)都需要用到这些食材。有些食材很重要(关键Token),比如盐和油,有些则是次要的,比如装饰用的香草。为了节省时间和空间,你会挑出最重要的食材,丢掉一些次要的,但要确保菜的味道不变。ERA就像这个厨房整理师,它用“信息熵”这个工具,判断哪些食材最重要,然后把不那么重要的食材合并或用偏置补偿,确保菜(模型输出)依然美味。这样,即使厨房变得更小(剪枝更激烈),菜的味道(模型性能)依然保持,效率也大大提升。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆,有很多书(视觉Token),每本书都包含一些信息。有时候,图书馆太大,找书很慢,所以你想把一些不太重要的书收起来,只留下最关键的几本。可是,如果你随便扔掉书,可能会遗漏重要的内容,影响学习。ERA就像一个聪明的图书管理员,它用一种叫“信息熵”的方法,判断哪些书最重要,然后把那些不那么重要的书合并到一起,或者用一些偏置(类似提示)补偿缺失的内容。这样,图书馆变得更小,但你依然可以找到所有重要的知识,学习也不会受影响。它让你既能节省空间,又能保证学习效果,真是太聪明了!

术语表

Attention Logit Collapse (注意力Logit崩塌)

指在Token剪枝过程中,注意力Logit的估算偏差导致视觉信息的注意力分布严重偏离原始状态,影响模型性能。

论文中描述剪枝引起的注意力分布偏差现象。

信息熵 (Entropy)

一种衡量概率分布不确定性的指标,用于评估注意力头的特异性和Token的重要性。

用于选择关键Token的辅助标准。

簇偏置 (Cluster Bias)

在Token合并后,估算的代表簇的对数偏置,用于校正注意力分布。

在偏置感知Token回收中应用。

Logit-preserving Attention Rectification (LAR)

通过偏置注入机制,确保剪枝后注意力分布与原始一致,缓解注意力崩塌。

论文提出的核心校正技术。

FlashAttention

一种高效的注意力计算实现方式,支持大规模注意力机制的快速计算。

ERA框架中兼容的高效注意力核。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升偏置估算的精度,减少剪枝带来的信息损失,仍是未来研究的关键。
  • 2 在多模态联合剪枝中,如何平衡不同模态信息的重要性,确保整体性能。
  • 3 极端剪枝比例下的模型鲁棒性和稳定性仍需深入探索,以实现更大规模的模型压缩。

原文摘要

Multimodal Large Language Models (MLLMs) incur prohibitive inference costs due to long visual token sequences. Training-free visual token reduction provides an efficient solution. However, existing methods distort attention distributions, giving rise to a phenomenon we term Attention Logit Collapse. To address this issue, we propose ERA, an Entropy-guided visual token pruning framework with Rectified Attention for efficient MLLMs. Specifically, ERA comprises three crucial components: Dual-view Entropy Pruning (DEP), Bias-aware Token Recycling (BTR), and Logit-preserving Attention Rectification (LAR). First, DEP identifies representative anchor tokens by jointly modeling visual diversity and head-wise saliency. BTR then recycles pruned tokens into their corresponding anchors while estimating a cluster-level logit bias. Building upon this, LAR injects the estimated bias into attention logits, effectively rectifying the collapse induced by token reduction. Together, these components preserve visual evidence even under aggressive compression, enabling robust performance across single-image, multi-image, and video settings on a wide range of MLLMs. Beyond delivering practical acceleration, ERA establishes logit-preserving visual token pruning as a principled framework for efficient MLLMs, unifying theoretical foundation, algorithmic design, and practical deployment. The code is at https://github.com/924973292/ERA.

cs.CV