PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

TL;DR

PACE通过像素自适应压缩和双注意力提取,在保留93.8%性能的同时将视觉令牌减少90%,实现3.1倍推理加速。

cs.CV 🔴 高级 2026-08-27 28 次浏览
Junjie Liu Shengyuan Ye Xu Chen
视觉语言模型 推理优化 视觉令牌剪枝 高效计算 深度学习

核心发现

方法论

PACE提出了一个无训练的推理框架,包括两个阶段:压缩阶段通过自适应像素压缩器(APC)动态下采样冗余输入,提取阶段通过动态双注意力提取器(DDAE)融合视觉和语义信号,保留关键视觉令牌。

关键结果

  • 在Qwen2.5-VL-7B模型上,PACE在仅保留10%视觉令牌的情况下,仍能保留93.8%的原始性能,同时实现3.1倍TTFT加速。
  • 在OCRBench上,PACE在10%令牌预算下的准确率达到70.90%,相比最佳基线方法高出17.90个百分点。
  • 在DocVQA任务中,PACE在5%的令牌预算下仍能达到48.94%的ANLS分数,显著优于其他方法。

研究意义

PACE解决了视觉语言模型推理中视觉编码阶段和语言模型预填阶段的双重瓶颈问题。通过在编码前后分别进行像素压缩和令牌提取,PACE显著降低了计算成本,同时保留了全局上下文和细粒度细节。这为高分辨率推理任务提供了高效的解决方案,特别是在实时应用场景中具有重要意义。

技术贡献

PACE的主要技术贡献包括:1) 提出了自适应像素压缩器(APC),在视觉编码前动态调整输入分辨率;2) 引入动态双注意力提取器(DDAE),结合视觉和语义信号以保留关键细节;3) 提供了一个无训练、即插即用的框架,兼容现有视觉令牌剪枝方法。

新颖性

PACE首次在视觉语言推理中结合了预编码压缩和后编码提取的统一框架。其动态双注意力机制在保留细粒度细节和全局上下文方面优于现有方法。

局限性

  • 在极低令牌预算下(如5%),细节丢失仍可能导致性能下降,尤其是在需要精确布局信息的任务中。
  • APC的像素压缩可能对某些复杂背景场景的全局上下文造成一定影响。
  • 当前框架未优化自回归解码阶段,整体推理时间仍受限于语言模型的生成速度。

未来方向

未来工作可以探索将PACE与自回归解码优化结合,进一步提升端到端推理效率。同时,可研究更复杂的多模态任务场景下的适用性,例如视频推理或三维视觉任务。

AI 总览摘要

视觉语言模型(VLMs)在多模态推理任务中表现出色,但高分辨率输入导致的视觉令牌数量激增显著增加了推理成本。现有的视觉令牌剪枝方法通常仅在视觉编码后进行优化,忽略了编码阶段的高计算开销。此外,这些方法在严格的令牌预算下难以同时保留全局上下文和细粒度细节,导致性能下降。

为解决这些问题,本文提出了PACE(像素自适应压缩与提取),一个无训练的推理框架。PACE包括两个阶段:在压缩阶段,通过自适应像素压缩器(APC)动态评估视觉信息密度并下采样冗余输入;在提取阶段,通过动态双注意力提取器(DDAE)结合视觉编码器的自注意力和语言模型的语义信号,选择性保留关键视觉令牌。实验表明,PACE在Qwen2.5-VL-7B模型上仅保留10%视觉令牌的情况下,仍能保留93.8%的原始性能,并实现3.1倍推理加速。

PACE不仅显著降低了推理成本,还在细节敏感任务(如OCRBench和DocVQA)中表现出色。然而,极低预算下的细节丢失和未优化的自回归解码仍是未来需要解决的问题。PACE为高效多模态推理提供了新的思路,并为进一步研究奠定了基础。

深度分析

研究背景

视觉语言模型近年来取得了显著进展,能够将视觉感知与语言推理无缝结合。然而,随着输入分辨率的提高,视觉令牌数量迅速增加,导致推理成本飙升。现有方法如FastV和VisionZip主要通过剪枝视觉令牌来减少计算,但这些方法通常忽略了视觉编码阶段的高计算开销。

核心问题

高分辨率推理的核心问题在于视觉编码器和语言模型预填阶段的双重瓶颈。视觉编码阶段处理大量冗余像素,而语言模型阶段需要处理冗长的视觉令牌序列,导致推理效率低下。

核心创新

PACE的核心创新包括:1) 自适应像素压缩器(APC),通过轻量级特征预览动态调整输入分辨率;2) 动态双注意力提取器(DDAE),结合视觉和语义信号以保留关键细节;3) 无需训练的即插即用框架,兼容现有剪枝方法。

方法详解

  • �� 压缩阶段:APC通过轻量级特征预览计算全局信息密度和局部细节对比,动态调整输入分辨率。
  • �� 提取阶段:DDAE融合视觉编码器的自注意力和语言模型的语义注意力,动态分配权重以选择关键令牌。
  • �� 集成:PACE可无缝嵌入现有视觉语言模型,如Qwen2.5-VL。

实验设计

实验在Qwen2.5-VL-7B模型上进行,使用九个数据集(如TextVQA和DocVQA)评估。基线方法包括FastV、SparseVLM等。实验设置包括固定分辨率和动态分辨率两种场景。

结果分析

PACE在10%令牌预算下保留了93.8%的性能,TTFT加速3.1倍。在OCRBench上,PACE的准确率达到70.90%,相比最佳基线方法高出17.90个百分点。

应用场景

PACE适用于需要高效推理的场景,如实时图像问答、文档分析和多模态搜索。其无训练特性使其易于集成到现有系统中。

局限与展望

PACE在极低令牌预算下可能丢失部分细节,影响任务性能。此外,当前框架未优化自回归解码阶段,整体推理时间仍受限。

通俗解读 非专业人士也能看懂

可以将PACE想象成一个高效的图书馆管理系统。图书馆有大量书籍(像素和视觉令牌),但只有一部分对当前任务有用。首先,图书管理员(APC)快速浏览书架,挑选出可能相关的书籍并重新排列(压缩阶段)。接着,另一位管理员(DDAE)根据读者的需求,结合书籍内容和读者问题,筛选出最重要的书籍(提取阶段)。最终,读者只需阅读这些精选书籍即可快速获得答案。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,地图上有很多地方可以探索,但你只有很少的时间。PACE就像一个聪明的助手,先帮你把地图缩小,只保留重要的地方(压缩阶段)。然后,它再根据你的任务,比如找宝藏,挑出最有用的线索(提取阶段)。这样,你可以又快又准地找到目标,而不用浪费时间在无关的地方!

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行推理的深度学习模型。

PACE用于优化这些模型的推理效率。

自适应像素压缩器 (Adaptive Pixel Compressor)

动态调整输入分辨率的模块。

在PACE的压缩阶段中使用。

动态双注意力提取器 (Dynamic Dual-Attention Extractor)

结合视觉和语义信号选择关键令牌的模块。

在PACE的提取阶段中使用。

令牌预算 (Token Budget)

限制视觉令牌数量的约束条件。

用于评估PACE在不同预算下的性能。

TTFT (Time to First Token)

从输入到生成第一个输出令牌的时间。

PACE显著减少了TTFT时间。

开放问题 这项研究留下的未解疑问

  • 1 如何在极低令牌预算下进一步减少细节丢失?
  • 2 如何将PACE扩展到视频或三维数据的推理任务?
  • 3 如何优化自回归解码阶段以进一步提升整体效率?

应用场景

近期应用

实时图像问答

通过减少推理时间,提升实时图像问答系统的响应速度,适用于搜索引擎和智能客服。

文档分析

高效处理文档中的视觉和文本信息,用于法律、财务等领域的自动化文档分析。

远期愿景

通用多模态推理

PACE可作为通用框架,支持未来更复杂的多模态任务,如视频分析和增强现实。

原文摘要

Vision-Language Models (VLMs) demonstrate exceptional visual reasoning capabilities, yet their inference costs escalate rapidly with the proliferation of visual tokens. Existing visual token pruning methods exhibit two fundamental limitations. First, most approaches operate exclusively post-vision encoder, leaving the substantial latency of the visual encoding phase unoptimized. Second, under strict token budgets, these methods often fail to jointly preserve holistic visual contexts and fine-grained details, leading to performance degradation. To address these bottlenecks, we propose PACE (Pixel-Adaptive Condense and Extract), a training-free inference framework that accelerates both the vision encoder and the Large Language Model (LLM) via a unified Condense-and-Extract paradigm. During the Condense stage, an Adaptive Pixel Compressor (APC) evaluates visual information density prior to encoding, adaptively downsampling redundant inputs, curtailing encoder computation while preserving global context and essential visual cues. In the Extract stage, a Dynamic Dual-Attention Extractor (DDAE) selectively retains visual tokens via a fusion of internal visual signals from the encoder and semantic signals from the LLM, safeguarding task-critical details. By integrating PACE into Qwen2.5-VL-7B, the model retains 93.8% of its original performance while utilizing only 10% of the visual tokens, yielding a 3.1x speedup in time to first token (TTFT). Our code is available at https://github.com/jjL357/PACE.

cs.CV cs.AI