Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

TL;DR

BACON方法在最激进预算下提高多模态KV缓存压缩7.5%,最高达30.9%。

cs.CV 🔴 高级 2026-06-10 7 次浏览
Tianhao Chen Yuheng Wu Kelu Yao Xiaogang Xu Xiaobin Hu Dongman Lee
多模态 KV缓存 压缩 注意力机制 机器学习

核心发现

方法论

BACON方法通过最后查询注意力校准观察窗口注意力,抑制噪声,恢复关键视觉证据。它结合层内一致性和层间持久性,提供了一种即插即用的KV缓存压缩机制。

关键结果

  • 在Qwen2-VL-7B模型上,BACON在预算64下将DocVQA性能提高了18.7个百分点。
  • 在PyramidKV上,BACON在Qwen3-VL-30B-A3B模型上预算64时提高了12.8个百分点。
  • BACON在不同模型和压缩方法中表现出一致的改进,尤其是在激进预算下。

研究意义

BACON方法显著提高了多模态大语言模型的推理效率,减少了KV缓存的内存和延迟成本,解决了在长视觉上下文中推理效率低下的问题。

技术贡献

BACON通过边界注意力校准,提供了一种新的KV缓存压缩方法,区别于现有的基于观察窗口的压缩方法,增强了视觉证据的保留。

新颖性

BACON首次将最后查询注意力用于KV缓存压缩,校准观察窗口注意力,提供了一种新的证据恢复机制。

局限性

  • 在某些情况下,最后查询注意力可能引入噪声,影响压缩效果。
  • BACON方法在极端情况下可能无法完全消除噪声。

未来方向

未来工作可以探索BACON在更多多模态任务中的应用,以及如何进一步优化其噪声抑制能力。

AI 总览摘要

多模态大语言模型在视觉-语言推理中表现出色,但长视觉上下文导致KV缓存过大,解码延迟高。现有压缩方法依赖于观察窗口注意力来稳定地估计令牌重要性,但这种聚合可能会稀释稀疏的关键证据,并在激进压缩下丢弃与答案相关的令牌。BACON方法通过最后查询注意力校准观察窗口注意力,抑制噪声,恢复关键视觉证据。实验结果表明,BACON在不同基准、模型、预算和压缩方法中平均提高了7.5%的多模态KV缓存压缩性能,在最激进的预算下,提升幅度最高可达30.9%。这种改进显著降低了多模态大语言模型的内存和延迟成本,提升了推理效率。BACON方法的成功为未来多模态推理任务的高效推理提供了新的思路和方向。

深度分析

研究背景

多模态大语言模型通过视觉编码器和投影模块扩展了大语言模型的推理和生成能力。然而,随着视觉输入变得更长、更密集,推理效率面临挑战。视觉令牌显著增加了预填充长度,KV缓存必须在层和注意力头之间保留其表示以供后续解码使用。因此,KV缓存压缩成为降低多模态大语言模型推理内存和延迟成本的重要方向。

核心问题

现有的KV缓存压缩方法通常根据估计的重要性保留缓存的令牌。常见策略是从观察窗口中估计重要性,即通过平均这些查询接收到的注意力来实现。然而,这种平均化可能会稀释稀疏的视觉证据,并在激进压缩下偏离答案关键的视觉令牌。

核心创新

BACON方法通过最后查询注意力校准观察窗口注意力,恢复被稀释的视觉证据。• 使用层内一致性和层间持久性来过滤最后查询信号中的噪声。• 结合观察窗口注意力作为稳定的保留基础,增强视觉证据的保留。

方法详解

  • �� BACON保持观察窗口注意力作为现有保留分数的稳定基础。• 使用最后查询注意力校准观察窗口注意力,恢复边界证据。• 通过层内一致性和层间持久性过滤最后查询信号中的噪声。• 在不同模型和压缩方法中验证BACON的有效性。

实验设计

实验在多模态理解、视频推理、GUI定位和长上下文文本任务中进行,使用不同规模和架构的多模态大语言模型,以及多种KV压缩方法和不同缓存预算。

结果分析

BACON在不同基准、模型、预算和压缩方法中平均提高了7.5%的多模态KV缓存压缩性能。在最激进的预算下,提升幅度最高可达30.9%。

应用场景

BACON方法可用于多模态大语言模型的高效推理,降低内存和延迟成本,提升推理效率。

局限与展望

BACON方法在某些情况下可能引入噪声,影响压缩效果。未来工作可以探索如何进一步优化其噪声抑制能力。

通俗解读 非专业人士也能看懂

想象一个图书馆,里面有很多书(视觉令牌),每本书都有不同的重要性。为了节省空间,我们需要选择保留哪些书。现有的方法通过观察窗口(最后一批查询)来决定哪些书更重要,但这可能会错过一些关键的书。BACON方法就像一个聪明的图书管理员,它不仅看观察窗口,还会查看最后一个查询,确保不遗漏任何重要的书。同时,它会过滤掉不相关的书,确保选择的书都是最有价值的。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要在有限的背包空间里选择哪些物品最重要。现有的方法就像只看最后一关的提示来决定哪些物品重要,但这可能会错过一些关键物品。BACON就像一个聪明的玩家,它不仅看最后一关的提示,还会查看最后一个提示,确保不遗漏任何重要物品。同时,它会过滤掉不相关的物品,确保选择的物品都是最有价值的。

术语表

多模态大语言模型 (MLLM)

结合视觉和语言信息进行推理的模型。

用于处理视觉-语言任务。

KV缓存

存储键值对的缓存,用于加速推理。

在多模态推理中用于存储视觉令牌。

观察窗口注意力

基于最后一批查询的注意力估计。

用于估计令牌的重要性。

最后查询注意力

基于最后一个查询的注意力估计。

用于校准观察窗口注意力。

层内一致性

在同一层中相邻令牌的注意力一致性。

用于过滤噪声。

开放问题 这项研究留下的未解疑问

  • 1 如何在不引入噪声的情况下进一步优化BACON的压缩效果?
  • 2 在更复杂的多模态任务中,BACON的表现如何?

应用场景

近期应用

多模态推理

BACON可以用于提高多模态大语言模型的推理效率,降低内存和延迟成本。

远期愿景

智能信息检索

通过改进多模态推理,BACON可以用于更智能的信息检索系统。

原文摘要

Multimodal Large Language Models (MLLMs) achieve strong vision-language reasoning but incur large KV caches and high decoding latency with long visual contexts. Existing compression methods rely on observation window attention for stable token importance estimation, yet this aggregation can dilute sparse critical evidence and discard answer-relevant tokens under aggressive compression. We identify last query attention as a complementary signal for recovering such evidence, though its irrelevant signals may introduce additional noise. We propose BACON, a plug-and-play method that calibrates observation window attention with last query evidence while suppressing noise through intra-layer coherence and inter-layer persistence. Across diverse benchmarks, models, budgets, and compression methods, BACON improves multimodal KV-cache compression by 7.5% on average under the most aggressive budget, with gains up to 30.9%.

cs.CV cs.CL