CONDUIT: A Unified Residual-Stream Restoration Framework for KV Cache Reuse in Vision-Language Models
CONDUIT框架在10%刷新预算下,达到97.0-99.5%的性能。
核心发现
方法论
CONDUIT框架通过残差流恢复实现KV缓存重用。利用缓存键查询注意力和缓存值范数代理进行排序,结合图像级别的相关性放大,在推理时进行全局选择。该方法无需训练,保持模型架构不变,仅在推理时增加查询条件的评分过程。
关键结果
- 在10%刷新预算下,CONDUIT在五个数据集上达到97.0-99.5%的性能,与完整预填充相比,平均提高约1.7分。
- 在MMLongBench-Doc延迟子集上,使用13.5%的完整预填充FLOPs,首次令牌时间加速2.99倍。
- 在单图像和多图像设置中,CONDUIT在保持大部分完整预填充质量的同时,显著减少了预填充计算。
研究意义
CONDUIT框架在视觉语言模型中实现了KV缓存的高效重用,显著降低了计算成本。该方法在不改变模型架构的情况下,通过训练外的刷新策略提高了模型的响应速度和计算效率,解决了视觉前缀变化导致的缓存失效问题。
技术贡献
CONDUIT通过结合缓存键查询注意力和缓存值范数代理,实现了视觉KV缓存的残差流恢复。该方法在不改变模型架构和权重的情况下,提供了一种无训练的刷新策略,显著提高了缓存重用效率。
新颖性
CONDUIT首次将视觉KV缓存重用问题视为残差流恢复问题,提出了基于范数加权注意力的刷新策略,区别于传统的注意力选择方法。
局限性
- 在某些高复杂度场景中,可能需要更高的刷新预算以维持性能。
- 对多图像提示的处理可能在某些情况下不够精细。
未来方向
未来工作可以探索在不同视觉语言模型架构上的适用性,以及在更大规模数据集上的性能表现。
AI 总览摘要
视觉语言模型(VLMs)在处理重复视觉内容时,通常需要重新编码昂贵的视觉前缀。现有方法在前缀变化时无法有效重用缓存,导致计算资源浪费。
CONDUIT框架通过残差流恢复实现KV缓存重用,利用范数加权注意力进行排序,并在推理时进行全局选择。该方法无需训练,保持模型架构不变,仅在推理时增加查询条件的评分过程。
在实验中,CONDUIT在10%刷新预算下,达到了97.0-99.5%的性能,显著减少了计算成本,并在多图像提示下实现了更高的缓存重用效率。
深度分析
研究背景
视觉语言模型在自然图像、文档页面和用户界面中回答问题。随着视觉内容的重复出现,重新编码视觉前缀的成本变得昂贵。现有方法在前缀变化时无法有效重用缓存,导致计算资源浪费。
核心问题
视觉前缀变化导致缓存失效的问题。现有方法在前缀变化时无法有效重用缓存,导致计算资源浪费。
核心创新
CONDUIT框架通过残差流恢复实现KV缓存重用,利用范数加权注意力进行排序,并在推理时进行全局选择。
方法详解
- �� 利用缓存键查询注意力和缓存值范数代理进行排序。
- �� 结合图像级别的相关性放大。
- �� 在推理时进行全局选择,保持模型架构不变。
实验设计
在五个数据集上进行实验,包括LongDocURL、MMLongBench-Doc、SlideVQA、InfoSeek和ViQuAE。使用三种VLM骨干网络进行测试。
结果分析
在10%刷新预算下,CONDUIT在五个数据集上达到97.0-99.5%的性能。在MMLongBench-Doc延迟子集上,使用13.5%的完整预填充FLOPs,首次令牌时间加速2.99倍。
应用场景
适用于需要高效处理重复视觉内容的场景,如文档检索和多图像推理。
局限与展望
在某些高复杂度场景中,可能需要更高的刷新预算以维持性能。对多图像提示的处理可能在某些情况下不够精细。
通俗解读 非专业人士也能看懂
想象你在一个图书馆里,图书馆员有一个笔记本,记录了每本书的关键字。当有人来问问题时,图书馆员可以快速查找笔记本,而不是重新翻阅每本书。这就像CONDUIT框架,它通过缓存关键字来加速查询过程。即使问题的开头发生了变化,只要关键字没有变,图书馆员就能快速找到答案。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,游戏里有很多关卡,每个关卡都有不同的挑战。你可以保存游戏进度,这样即使你换了一个新关卡,你也可以快速加载之前的进度,而不用从头开始。这就像CONDUIT框架,它帮助模型在处理新问题时快速重用之前的计算结果,节省时间和资源!
术语表
视觉语言模型 (Vision-Language Model)
结合视觉和语言信息进行任务的模型,通常用于图像描述或问答。
用于处理自然图像和文本的联合任务。
KV缓存 (KV Cache)
存储键值对以加速后续查询的缓存机制。
在视觉语言模型中用于存储视觉前缀信息。
残差流 (Residual Stream)
模型中用于传递信息的共享通道,注意力层从中读取和写入信息。
用于解释CONDUIT中的缓存重用机制。
范数加权注意力 (Norm-Weighted Attention)
结合注意力权重和范数信息的注意力机制,用于衡量信息的重要性。
用于CONDUIT中的刷新策略。
刷新预算 (Refresh Budget)
在缓存重用过程中允许重新计算的视觉令牌数量。
用于控制CONDUIT的计算成本。
开放问题 这项研究留下的未解疑问
- 1 如何在更大规模的数据集上实现高效的KV缓存重用?
- 2 在多图像提示下,如何进一步优化缓存重用策略?
应用场景
近期应用
文档检索
通过快速重用缓存,加速文档检索过程,提高查询效率。
远期愿景
智能助手
在智能助手中应用,提高多轮对话的响应速度和准确性。
原文摘要
Vision-language models (VLMs) often answer new questions about recurring visual content, where reusing the key-value (KV) cache can avoid re-encoding expensive visual prefixes. Exact-prefix reuse, however, fails when the same visual content appears under a changed prefix. Selective recomputation can recover quality under a small visual-token budget, but only when the right stale tokens are refreshed. Raw-attention selection can waste budget on high-attention tokens with small value-norm proxy scores and on query-irrelevant images. To address these failure modes, we propose CONDUIT, a training-free refresh policy that unifies single- and multi-image reuse as residual-stream restoration. Building on norm-weighted attention, CONDUIT ranks cached visual tokens using cached-key query attention and an accessible pre-output cached-value-norm proxy, then applies empirical image-level relevance amplification before one global selection. With one image, the coefficient is one and the rule reduces to intra-image token selection. The method preserves model architecture and weights, adding only a single query-conditioned scoring pass at inference. At a 10% refresh budget, CONDUIT achieves 97.0-99.5% of the corresponding full-prefill five-dataset average across three VLM backbones and leads budgeted methods on average; on the MMLongBench-Doc latency subset, it uses 13.5% of full-prefill FLOPs and achieves a 2.99x time-to-first-token speedup.