CONDUIT: A Unified Residual-Stream Restoration Framework for KV Cache Reuse in Vision-Language Models

TL;DR

CONDUIT框架在10%刷新预算下,达到97.0-99.5%的性能。

cs.CL 🔴 高级 2026-09-05 2 次浏览
Pengan Chen Kaisheng Zheng Liang Hong Lixia Yi Jiyue Jiang Jiayang Chen Yixuan Wang Yimin Fan Xinyuan Liu Jiayi Li Zhanqiu Zhang Yiwen Guo Yu Li
视觉语言模型 KV缓存 残差流 注意力机制 模型优化

核心发现

方法论

CONDUIT框架通过残差流恢复实现KV缓存重用。利用缓存键查询注意力和缓存值范数代理进行排序,结合图像级别的相关性放大,在推理时进行全局选择。该方法无需训练,保持模型架构不变,仅在推理时增加查询条件的评分过程。

关键结果

  • 在10%刷新预算下,CONDUIT在五个数据集上达到97.0-99.5%的性能,与完整预填充相比,平均提高约1.7分。
  • 在MMLongBench-Doc延迟子集上,使用13.5%的完整预填充FLOPs,首次令牌时间加速2.99倍。
  • 在单图像和多图像设置中,CONDUIT在保持大部分完整预填充质量的同时,显著减少了预填充计算。

研究意义

CONDUIT框架在视觉语言模型中实现了KV缓存的高效重用,显著降低了计算成本。该方法在不改变模型架构的情况下,通过训练外的刷新策略提高了模型的响应速度和计算效率,解决了视觉前缀变化导致的缓存失效问题。

技术贡献

CONDUIT通过结合缓存键查询注意力和缓存值范数代理,实现了视觉KV缓存的残差流恢复。该方法在不改变模型架构和权重的情况下,提供了一种无训练的刷新策略,显著提高了缓存重用效率。

新颖性

CONDUIT首次将视觉KV缓存重用问题视为残差流恢复问题,提出了基于范数加权注意力的刷新策略,区别于传统的注意力选择方法。

局限性

  • 在某些高复杂度场景中,可能需要更高的刷新预算以维持性能。
  • 对多图像提示的处理可能在某些情况下不够精细。

未来方向

未来工作可以探索在不同视觉语言模型架构上的适用性,以及在更大规模数据集上的性能表现。

AI 总览摘要

视觉语言模型(VLMs)在处理重复视觉内容时,通常需要重新编码昂贵的视觉前缀。现有方法在前缀变化时无法有效重用缓存,导致计算资源浪费。

CONDUIT框架通过残差流恢复实现KV缓存重用,利用范数加权注意力进行排序,并在推理时进行全局选择。该方法无需训练,保持模型架构不变,仅在推理时增加查询条件的评分过程。

在实验中,CONDUIT在10%刷新预算下,达到了97.0-99.5%的性能,显著减少了计算成本,并在多图像提示下实现了更高的缓存重用效率。

深度分析

研究背景

视觉语言模型在自然图像、文档页面和用户界面中回答问题。随着视觉内容的重复出现,重新编码视觉前缀的成本变得昂贵。现有方法在前缀变化时无法有效重用缓存,导致计算资源浪费。

核心问题

视觉前缀变化导致缓存失效的问题。现有方法在前缀变化时无法有效重用缓存,导致计算资源浪费。

核心创新

CONDUIT框架通过残差流恢复实现KV缓存重用,利用范数加权注意力进行排序,并在推理时进行全局选择。

方法详解

  • �� 利用缓存键查询注意力和缓存值范数代理进行排序。

  • �� 结合图像级别的相关性放大。

  • �� 在推理时进行全局选择,保持模型架构不变。

实验设计

在五个数据集上进行实验,包括LongDocURL、MMLongBench-Doc、SlideVQA、InfoSeek和ViQuAE。使用三种VLM骨干网络进行测试。

结果分析

在10%刷新预算下,CONDUIT在五个数据集上达到97.0-99.5%的性能。在MMLongBench-Doc延迟子集上,使用13.5%的完整预填充FLOPs,首次令牌时间加速2.99倍。

应用场景

适用于需要高效处理重复视觉内容的场景,如文档检索和多图像推理。

局限与展望

在某些高复杂度场景中,可能需要更高的刷新预算以维持性能。对多图像提示的处理可能在某些情况下不够精细。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里,图书馆员有一个笔记本,记录了每本书的关键字。当有人来问问题时,图书馆员可以快速查找笔记本,而不是重新翻阅每本书。这就像CONDUIT框架,它通过缓存关键字来加速查询过程。即使问题的开头发生了变化,只要关键字没有变,图书馆员就能快速找到答案。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里有很多关卡,每个关卡都有不同的挑战。你可以保存游戏进度,这样即使你换了一个新关卡,你也可以快速加载之前的进度,而不用从头开始。这就像CONDUIT框架,它帮助模型在处理新问题时快速重用之前的计算结果,节省时间和资源!

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行任务的模型,通常用于图像描述或问答。

用于处理自然图像和文本的联合任务。

KV缓存 (KV Cache)

存储键值对以加速后续查询的缓存机制。

在视觉语言模型中用于存储视觉前缀信息。

残差流 (Residual Stream)

模型中用于传递信息的共享通道,注意力层从中读取和写入信息。

用于解释CONDUIT中的缓存重用机制。

范数加权注意力 (Norm-Weighted Attention)

结合注意力权重和范数信息的注意力机制,用于衡量信息的重要性。

用于CONDUIT中的刷新策略。

刷新预算 (Refresh Budget)

在缓存重用过程中允许重新计算的视觉令牌数量。

用于控制CONDUIT的计算成本。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的数据集上实现高效的KV缓存重用?
  • 2 在多图像提示下,如何进一步优化缓存重用策略?

应用场景

近期应用

文档检索

通过快速重用缓存,加速文档检索过程,提高查询效率。

远期愿景

智能助手

在智能助手中应用,提高多轮对话的响应速度和准确性。

原文摘要

Vision-language models (VLMs) often answer new questions about recurring visual content, where reusing the key-value (KV) cache can avoid re-encoding expensive visual prefixes. Exact-prefix reuse, however, fails when the same visual content appears under a changed prefix. Selective recomputation can recover quality under a small visual-token budget, but only when the right stale tokens are refreshed. Raw-attention selection can waste budget on high-attention tokens with small value-norm proxy scores and on query-irrelevant images. To address these failure modes, we propose CONDUIT, a training-free refresh policy that unifies single- and multi-image reuse as residual-stream restoration. Building on norm-weighted attention, CONDUIT ranks cached visual tokens using cached-key query attention and an accessible pre-output cached-value-norm proxy, then applies empirical image-level relevance amplification before one global selection. With one image, the coefficient is one and the rule reduces to intra-image token selection. The method preserves model architecture and weights, adding only a single query-conditioned scoring pass at inference. At a 10% refresh budget, CONDUIT achieves 97.0-99.5% of the corresponding full-prefill five-dataset average across three VLM backbones and leads budgeted methods on average; on the MMLongBench-Doc latency subset, it uses 13.5% of full-prefill FLOPs and achieves a 2.99x time-to-first-token speedup.

cs.CL cs.CV