Think in Sets for Streaming Video Token Compression

TL;DR

提出NovaCov,基于集合选择的流视频令牌压缩方法,保持99.6%准确率,降低46%延迟。

cs.CV 🔴 高级 2026-08-02 52 次浏览
Moxu Duan Jingwen Fu Yuwang Wang
视频理解 令牌压缩 集合选择 实时流处理 子模优化

核心发现

方法论

本文将流视频令牌压缩问题转化为集合选择任务,提出NovaCov。该方法利用容量有限、基于时间加权的历史参考库,结合双分支子模覆盖目标,动态选择代表性令牌。两个分支分别优化当前帧内容和历史未覆盖信息,保证模型在实时条件下的有效性。采用贪心算法,确保(1-1/e)的近似保证。该方法无需训练,具备即插即用特性,适应连续流场景。

关键结果

  • 在流和离线视频理解基准上,NovaCov均优于现有无训练压缩方法,保持99.6%的ReKV精度,显著降低预填充延迟46%。在OVO-Bench和StreamingBench上,压缩比约为25%,性能提升明显。实验还验证了其在多任务、多场景中的适应性和鲁棒性。
  • 具体数据表明,NovaCov在不同压缩比例下均实现优异性能,最大压缩比达75%,同时保持较高的内容覆盖率和任务准确率。与传统基于单一得分的令牌排序方法相比,集合优化策略显著减少冗余,提高信息利用效率。
  • 通过消融实验,验证了历史参考库容量、双分支目标权重对性能的影响,确保算法在实时场景中的可行性和稳定性。

研究意义

该研究突破了流视频令牌压缩的传统单一得分策略,提出集合选择框架,解决了实时性与信息代表性之间的矛盾。其无需训练的特性极大简化了部署流程,为大规模视频理解提供高效、可靠的解决方案。该方法不仅提升了模型的响应速度,也增强了对连续场景变化的适应能力,为未来多模态、实时视频分析奠定基础。

技术贡献

创新点在于引入容量受限的历史参考库和双分支子模目标,结合贪心算法保证近似最优。该方法首次将流视频令牌压缩问题系统化为集合优化框架,突破了传统单令牌得分模型的局限。理论上,确保了(1-1/e)的近似保证,提供了严格的性能保障。此外,设计的参考库机制实现了内容的动态更新与高效管理,极大提升了实时处理能力。

新颖性

本研究首次提出面向流视频的训练无关集合选择压缩策略,解决了连续帧中跨帧冗余与信息代表性矛盾。区别于以往离线方法的全局优化,NovaCov在保证实时性前提下,通过容量有限的参考库实现跨帧信息的有效融合。这一创新为流媒体视频理解提供了新思路,填补了该领域的空白。

局限性

  • 当前方法依赖预设的容量参数和阈值,可能在极端场景(如快速场景变化或极端压缩比)下表现不佳,需进一步自适应调整机制。
  • 在极高压缩比例(如超过80%)时,信息覆盖率可能不足,影响任务性能,未来需结合多模态信息增强表达能力。
  • 算法在极端低资源设备上的实时性能仍需优化,特别是在硬件限制较大的边缘场景中。

未来方向

未来将探索自适应容量调节机制,结合多模态信息提升压缩效率。还计划引入学习机制优化参考库更新策略,增强模型对复杂场景的适应性。此外,将扩展到多任务、多模态融合场景,推动流视频理解的广泛应用。

AI 总览摘要

随着视频内容的不断增长,实时流视频理解面临着巨大的计算和存储挑战。传统方法多依赖训练复杂模型或全局特征,难以满足低延迟和高效率的需求。本文提出NovaCov,一种基于集合选择的流视频令牌压缩策略,无需训练,具备即插即用的特性。它通过维护容量有限、基于时间加权的历史参考库,有效捕捉已传达内容,避免冗余。结合双分支子模覆盖目标,动态选择代表性令牌,既保证当前帧的空间信息,又考虑历史未覆盖部分。该方法采用贪心算法,确保理论上的(1-1/e)近似保证,显著提升压缩效率和内容保真度。在多个流和离线视频理解基准测试中,NovaCov均优于现有无训练压缩方案,保持99.6%的ReKV精度,延迟降低46%。这一突破为实时多模态视频理解提供了高效、可扩展的解决方案,推动了智能视频分析的快速发展。未来,结合自适应参数调节和多模态信息融合,NovaCov有望在边缘设备和大规模视频平台中实现更广泛应用。

深度分析

研究背景

视频理解技术近年来快速发展,尤其是大规模视频语言模型(VideoLLMs)推动了多模态理解的边界。早期工作如ReKV通过缓存机制实现在线问答,随后出现多种压缩策略以减少计算负担。训练驱动的方法如ViT、Swin Transformer等提升了特征表达,但在流场景中受限于延迟和存储。无训练的令牌压缩技术如Yao等采用单一得分排序,忽略了跨帧冗余。离线集合优化方法如FLoC、MM-Tok通过全局视角提升效率,但难以适应实时流场景。当前挑战在于如何在保证实时性同时,最大化信息覆盖和减少冗余。

核心问题

流视频场景要求模型在每一帧到达时,快速决定保留哪些令牌以代表当前内容,同时考虑已传达信息,避免重复。传统单一得分方法无法有效处理跨帧冗余,导致信息重复和效率低下。实时性限制使得必须在有限时间内做出决策,存储空间也有限制。如何在保证内容代表性和系统响应速度的前提下,设计一种既高效又准确的令牌压缩策略,成为核心难题。

核心创新

本研究提出了NovaCov,核心创新在于引入容量有限的历史参考库,结合双分支子模目标实现跨帧信息融合。第一,设计容量受限、基于时间加权的参考库,动态更新代表已传达内容;第二,采用双分支目标,分别优化当前帧空间信息和未覆盖的历史内容,确保信息多样性。第三,利用贪心算法保证(1-1/e)的理论近似,兼顾效率与性能。这些设计突破了传统单一得分模型的局限,实现了无训练、实时、跨帧的令牌压缩。

方法详解

  • �� 设计容量有限、时间加权的历史参考库,实时更新以反映最新内容。• 将令牌压缩转化为集合优化问题,定义两个子模目标:当前帧内容和历史未覆盖信息。• 利用相似度(余弦)衡量令牌与内容的匹配程度,结合新颖度加权,优先选择新信息。• 采用贪心算法逐步选择令牌,保证理论近似。• 设计匹配或插入机制,动态更新参考库,保持内容代表性。• 通过阈值控制内容融合,平衡新旧信息。• 实验中调节参数如容量、阈值、加权系数,确保系统稳定性。

实验设计

在OVO-Bench和StreamingBench等多个流视频理解任务上,采用ReKV作为基础架构,设置每帧保留50个令牌(总共196),压缩比约25%。对比包括Yao、VisionZip、VidCom2和STC-Pruner等无训练方法,评估指标涵盖任务准确率和延迟。参数调优包括容量C=512、阈值θ=0.9、加权系数等。通过消融验证不同参数对性能的影响,确保在不同压缩比例下的鲁棒性。实验还包括离线长视频任务,验证模型的泛化能力。

结果分析

结果显示,NovaCov在所有压缩比例下均优于对比方法,最大压缩比达75%,保持99.6%的ReKV准确率,延迟降低46%。在多任务场景中表现出色,特别是在实时理解和问答任务中,响应速度显著提升。消融实验验证了容量和目标权重对性能的影响,确保算法在实际应用中的稳定性。整体而言,NovaCov实现了高效的内容压缩与信息保真之间的良好平衡,为流视频理解提供了新范式。

应用场景

该方法适用于实时视频监控、自动驾驶、视频问答等场景,能显著降低模型预填充延迟,提升系统响应速度。未来还可结合多模态信息,增强对复杂场景的理解能力,推动智能视频分析在边缘设备和大规模平台中的应用。

局限与展望

目前参数设置较为固定,可能在极端场景(如快速变化或极高压缩比)表现不足。模型对硬件资源依赖较大,边缘设备上实时性能仍需优化。未来需引入自适应机制和多模态融合,以提升鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在整理一个很大的相册,每次只需要带一些照片去朋友家玩。你会挑选最重要、最能代表当天的照片,而不是每一张都带。这个过程就像视频中的令牌压缩,系统要决定哪些内容最关键,哪些可以省略。传统方法就像随机挑照片,有些重复或无关紧要。而新方法像聪明的整理师,记住哪些照片已经带过了,只带那些新鲜或特别的。它还会记住哪些照片经常出现,避免重复带相似的内容。这样既节省空间,又保证了照片的代表性。这个比喻说明了如何在不断的流动中,智能地选择最重要的信息,保证理解的完整性和效率。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆借书,但每次只能带几本。你会挑选最喜欢、最重要的书,而不是带所有的书。每次借完书后,你会记住哪些书你已经借过了,下次就不会再带一样的书。这个过程就像视频中的令牌压缩,系统要决定每一帧带哪些内容。以前的方法就像随机挑书,可能带了很多重复的内容,浪费空间。而新方法像个聪明的朋友,记住哪些内容已经带过,优先带新鲜或重要的内容。它还会记住哪些内容经常出现,避免重复带相似的东西。这样既节省空间,又能保证理解完整。这就像你在不断学习和整理信息,既快又准,帮你更好地理解视频内容。

原文摘要

Streaming VideoLLMs process frames causally while visual tokens grow continuously, making compression essential for controlling prefilling latency and memory. Existing training-free methods independently rank tokens, ignoring marginal-gain interactions among retained tokens. We argue that streaming video token compression should instead be formulated as set selection, where each candidate is valued by what it adds beyond the tokens already retained. Unlike existing set-wise methods designed for offline tasks, streaming makes causal, frame-by-frame pruning decisions, so modeling cross-frame interactions requires an explicit historical reference. This creates a reference-set dilemma: the reference must adequately represent previously conveyed content while remaining bounded for real-time inference. We introduce NovaCov, to our knowledge the first training-free, plug-and-play set-wise token compressor designed for streaming video. NovaCov maintains a capacity-bounded, recency-weighted Historical Reference Bank and optimizes a dual-branch submodular coverage objective that preserves representative current-frame content while prioritizing information insufficiently covered by history. Both branches are facility-location functions, so greedy selection retains the classical (1-1/e) approximation guarantee. Across streaming and offline benchmarks, NovaCov outperforms existing training-free compression methods, retaining 99.6% of ReKV accuracy while reducing LLM prefilling latency by 46%.

cs.CV