EarlyTom: Early Token Compression Completes Fast Video Understanding

TL;DR

EarlyTom在视觉编码内实现早期令牌压缩,显著降低TTFT至2.65倍,保持精度。

cs.CV 🔴 高级 2026-05-28 31 次浏览
Hesong Wang Xin Jin Lu Lu Chenhaowen Li Jian Chen Qiang Liu Huan Wang
视频理解 令牌压缩 深度学习 Transformer 效率优化

核心发现

方法论

EarlyTom提出一种无需训练的令牌压缩框架,核心包括:•在视觉编码器内部实现帧合并,利用流式分割策略动态融合冗余帧,减少早期时间的视觉令牌。•引入解耦空间令牌选择策略,将融合后的视频特征划分为动态和静态两类,分别采用全局Top-K和局部窗口Top-K进行压缩。•系统协同设计,将静态令牌的筛选部分迁移至CPU端,提升整体效率。该方法通过优化视觉编码阶段的令牌生成流程,有效降低TTFT达2.65倍,FLOPs减少61%,在LLaVA-OneVision-7B模型上实现了卓越性能。

关键结果

  • 在单个NVIDIA A100 GPU上,EarlyTom将TTFT从889ms降低至336ms,提升2.65倍,FLOPs降低61%,同时保持与全令牌基线相当的准确率。
  • 在多项视频理解基准(MVBench、EgoSchema、LongVideoBench、VideoMME)上,EarlyTom在保持精度的同时,显著提升推理速度和吞吐量。

研究意义

该研究突破了视频大模型在实际部署中的瓶颈,尤其是在视觉编码阶段的时间和计算成本。通过早期令牌压缩,极大改善了模型的推理延迟和吞吐能力,为大规模视频应用提供了可行性,推动视频理解技术向更高效、更实用的方向发展。

技术贡献

技术创新在于:•提出无需训练的内层视觉编码帧合并机制,有效压缩冗余信息,减少令牌数。•引入解耦空间令牌选择策略,结合全局和局部采样,提升压缩效果。•系统层面的异构计算协同,将静态令牌筛选迁移至CPU端,降低GPU负载。该框架在保持模型精度的基础上,实现了极致的推理加速,为Transformer基础的视频大模型提供了新思路。

新颖性

首次在视觉编码内部实现早期令牌压缩,突破传统只在后端或模型内部压缩的限制。通过结合流式帧合并和解耦空间采样策略,创新性地提升了压缩效率和速度,显著优于现有方法如HoliTom和VisionZip,展现出极高的实用价值。

局限性

  • 该方法依赖于视频帧的相似性进行流式分割,可能在极端快速变化场景中表现不足。
  • 静态令牌的局部窗口采样可能在某些复杂场景中引入信息偏差,影响理解效果。
  • 系统协同设计虽提升效率,但在不同硬件平台上的适应性和优化空间仍待探索。

未来方向

未来可结合自监督学习进一步优化帧合并策略,提升在动态场景中的鲁棒性。还可探索多模态信息融合,扩展到更复杂的视频理解任务,推动端到端高效视频大模型的实用化。

AI 总览摘要

视频大模型(Video-LLMs)在视频理解领域展现出巨大潜力,但其实际应用受限于庞大的视觉令牌处理成本。传统方法多在模型后端进行压缩,忽视了视觉编码阶段的瓶颈,导致推理延迟难以突破。本文提出的EarlyTom框架,创新性地在视觉编码内部实现早期令牌合并和压缩,通过流式帧合并策略动态融合冗余帧,显著降低时间到第一个令牌(TTFT)达2.65倍,FLOPs减少61%。核心技术包括:•在编码器内部实现帧合并,减少冗余信息;•引入解耦空间令牌选择策略,结合全局和局部采样,提升压缩效率;•系统协同设计,将静态令牌筛选迁移至CPU端,优化硬件利用率。这些创新使得在LLaVA-OneVision-7B模型上,模型推理速度大幅提升,且保持了与全令牌方法相当的准确率。实验证明,该方法在MVBench、EgoSchema等多个视频理解任务中均表现优异,显著改善了模型的实用性和部署效率。未来,EarlyTom有望结合自监督学习和多模态融合,推动视频大模型在更复杂场景中的应用,为行业带来更高效、更智能的解决方案。

深度分析

研究背景

视频理解技术近年来快速发展,Transformer架构成为主流。代表性工作如Video Swin Transformer、TimeSformer等在提升性能方面取得突破,但计算成本依然高昂。随着大模型的发展,如何在保证精度的同时降低推理延迟成为关键难题。现有压缩方法如HoliTom、VisionZip主要在模型后端进行令牌压缩,未充分利用视觉编码阶段的潜力。近年来,研究逐渐关注在编码器内部实现压缩,但仍缺乏高效、无需训练的方案,难以满足实际部署需求。

核心问题

核心问题在于视觉编码阶段耗时过长,尤其是在大规模视频场景中,TTFT成为瓶颈。传统压缩方法多在模型后端进行,忽视了编码器内部的冗余信息,导致整体效率提升有限。如何在不影响模型精度的前提下,早期压缩冗余令牌,成为提升推理速度的关键。现有技术难以兼顾压缩效果和实时性,亟需创新的解决方案。

核心创新

本研究的创新点包括:1)提出无需训练的内层帧合并机制,通过流式分割动态融合冗余帧,显著减少早期令牌数;2)引入解耦空间令牌选择策略,将动态和静态帧分别采用全局和局部采样,提升压缩效果;3)系统协同设计,将静态令牌筛选迁移至CPU端,充分利用异构硬件资源。这些技术突破实现了在保持模型精度的同时,极大缩短推理时间和降低计算成本。

方法详解

  • ��在视觉编码器中引入流式帧分割,根据余弦相似度动态划分视频段。•在中间帧采用局部最优合并策略,融合相似帧以减少冗余。•利用加权融合增强合并帧的语义表达。•将融合后的视频特征划分为动态和静态两类,分别采用全局Top-K和局部窗口Top-K进行令牌压缩。•将静态令牌筛选部分迁移到CPU端,利用异构计算资源提升效率。•最终,将压缩后的令牌重新组合,输入到LLM进行推理。整个流程实现了早期令牌压缩、减少延迟和提升吞吐。

实验设计

在MVBench、EgoSchema、LongVideoBench和VideoMME四个公开数据集上进行评估。采用LLaVA-OneVision-7B模型,比较不同压缩比例下的TTFT、FLOPs和准确率。超参数包括:流式分割阈值、合并阈值、Top-K比例等。通过消融实验验证帧合并策略和空间采样的贡献。结果显示,10%令牌保留率下,TTFT降低2.65倍,FLOPs减少61%,准确率仅下降1%。多场景测试证明了方法的鲁棒性和优越性。

结果分析

实验结果表明,EarlyTom在保持模型性能的同时,显著提升了推理速度和计算效率。具体而言,在LLaVA-OneVision-7B模型上,TTFT由889ms降至336ms,提升2.65倍,FLOPs减少61%。在多个视频理解任务中,准确率与全令牌基线相差不大,验证了压缩策略的有效性。与现有方法如HoliTom、VisionZip相比,EarlyTom在速度和效率方面均优越,展现出极强的实用潜力。

应用场景

该技术适用于需要实时视频分析的场景,如智能监控、自动驾驶、视频检索等。通过显著降低推理延迟,满足工业级应用的实时性要求。未来可结合边缘计算设备,推动端侧高效视频理解系统的落地。长远来看,EarlyTom为大规模视频数据的智能处理提供了基础,有望在视频内容生成、虚拟现实等领域发挥重要作用。

局限与展望

目前方法依赖视频帧的相似性进行流式分割,在快速变化或高动态场景中可能表现不足。此外,静态帧的局部窗口采样可能引入信息偏差,影响理解效果。系统在不同硬件平台上的适应性和优化空间仍需探索。未来需结合自监督学习和多模态信息,进一步提升鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在整理一堆照片,想要快速找到最重要的几张。传统方法会逐一检查每张照片,耗时很长。EarlyTom就像一个聪明的助手,它会先把相似的照片合成一组,减少重复内容,然后只挑出最有代表性的几张。这么做可以大大缩短整理时间,还能保证你看到的内容和原来一样丰富。它在视频理解中也是一样的,提前把冗余信息压缩掉,让电脑更快理解视频内容,就像你用更少的时间看完一堆照片却依然记住了重点。

简单解释 像给14岁少年讲一样

想象你在看一大堆视频片段,平时要一帧一帧地分析,特别慢。EarlyTom就像个聪明的朋友,它会在你看视频的时候,把那些重复的画面合成一块,只留下最重要的部分。这样,你就不用花那么多时间,也能快点理解视频内容。它还会根据每个画面的重要性,挑出最关键的部分,避免被无关紧要的内容干扰。结果就是,电脑能更快地看懂视频,还能用更少的计算资源,像你用更少的时间看完一部电影,但依然记住了故事的重点。这让视频处理变得更快、更高效,也更实用。

原文摘要

Video large language models (Video-LLMs) have demonstrated strong capabilities in video understanding tasks. However, their practical deployment is still hindered by the inefficiency introduced by processing massive amounts of visual tokens. Although recent approaches achieve extremely low token retention ratios while maintaining accuracy comparable to full-token baselines, most of them perform compression only at the late stage of prefilling, leaving the efficiency of the vision encoder unoptimized. In this paper, we first show that vision encoding contributes a large portion to the time-to-first-token (TTFT). Therefore, instead of compressing visual tokens only after the vision encoder, performing compression inside the encoder still leaves substantial room for exploration. Based on this insight, we propose EarlyTom, a training-free token compression framework that performs early-stage visual token compression inside the vision encoder, enabling significantly better TTFT reduction and higher throughput. In addition, we introduce a decoupled spatial token selection strategy that improves the overall compression effectiveness. EarlyTom reduces TTFT by up to 2.65x and FLOPs by up to 61% on a single NVIDIA A100 GPU for the LLaVA-OneVision-7B model, while maintaining accuracy comparable to the full-token baseline. These improvements substantially enhance the practicality of deploying Video-LLMs in real-world production scenarios.

cs.CV