核心发现
方法论
CoFiE框架将证据选择分为两个阶段:视觉编码前的粗过滤和LLM预填充期间的细化选择。粗过滤使用新颖性引导框架过滤保留视觉上独特的候选帧,而细化选择则通过文本到视觉的注意力机制选择与用户查询最相关的帧。
关键结果
- 在StreamingBench上,CoFiE在50%帧丢弃情况下达到78.86%的准确率,比之前的方法提高了1.60%。
- 在OvO-Bench上,CoFiE在50%帧丢弃情况下达到68.72%的平均分,比Qwen3-VL-8B-Instruct提高了3.69%。
- 即使在80%的证据帧过滤下,CoFiE仍能保持99.0%的无丢弃性能。
研究意义
CoFiE通过在视觉编码前进行证据选择,显著减少了冗余计算,提升了流媒体视频理解的效率。这一方法在学术界和工业界都具有重要意义,尤其是在需要快速响应的实时视频分析中。
技术贡献
CoFiE在视觉编码前进行帧级别的修剪,这是流媒体VLLM推理中的首次尝试。通过引入新颖性引导框架过滤和查询特定证据细化,CoFiE提供了新的理论保证和工程可能性。
新颖性
CoFiE首次在视觉编码前进行证据选择,与现有方法相比,显著减少了计算开销,同时保持了高准确性。与传统的单阶段压缩方法不同,CoFiE的双阶段设计使其在处理非均匀视频证据时更具鲁棒性。
局限性
- 在处理极端复杂或快速变化的视频场景时,CoFiE可能会遗漏关键帧,影响准确性。
- 对新颖性评分的依赖可能导致在某些情况下的误判。
未来方向
未来的研究可以探索更复杂的帧选择机制,结合深度学习模型来提高新颖性评分的准确性。此外,扩展CoFiE以支持更多类型的视频数据也是一个有趣的方向。
AI 总览摘要
流媒体视频理解需要在严格的延迟限制下处理不断增长的视频流,并回答用户问题。现有方法主要通过在视觉编码后进行令牌修剪来提高效率,但这种方法的端到端延迟减少有限。CoFiE框架通过在视觉编码前进行粗过滤和在LLM预填充期间进行细化选择,显著减少了冗余计算。实验表明,CoFiE在多个视频理解基准上实现了新的准确性-效率权衡,达到78.86%的准确率,并在80%的证据帧过滤下仍能保持高性能。CoFiE的设计在学术界和工业界都具有重要意义,尤其是在需要快速响应的实时视频分析中。尽管如此,CoFiE在处理极端复杂或快速变化的视频场景时可能会遗漏关键帧,未来的研究可以探索更复杂的帧选择机制来提高其鲁棒性。
深度分析
研究背景
流媒体视频理解是视觉语言模型(VLLMs)的核心能力之一。现有方法如VideoStreaming和TimeChat-Online通过减少视觉令牌来提高效率,但这些方法在视觉编码后进行证据减少,导致计算开销无法显著降低。
核心问题
流媒体视频理解的核心问题在于如何在不影响准确性的情况下减少计算开销。现有方法主要在视觉编码后进行令牌修剪,无法显著减少端到端延迟。
核心创新
CoFiE的核心创新在于其双阶段证据选择框架:在视觉编码前进行粗过滤,保留视觉上独特的候选帧;在LLM预填充期间进行细化选择,通过文本到视觉的注意力机制选择与用户查询最相关的帧。
方法详解
- �� 粗过滤:使用新颖性引导框架过滤,基于直方图变化计算帧的新颖性分数。
- �� 细化选择:在LLM预填充期间,使用文本到视觉的注意力机制对候选帧进行排序,选择最相关的证据帧。
实验设计
实验在StreamingBench和OvO-Bench等基准上进行,使用Qwen3-VL-8B-Instruct作为基线。评估指标包括准确性和推理时间,实验结果表明CoFiE在多个基准上实现了新的准确性-效率权衡。
结果分析
CoFiE在StreamingBench上达到78.86%的准确率,比之前的方法提高了1.60%。在OvO-Bench上,CoFiE在50%帧丢弃情况下达到68.72%的平均分,比Qwen3-VL-8B-Instruct提高了3.69%。
应用场景
CoFiE可用于实时视频分析,如监控系统和自动驾驶中需要快速响应的场景。其高效的证据选择机制可以显著减少计算开销,提高系统的实时性。
局限与展望
CoFiE在处理极端复杂或快速变化的视频场景时可能会遗漏关键帧,影响准确性。未来的研究可以探索更复杂的帧选择机制来提高其鲁棒性。
通俗解读 非专业人士也能看懂
想象一下你在看一场长时间的足球比赛。你不需要每一秒的细节,只需要关键时刻,比如进球、犯规等。CoFiE就像一个聪明的观众,它会在比赛开始前选择一些可能包含精彩瞬间的片段,然后在比赛进行中根据解说员的提示进一步筛选出最重要的时刻。这样,你就能在不浪费时间的情况下,看到比赛的精华部分。
简单解释 像给14岁少年讲一样
想象你在玩一个超级长的游戏,你不想看每一帧,只想看最酷的瞬间。CoFiE就像一个超级聪明的助手,帮你挑选出那些可能很酷的画面,然后在你问问题的时候,再挑出最相关的画面。这样,你就能快速看到游戏的精彩部分,而不用浪费时间!
术语表
Vision Language Models (视觉语言模型)
一种结合视觉和语言处理能力的模型,用于理解和生成多模态信息。
在流媒体视频理解中用于处理视频流和用户问题。
Token Pruning (令牌修剪)
一种减少模型计算量的方法,通过去除不重要的令牌来提高效率。
现有方法主要在视觉编码后进行令牌修剪。
Novelty-Guided Frame Filtering (新颖性引导框架过滤)
一种基于帧的新颖性评分来选择候选帧的机制。
在CoFiE中用于在视觉编码前进行粗过滤。
Query-Specific Evidence Refinement (查询特定证据细化)
一种通过文本到视觉的注意力机制选择与用户查询最相关帧的机制。
在CoFiE中用于在LLM预填充期间进行细化选择。
StreamingBench
一种用于评估流媒体视频理解性能的基准测试。
CoFiE在该基准上实现了78.86%的准确率。
开放问题 这项研究留下的未解疑问
- 1 如何在不影响准确性的情况下进一步减少计算开销?现有方法在视觉编码后进行修剪,未能显著降低延迟。
- 2 如何提高新颖性评分的准确性?当前方法可能在某些情况下误判。
应用场景
近期应用
实时监控系统
通过高效的证据选择机制,减少计算开销,提高系统的实时性和响应速度。
自动驾驶
在自动驾驶场景中,快速识别和处理关键视觉信息,提高安全性。
远期愿景
智能城市
在智能城市中,通过高效的视频分析系统,提升公共安全和交通管理效率。
原文摘要
Streaming video understanding requires Vision Language Models (VLLMs) to process growing video streams and answer user questions under tight latency constraints. Existing methods improve efficiency through token pruning and memory-bank schemes, but mainly reduce visual tokens after visual encoding. Consequently, downstream token pruning alone cannot substantially reduce end-to-end latency because the expensive frame encoding cost has already been incurred. We propose CoFiE, a Coarse-to-Fine Evidence Selection framework that decouples evidence selection into a coarse, query-agnostic filtering stage before the vision encoder and a fine, query-specific refinement stage during LLM prefill. CoFiE introduces Novelty-Guided Frame Filtering to retain visually distinctive candidate frames and Query-Specific Evidence Refinement to select the frames most relevant to the user query. This design removes substantial redundancy before frame encoding while preserving query-specific refinement once semantic information becomes available. Experiments show that CoFiE establishes a new state-of-the-art accuracy-efficiency trade-off across multiple video understanding benchmarks, reaching 78.86% accuracy on StreamingBench and 68.72% on OvO-Bench, with improvements of up to 3.15% over prior methods. Even with up to 80% evidence-frame filtering, CoFiE outperforms strong open-source multimodal models while improving end-to-end inference latency by up to 2.54 times.