Caption-once, Frames-on-Demand: Visual-Need Routing for Budget-Aware Agentic Long Video Understanding

TL;DR

提出CFD框架,通过视觉需求路由优化长视频理解,减少视觉处理。

cs.CV 🔴 高级 2026-09-11 4 次浏览
Weitong Cai Hang Zhang Yukai Huang Yiqiao Xie Shan Gao Jiankang Deng Songcen Xu Jifei Song Zhensong Zhang
长视频理解 边缘计算 视觉需求路由 多模态 效率优化

核心发现

方法论

该研究提出了Caption-once, Frames-on-Demand (CFD)框架,结合边缘设备和云端的协同工作。边缘设备进行一次性离线字幕生成,创建事件级别的故事骨架和片段级别的微日志。云端通过视觉需求路由器判断是否需要检索关键帧,仅在感知问题上进行视觉访问。

关键结果

  • 在Video-MME基准测试中,CFD在每个问题平均使用5.8帧,整体准确率达到67.5%,显著减少了视觉处理量。
  • 在InfiniBench上,CFD在时间顺序理解和全局外观等方面表现优异,平均每个问题使用14.8帧。
  • 实验表明,CFD在减少视觉处理的同时保持了高准确性,尤其在长视频场景中。

研究意义

CFD框架在长视频理解领域具有重要意义,尤其是在资源受限的边缘设备上。它通过减少视觉处理需求,提高了系统的效率和响应速度,同时保持了对视频内容的准确理解。这一方法为多模态应用提供了新的思路,特别是在需要实时处理和低延迟的场景中。

技术贡献

CFD框架的技术贡献在于其创新的视觉需求路由机制,首次将视觉访问作为一个条件化的成本来处理。这种方法不仅减少了视觉处理的开销,还提供了一个灵活的框架来处理不同类型的问题,适应性强。

新颖性

CFD框架的创新之处在于其将视觉访问转化为一个可调的查询条件成本,这是首次在视频问答系统中实现的。这一创新使得视觉处理可以根据问题类型进行选择性分配,而不是一刀切的处理方式。

局限性

  • CFD在处理极其复杂的视觉场景时可能会遇到困难,因为其依赖于初始的文本索引。
  • 在某些需要高精度视觉分析的场景中,可能会因为减少视觉处理而导致准确性下降。

未来方向

未来的研究方向包括优化视觉需求路由器的决策机制,以提高在复杂场景中的表现。同时,可以探索如何更好地结合多模态信息,以进一步提升系统的准确性和效率。

AI 总览摘要

长视频理解在边缘设备上面临计算和带宽的限制,传统方法要么丢失时间结构,要么丢失细粒度视觉属性。为解决这一问题,研究者提出了Caption-once, Frames-on-Demand (CFD)框架。该框架通过一次性离线字幕生成,创建事件级别的故事骨架和片段级别的微日志,缓存并在查询时重复使用。云端的多模态大模型在一个以故事为中心的循环中对索引进行推理,使用视觉需求路由器来判断是否需要检索关键帧。实验结果表明,CFD在减少视觉处理的同时,保持了高准确性,尤其在长视频场景中表现优异。CFD框架在长视频理解领域具有重要意义,尤其是在资源受限的边缘设备上。它通过减少视觉处理需求,提高了系统的效率和响应速度,同时保持了对视频内容的准确理解。这一方法为多模态应用提供了新的思路,特别是在需要实时处理和低延迟的场景中。未来的研究方向包括优化视觉需求路由器的决策机制,以提高在复杂场景中的表现。同时,可以探索如何更好地结合多模态信息,以进一步提升系统的准确性和效率。

深度分析

研究背景

长视频理解是多模态应用的基础,涉及交互式视频助手、设备内存和可穿戴视觉辅助等。现有方法主要通过视觉压缩和文本翻译来降低计算成本,但这两者都有各自的局限性。视觉压缩可能导致覆盖面不足,而文本翻译则可能丢失细粒度的视觉证据。

核心问题

长视频理解需要在有限的计算和带宽条件下处理大量内容。现有方法在处理时间结构和视觉属性时存在权衡,难以同时满足效率和准确性。

核心创新

CFD框架的核心创新在于其视觉需求路由机制。通过将视觉访问转化为一个条件化的成本,CFD能够根据问题类型选择性地分配视觉处理资源。这一方法不仅减少了视觉处理的开销,还提供了一个灵活的框架来处理不同类型的问题。

方法详解

  • �� 边缘设备进行一次性离线字幕生成,创建事件级别的故事骨架和片段级别的微日志。

  • �� 云端通过视觉需求路由器判断是否需要检索关键帧,仅在感知问题上进行视觉访问。

  • �� 使用多模态大模型在一个以故事为中心的循环中对索引进行推理。

实验设计

实验在Video-MME和InfiniBench基准上进行,使用Qwen3-VL-8B-Instruct和Qwen3-VL-32B-Instruct模型。通过对比不同方法的帧使用量和准确率,验证了CFD的效率和准确性。

结果分析

CFD在Video-MME基准测试中,平均每个问题使用5.8帧,整体准确率达到67.5%。在InfiniBench上,CFD在时间顺序理解和全局外观等方面表现优异,平均每个问题使用14.8帧。

应用场景

CFD框架适用于需要实时处理和低延迟的多模态应用,如交互式视频助手和可穿戴设备。其高效的视觉处理机制使其在资源受限的边缘设备上表现出色。

局限与展望

CFD在处理极其复杂的视觉场景时可能会遇到困难,因为其依赖于初始的文本索引。在某些需要高精度视觉分析的场景中,可能会因为减少视觉处理而导致准确性下降。

通俗解读 非专业人士也能看懂

想象你在看一部很长的电影,但你的手机电量有限。CFD就像一个聪明的助手,它会先把电影的故事情节记下来,只在你需要看清某个细节时才打开画面。这样,你可以在不耗尽电量的情况下,了解电影的全貌和细节。

简单解释 像给14岁少年讲一样

想象你在玩一个很长的游戏,但你的设备电量有限。CFD就像一个聪明的助手,它会先把游戏的故事情节记下来,只在你需要看清某个细节时才打开画面。这样,你可以在不耗尽电量的情况下,了解游戏的全貌和细节。

术语表

视觉需求路由 (Visual-Need Routing)

一种根据问题类型决定是否检索视觉信息的机制。

用于在查询时判断是否需要检索关键帧。

多模态大模型 (MLLM)

能够处理多种数据模态(如文本和图像)的机器学习模型。

用于在云端进行推理和决策。

事件级别故事骨架 (Event-level Story Skeleton)

视频内容的简化文本表示,包含主要事件和时间顺序。

用于在边缘设备上创建初始索引。

片段级别微日志 (Clip-level Micro-log)

视频片段的详细文本描述,包含局部时间细节。

用于在查询时提供细粒度的时间信息。

边缘设备 (Edge Device)

靠近数据源的小型计算设备,通常具有有限的计算能力。

用于进行初始的离线字幕生成。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算成本的情况下提高CFD在复杂视觉场景中的表现?
  • 2 如何优化视觉需求路由器的决策机制以提高准确性?

应用场景

近期应用

交互式视频助手

CFD可用于提高视频助手的响应速度和准确性,特别是在资源受限的设备上。

远期愿景

智能监控系统

CFD可用于开发高效的监控系统,能够在不耗费大量资源的情况下进行实时分析。

原文摘要

Long-video understanding on edge devices must reason over hours of content under tight compute and bandwidth budgets. Subsampling visual tokens loses temporal structure, while text-only video memories lose fine-grained visual attributes. We observe a visual-textual duality: language memories carry long-range temporal structure better than dense frames, while pixels remain decisive for attribute-level perception. Building on this insight, we propose Caption-once, Frames-onDemand (CFD), a budget-aware edge-cloud agentic framework. The edge runs a single offline captioning pass that builds a dual-track narrative index, an event-level story skeleton plus a clip-level micro-log, cached and reused across queries without re-captioning. At query time, a cloud-side MLLM reasons over the index in a story-first loop centered on a lightweight Visual-Need Router: a per-query gating module that triggers bounded keyframe retrieval only for perceptual questions (appearance, on-screen text, attribute disambiguation) and keeps temporal-structural questions in language space. The router turns visual access into a first-class, query-conditioned cost, capping per-query frame consumption regardless of video length. Experiments on long-video benchmarks demonstrate strong accuracy-efficiency trade-offs while substantially reducing online visual processing.

cs.CV cs.HC