What Should a Streaming Video Model Remember?

TL;DR

SelectStream模型通过选择性记忆提升流媒体视频理解,StreamingBench上达到82.67%。

cs.CV 🔴 高级 2026-06-15 6 次浏览
Haonan Ge Yiwei Wang Hang Wu Yujun Cai
流媒体视频 记忆分配 选择性记忆 视频理解 在线学习

核心发现

方法论

SelectStream通过选择性潜在记忆框架解决流媒体视频理解问题。其核心机制包括惊讶驱动的自适应窗口、优先级保留的整合,以及基于查询条件的图推理。通过固定容量的潜在记忆图来管理历史信息,避免了不必要的历史信息干扰当前场景感知。

关键结果

  • 在StreamingBench上,SelectStream模型取得了82.67%的准确率,相比于近期窗口基线提高了2.08%。
  • 在OVO-Bench上,SelectStream在回溯追踪任务中提升了10%以上的准确率,显示出其在利用历史视觉上下文方面的优势。
  • 在离线视频基准测试中,SelectStream在VideoMME和MLVU上分别提升了2.7%和2.8%的准确率,显示出其对长视频的强大处理能力。

研究意义

SelectStream的提出解决了流媒体视频理解中如何有效利用历史信息的问题。通过选择性记忆分配,模型能够在固定的计算和记忆预算下,显著提升对长时间跨度视频的理解能力。这一方法不仅在学术界具有重要意义,也为工业界的实时视频处理提供了新的思路。

技术贡献

SelectStream通过引入选择性潜在记忆框架,突破了传统方法中记忆模块过于复杂或简单的局限。其动态潜在证据图和基于查询的图推理机制,提供了新的理论保障和工程可能性。

新颖性

SelectStream首次将流媒体视频理解问题形式化为预算在线潜在证据分配问题,提出了独特的选择性记忆框架,区别于现有的记忆模块和压缩技术。

局限性

  • 在高动态场景下,选择性记忆可能导致对快速变化事件的捕捉不够及时。
  • 模型在处理极长视频时,可能会面临记忆容量的限制。
  • 在某些特定任务中,选择性记忆的效果可能不如全记忆策略。

未来方向

未来的研究方向包括优化选择性记忆机制以应对更复杂的动态场景,以及探索更高效的记忆管理策略,以进一步提升模型的实时处理能力。

AI 总览摘要

流媒体视频理解在现代应用中至关重要,如自动驾驶和实时监控。然而,现有方法在处理长时间跨度的视频时,往往面临记忆和计算资源的限制。SelectStream模型通过选择性潜在记忆框架,解决了这一难题。其核心机制包括惊讶驱动的自适应窗口和基于查询的图推理,能够在固定预算下有效管理历史信息。实验结果表明,SelectStream在多个基准测试中表现优异,尤其在需要利用历史上下文的任务中,显著超越了现有方法。尽管如此,模型在处理极动态场景时仍有改进空间,未来的研究将着重于优化记忆管理策略。

深度分析

研究背景

流媒体视频理解是计算机视觉领域的一个重要研究方向。随着视频数据量的爆炸式增长,如何在有限的计算资源下有效处理长时间跨度的视频成为一个关键问题。现有方法多通过记忆库或压缩技术来保留历史信息,但这些方法往往面临信息稀释或资源消耗过大的问题。

核心问题

流媒体视频理解的核心问题在于如何在固定的记忆和计算预算下,选择性地保留和利用历史信息。现有方法在处理长时间跨度的视频时,往往面临信息稀释或资源消耗过大的问题。

核心创新

SelectStream的核心创新在于其选择性潜在记忆框架。通过惊讶驱动的自适应窗口和基于查询的图推理,模型能够在固定预算下有效管理历史信息,避免了不必要的历史信息干扰当前场景感知。

方法详解

  • �� 惊讶驱动的自适应窗口:根据视频内容的变化动态调整记忆窗口。
  • �� 优先级保留的整合:通过优先级机制选择性保留重要的历史信息。
  • �� 基于查询的图推理:根据查询条件从固定容量的潜在记忆图中提取相关信息。

实验设计

实验设计包括在StreamingBench和OVO-Bench等基准测试上进行评估,比较了SelectStream与多种基线方法的性能。实验中使用了固定的记忆和计算预算,以验证模型在不同场景下的表现。

结果分析

实验结果显示,SelectStream在StreamingBench上取得了82.67%的准确率,相比于近期窗口基线提高了2.08%。在OVO-Bench上,SelectStream在回溯追踪任务中提升了10%以上的准确率。

应用场景

SelectStream可应用于自动驾驶、实时监控等需要长时间跨度视频理解的场景。其选择性记忆机制能够在有限资源下有效处理复杂视频。

局限与展望

尽管SelectStream在多个基准测试中表现优异,但在处理极动态场景时,选择性记忆可能导致对快速变化事件的捕捉不够及时。未来的研究将着重于优化选择性记忆机制。

通俗解读 非专业人士也能看懂

想象一个图书馆,SelectStream就像是一个聪明的图书管理员。它不需要记住每一本书的细节,而是根据读者的需求,选择性地记住最重要的信息。当有人问问题时,它能快速找到相关书籍,提供准确的答案。这种方法避免了不必要的信息干扰,使得图书馆在有限的空间内仍能高效运作。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象你在玩一个超级复杂的游戏,里面有很多关卡和任务。SelectStream就像你的游戏助手,它会帮你记住每个关卡的重要信息,而不是所有细节。当你需要提示时,它会快速给你最有用的建议,让你更快通关!是不是很酷?

术语表

选择性记忆 (Selective Memory)

一种在有限资源下选择性保留重要信息的机制。

用于管理流媒体视频中的历史信息。

惊讶驱动的自适应窗口 (Surprise-driven Adaptive Window)

根据视频内容变化动态调整记忆窗口的机制。

用于决定何时写入新的记忆。

优先级保留的整合 (Priority-preserving Consolidation)

通过优先级机制选择性保留重要历史信息的方法。

用于在记忆容量有限时管理信息。

基于查询的图推理 (Query-conditioned Graph Reasoning)

根据查询条件从记忆图中提取相关信息的机制。

用于在回答查询时检索历史信息。

潜在记忆图 (Latent Memory Graph)

一种用于管理历史信息的图结构,具有固定容量。

用于存储和检索视频流中的历史信息。

开放问题 这项研究留下的未解疑问

  • 1 如何在极动态场景下优化选择性记忆机制?
  • 2 在处理超长视频时,如何突破记忆容量的限制?
  • 3 选择性记忆在其他领域的应用潜力如何?

应用场景

近期应用

自动驾驶

SelectStream可用于自动驾驶系统中,帮助车辆在复杂路况下快速决策。

实时监控

在监控系统中,SelectStream能有效管理视频数据,提升异常事件检测的准确性。

远期愿景

智能城市

SelectStream可用于智能城市的实时数据分析,优化城市资源管理。

原文摘要

Streaming video understanding models must answer queries at any moment during an ongoing stream, using only what they have observed so far and under fixed memory and computation budgets. Existing methods address this by adding memory banks, retrieval modules, or visual token compression to preserve long-range history. However, strong recent-window baselines show that indiscriminate history injection can dilute current-scene perception, suggesting that the key challenge is not whether to use memory, but how to allocate it selectively. We formulate this as budgeted online latent evidence allocation and propose \textbf{SelectStream}, a selective latent-memory framework that keeps the current observation directly visible to a frozen VLM while exposing historical information only through a compact, query-conditioned evidence budget. Three coordinated mechanisms govern when to write, what to preserve, and how to retrieve: surprise-driven adaptive windowing, priority-preserving consolidation, and query-conditioned graph reasoning over a fixed-capacity latent memory graph. Retrieved evidence is calibrated and injected as latent tokens for answer generation, without replaying frames or growing the context with stream length. Experimental results show that SelectStream achieves strong online streaming performance and preserves general video understanding, reaching 82.67\% on StreamingBench, 67.03\% on OVO-Bench, and 74.4\% average accuracy on offline video benchmarks, while outperforming strong recent-window baselines and prior streaming memory methods.

cs.CV cs.AI