FOLIO: Focused Semantic Memory for Streaming Video Understanding

TL;DR

FOLIO是一种无训练的流媒体视频语义记忆系统,结合短期视觉缓冲与长时语义组织,提升理解精度。

cs.CV 🔴 高级 2026-07-15 49 次浏览
Haoyang Fan Dhruv Parikh Anvitha Ramachandran Sameh Gobriel Nilesh Jain Rajgopal Kannan Viktor Prasanna
视频理解 流媒体 语义记忆 多模态 信息检索

核心发现

方法论

FOLIO采用基于段级更新的无训练语义记忆架构,结合动态焦点状态引导信息存储。系统由短期视觉缓冲区、长时实体中心结构化记忆和视觉证据缓存组成。通过关键帧选择和焦点状态调整,优先存储重要实体和动作,压缩背景信息。在查询时,结合结构化匹配和语义扩展实现高效检索。该方法无需训练,依赖规则和特征驱动的写入策略,有效平衡记忆成本与信息丰富性。

关键结果

  • 在OVO-Bench上,FOLIO实现82.0/69.1的感知/回溯准确率,显著优于现有方法,且在StreamingBench上达74.5%的整体准确率。系统通过优先存储焦点实体和紧凑背景,减少了内存维护成本,提升了多轮交互中的目标追踪和长时依赖能力。
  • 在多轮问答场景中,FOLIO利用前轮查询更新焦点状态,增强对目标的持续追踪,显著改善长时序理解效果。实验显示,结合语义扩展的检索策略比纯结构匹配提升约15%的准确率,验证了其有效性。
  • 消融实验表明,焦点状态引导的写入机制和结构化记忆的结合,是提升长时依赖理解和多目标追踪的关键。系统在保持低成本的同时,达到了SOTA的性能指标。

研究意义

该研究突破了流媒体视频理解中记忆组织的瓶颈,提出无需训练的焦点引导语义记忆方案,有效应对无限增长的视觉信息。其创新的结构设计和检索机制,为实时视频分析、智能监控、自动驾驶等应用提供了强大支撑。系统在保持高精度的同时,大幅降低了存储和计算成本,推动了流媒体理解技术的实用化。未来,结合多模态信息和强化学习,有望实现更智能、更高效的连续场景理解。

技术贡献

FOLIO提出了一种融合短期视觉缓冲和长时实体结构化记忆的无训练方案,创新性引入动态焦点状态引导存储策略。其核心在于基于规则的写入优先级调节和多模态检索机制,突破了传统基于帧或事件的记忆组织限制。系统实现了高效的多轮交互和长时依赖追踪,显著提升了流媒体视频理解的准确性和效率,为未来大规模在线场景理解提供了新范式。

新颖性

本研究首次提出无训练的焦点引导语义记忆体系,结合实体中心的结构化存储与动态焦点机制,有效解决了长时依赖和多目标追踪难题。不同于以往仅依赖帧、事件或缓存的方案,FOLIO通过规则驱动的写入策略实现信息的有选择性存储,兼顾效率与效果。这一创新为流媒体视频理解提供了全新思路,填补了实时长时记忆组织的研究空白。

局限性

  • 系统依赖于规则和特征设计,可能在复杂场景或极端变化中表现不佳,缺乏端到端学习能力。
  • 长时依赖的结构化记忆在极端长序列中可能仍面临信息稀释或错配风险,未来需引入自适应机制优化存储策略。
  • 系统在高动态场景下的实时性能和存储成本仍需进一步优化,特别是在多模态信息融合方面。

未来方向

未来将结合深度学习与强化学习,提升焦点状态的自适应调节能力。探索多模态信息融合,增强对复杂场景的理解能力。同时,优化存储结构以应对更长序列和多目标场景,推动系统在自动驾驶、智能监控等实际应用中的部署。

AI 总览摘要

在流媒体视频理解领域,如何高效组织和利用不断增长的视觉信息,一直是核心难题。传统方法多依赖帧缓存或事件存储,面临存储成本高、信息冗余和长时依赖难以捕获的挑战。本文提出FOLIO,一种无训练的焦点引导语义记忆系统,创新性结合短期视觉缓冲与长时实体结构化存储,通过动态焦点状态优先存储关键实体和动作,有效压缩背景信息。系统在每个视频段落中选择关键帧,利用规则驱动的写入策略,存储丰富的目标信息,并通过结构化链条追踪实体状态和关系。在查询时,结合结构化匹配和语义扩展实现高效检索,支持多轮交互中的长时依赖追踪。实验结果显示,FOLIO在OVO-Bench和StreamingBench上均超越SOTA,显著提升理解准确率,同时降低存储成本。该方法为实时视频理解提供了新思路,未来可结合多模态信息和强化学习,推动智能场景的持续理解与应用。

深度分析

研究背景

随着视频内容的丰富和复杂,流媒体视频理解逐渐成为人工智能研究的热点。早期方法多依赖全视频分析或离线模型,难以满足实时需求。近年来,诸如Video-LLMs、Hierarchical Memory和事件驱动存储等技术不断发展,解决了部分长时依赖和多目标追踪问题,但仍存在存储成本高、信息冗余和多轮交互效率低等难题。特别是在实际应用中,系统需要在有限资源下持续处理无限增长的视觉信息,保持高精度和低延迟,成为研究的核心挑战。

核心问题

核心问题在于如何在视频流不断增长的情况下,有效组织和存储关键信息,避免冗余,同时支持多轮复杂查询。传统方法多采用帧缓存或事件存储,难以兼顾信息丰富性和存储效率。长时依赖的追踪和多目标识别在高动态场景中尤为困难,尤其是在有限计算资源下实现实时响应。解决这一问题需要创新的存储策略和高效的检索机制,以实现长时记忆的有选择性存储和快速访问。

核心创新

本研究的创新点主要在于:1)提出无训练的焦点引导语义记忆,通过动态焦点状态优先存储重要实体和动作,提升记忆效率;2)结合短期视觉缓冲与长时结构化记忆,兼顾实时性与长时依赖;3)采用规则驱动的写入策略,避免无差别存储带来的成本增加;4)引入轻量级的结构化检索和语义扩展,提升多轮交互中的目标追踪能力。这些创新共同解决了长时依赖和多目标管理的难题,为流媒体视频理解提供了新范式。

方法详解

  • �� 视频流按段划分,逐段处理;
  • �� 每段选择关键帧,结合动态焦点状态调整存储优先级;
  • �� 由写入VLM生成结构化实体和动作记录,存入长时记忆链;
  • �� 结构化记忆包括实体身份、位置、关系、状态等信息;
  • �� 视觉证据缓存存储关键帧,支持后续恢复;
  • �� 查询时,结构化匹配结合语义扩展,快速定位目标;
  • �� 多轮交互中,前轮查询更新焦点状态,持续追踪目标;
  • �� 规则驱动写入策略,平衡信息丰富性和存储成本。

实验设计

采用OVO-Bench和StreamingBench两个公开数据集,评估感知和回溯准确率。对比多种SOTA模型,验证FOLIO在多轮长时依赖和目标追踪中的优越性。设置不同的存储参数和焦点策略,进行消融分析。指标包括准确率、存储成本和响应时间,确保系统在保持高性能的同时,具备良好的实时性和扩展性。

结果分析

FOLIO在OVO-Bench达到82.0/69.1的感知/回溯准确率,超越现有模型,且在StreamingBench上达74.5%的整体准确率。多轮问答中,结合焦点状态和语义扩展的检索策略,提升目标追踪和长时依赖理解能力。消融实验显示,焦点引导和结构化记忆的结合,是性能提升的关键。系统在降低存储成本的同时,实现了长时依赖的高效管理。

应用场景

该系统适用于自动驾驶、智能监控、机器人助手等场景,能够实时理解复杂场景中的目标和事件。只需有限的存储资源,便可实现长时间连续监控和多轮交互,极大提升场景感知能力。未来,可结合多模态信息和强化学习,推动智能场景的持续理解和应用创新。

局限与展望

系统在极端动态或复杂场景下,焦点状态可能难以准确更新,导致信息遗漏或误追踪。规则驱动的存储策略依赖手工设计,缺乏自适应能力。此外,长时记忆的扩展仍面临存储瓶颈,未来需引入学习机制优化存储策略和多模态融合。

通俗解读 非专业人士也能看懂

想象你在一个厨房里做饭。每次你准备食材时,只会记住重要的步骤,比如切菜、炒菜,而背景的细节,比如桌子上的调料、碗碟,都会尽量简化记忆。当你需要告诉朋友你做了什么菜时,你会重点描述关键的步骤和主要食材,而不是每个细节都记得。这就像FOLIO系统一样,它会优先存储重要的实体和动作,把背景信息压缩,确保在需要时能快速找到关键内容。这样既节省空间,又能快速回答问题。

简单解释 像给14岁少年讲一样

想象你在看一场足球比赛,你只记住了关键的事情,比如谁进了球、谁在跑、裁判的判罚。其他细节,比如场边的广告牌、观众的反应,虽然也在场,但你不会一直记得全部。每当有人问你比赛的情况,你会重点说出那些重要的瞬间和人物,而不是所有细节。这就像FOLIO一样,它会专注于重要的目标,比如球员和动作,把其他背景信息压缩存储。这样,你就能在比赛结束后,快速告诉别人比赛的精彩瞬间,而不用记住所有琐碎的细节。

术语表

结构化记忆 (Structured Memory)

一种按实体、动作、关系组织的记忆方式,便于长时追踪和检索。

用于存储视频中目标的状态和关系。

焦点状态 (Focus State)

动态调整的优先级指标,用于引导存储重要实体和动作。

决定存储资源的分配。

视觉证据缓存 (Visual Evidence Cache)

存储关键帧的缓存,用于后续恢复和验证。

支持检索和问答。

无训练系统 (Training-free System)

无需端到端训练,通过规则和特征驱动的机制实现目标。

系统设计的核心思想。

多轮交互 (Multi-turn Interaction)

多次问答过程中,前轮信息影响后续存储和检索。

实现长时依赖追踪。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步自适应焦点状态以应对极端动态场景?
  • 2 多模态信息融合在长时记忆中的应用潜力?
  • 3 系统在超长序列中的性能极限和优化策略?

应用场景

近期应用

智能监控

实时追踪多个目标,压缩存储关键事件,提升监控效率。

自动驾驶

理解道路场景中的关键目标和动作,支持决策与反应。

远期愿景

场景理解的普适平台

结合多模态信息,实现连续、全场景的智能理解,推动自动化和智能化发展。

原文摘要

In online streaming video understanding, a video stream continues to arrive and queries may be issued at any time. Because streaming frames grow without bound, the system must continuously compress and retain information from the observed video prefix while future frames and future queries remain unknown. The core challenge is deciding what information to retain and how to organize the maintained history: as this history grows with the stream, memory cost increases and many redundant visual details are retained, whereas later queries often depend on specific entities, actions, and their temporal changes. To address this challenge, we introduce FOLIO, a training-free focused semantic memory system that records important parts of the stream in higher detail while keeping surrounding context compact. As the stream arrives, FOLIO updates memory at the segment level, guided by a dynamic focus state, combining a short-term visual buffer with a long-term semantic memory organized around observed entities and linked to a visual-evidence cache. At query time, lightweight hybrid retrieval combines direct matching over the structured memory with semantic query expansion. FOLIO achieves state-of-the-art performance, reaching 82.0/69.1 Perception/Backward accuracy on OVO-Bench with Qwen3-VL-8B and 74.5 overall accuracy on StreamingBench, while substantially reducing the cost of maintaining streaming memory by reserving detailed records for focused entities and storing surrounding context compactly.

cs.CV