ReaSon: Reinforced Causal Search with Information Bottleneck for Video Understanding

TL;DR

ReaSon利用因果信息瓶颈优化关键帧选择,显著提升视频理解性能。

cs.CV 🔴 高级 2025-11-16 63 次浏览
Yuan Zhou Litao Hua Shilong Jin Wentao Huang Haoran Duan
视频理解 因果推断 信息瓶颈 强化学习 关键帧选择

核心发现

方法论

ReaSon框架结合可学习策略网络与因果信息瓶颈(CIB),实现关键帧的预测充分性与因果必要性评估。模型由两个模块组成:预测充分性模块通过视觉元素检测与候选帧筛选,利用变分推断近似互信息,优化帧的代表性;因果必要性模块通过反事实干预,衡量帧对输出的因果依赖,采用对抗性策略估算因果信息。强化学习中的复合奖励函数引导策略网络在有限帧数下找到最具代表性与因果决定性的关键帧,提升视频推理的准确性与效率。

关键结果

  • 在NExT-QA数据集上,ReaSon以8帧设置达到了81.4%的准确率,优于现有最优方法的78.1%,提升3.3%。在EgoSchema上,ReaSon以8帧实现72.2%,超越T*的66.6%。在长视频数据集Video-MME中,采用GPT-4o模型,ReaSon在有限帧条件下达到了66.4%的整体准确率,比未使用选择策略的模型提升了约10%。多场景验证显示其在因果推断和有限信息条件下的优越性。
  • 结果显示,结合因果信息瓶颈的策略显著优于纯视觉相关方法,尤其在因果推理和长视频理解中表现出强大优势。 Ablation研究验证了预测充分性与因果必要性模块的贡献,单独使用任何一项都无法达到最佳性能。不同VLM模型的迁移实验也表明,ReaSon具有良好的泛化能力,能在多种视频理解任务中稳定提升性能。
  • 该方法在提升视频理解效率的同时,增强了模型的因果推理能力,为未来基于因果关系的视觉理解提供了新思路。

研究意义

ReaSon的提出突破了传统帧选择仅依赖视觉相关性的局限,通过引入因果信息瓶颈,有效捕获视频中的因果结构,极大改善了有限帧条件下的推理准确性。这不仅推动了视频理解技术的发展,也为视觉推理、因果推断在复杂场景中的应用提供了理论基础。其结合强化学习的策略设计,为未来自主学习高效关键帧提供了新范式,具有重要的学术价值和工业应用潜力,特别是在资源受限的边缘计算和实时监控场景中。

技术贡献

本研究提出了基于因果信息瓶颈的关键帧选择新框架,创新性地将因果推断引入视频理解中的信息压缩与选择问题。模型通过两个模块分别优化预测充分性和因果必要性,利用变分推断与反事实干预实现互信息的近似计算。引入强化学习中的复合奖励函数,有效引导策略网络在有限帧数下找到最具因果决定性的关键帧。该方法在理论上结合了信息瓶颈与因果推断的优势,突破了传统相关性驱动的帧选择限制,提供了更具因果解释性的模型架构。实验验证显示其在多个公开数据集上均优于现有最先进方法,具有良好的迁移性和泛化能力。

新颖性

该工作首次将因果信息瓶颈(CIB)引入视频关键帧选择,系统性地结合预测充分性与因果必要性,提出了可训练的强化学习策略。相比以往仅关注视觉相关性的帧筛选方法,ReaSon强调因果结构的建模,解决了传统方法忽视因果关系导致的推理不足问题。其创新点在于引入反事实干预评估帧的因果贡献,结合变分推断与强化学习,形成一个理论严密、效果显著的关键帧选择框架。这在视频理解领域具有开创性意义,为未来因果推断与视觉推理的结合提供了新思路。

局限性

  • 模型在极端长视频或高复杂度场景中,因反事实干预计算成本较高,可能影响实时性。部分场景下对视觉元素检测的依赖也可能引入误差,影响因果推断的准确性。此外,当前方法在多模态信息融合方面仍有提升空间,未来需结合多源信息增强鲁棒性。

未来方向

未来将探索更高效的因果推断算法,降低反事实干预的计算成本。同时,结合多模态信息(如声音、文本)丰富关键帧的因果结构建模,提升复杂场景下的推理能力。还计划引入自监督学习策略,增强模型的泛化能力与鲁棒性,推动因果推断在视频理解中的广泛应用。

AI 总览摘要

视频理解面临输入信息有限和时间跨度长带来的挑战,传统方法多依赖视觉相关性筛选关键帧,但忽视了因果关系的重要性。ReaSon提出一种基于因果信息瓶颈的关键帧选择策略,结合强化学习,显著提升在有限帧条件下的推理准确性。

该方法由预测充分性模块和因果必要性模块组成。前者通过视觉元素检测筛选候选帧,利用变分推断优化互信息,确保所选帧能支持正确推理;后者通过反事实干预衡量帧的因果贡献,确保所选帧的因果必要性。强化学习中的复合奖励引导模型在有限帧数内找到最具代表性和因果决定性的关键帧,兼顾效率和推理质量。

在多个公开数据集上的实验结果充分验证了ReaSon的优越性。它在NExT-QA、EgoSchema和Video-MME等任务中均优于现有最先进方法,特别是在因果推理和长视频理解方面表现突出。该研究不仅推动了视频理解技术的发展,也为因果推断在视觉任务中的应用提供了新思路,具有重要的学术和工业价值。未来,结合多模态信息和更高效的因果推断算法,将进一步拓展其应用场景和性能潜力。

深度分析

研究背景

视频理解作为人工智能的重要方向,经历了从基于特征提取到深度学习模型的快速发展。早期方法如动作识别和场景理解依赖手工特征,近年来深度卷积神经网络(CNN)和Transformer模型推动了性能提升。Vision-language模型(VLMs)如CLIP、Florence等,结合视觉与文本信息,极大增强了多模态理解能力。尽管如此,视频数据的高冗余和时间跨度长带来了计算瓶颈,关键帧选择成为提升效率的关键。现有方法多关注视觉相关性或语义匹配,诸如Wang et al.(2024)提出的VideoAgent、Ye et al.(2025)提出的T*等,虽在一定程度上改善了效率,但忽视了因果关系的重要性,导致推理的鲁棒性不足。因果推断逐渐成为研究热点,但其在视频理解中的系统性应用尚处于起步阶段。ReaSon试图弥补这一空白,将因果推断引入关键帧选择,旨在提升模型的推理深度和解释能力。

核心问题

传统视频理解方法多依赖视觉相关性指标筛选关键帧,容易受到冗余信息干扰,忽视了因果关系的作用。这导致模型在复杂推理任务中表现不佳,尤其在有限帧数限制下,推理准确率明显下降。现有方法缺乏对因果结构的建模,难以捕获事件的因果链条,限制了模型的推理深度和泛化能力。此外,长视频中的信息冗余和计算成本过高,也成为瓶颈。如何在保证信息充分的同时,筛选出具有因果决定性的关键帧,成为亟待解决的问题。

核心创新

ReaSon的核心创新在于引入因果信息瓶颈(CIB),系统性地结合预测充分性与因果必要性,优化关键帧选择。具体包括:

  • �� 设计可训练的策略网络,通过强化学习在候选帧池中选择最具代表性和因果决定性的帧。
  • �� 利用变分推断近似互信息,确保所选帧能支持准确推理。
  • �� 引入反事实干预,评估帧的因果贡献,确保所选帧的因果必要性。
  • �� 设计复合奖励函数,结合答案正确性、语义一致性和因果干预效果,指导策略优化。
  • �� 通过多任务训练,实现模型在有限帧条件下的高效推理,突破传统相关性驱动的限制。该框架在理论上结合了信息瓶颈与因果推断的优势,显著提升了视频理解的深度和解释性。

方法详解

  • �� 以视频V和问题Q为输入,构建候选帧池,通过视觉元素检测筛选候选帧。
  • �� 使用变分推断近似互信息I(S; O),优化所选帧S的代表性,确保预测充分性。
  • �� 设计策略网络πθ(S|F,Q),在候选池中采样关键帧子集,限制最大数量K。
  • �� 通过VLM模型生成答案,并用二元奖励Rans衡量答案正确性。
  • �� 引入循环一致性奖励Rcycle,确保语义一致性。
  • �� 反事实干预策略通过逆转选择概率,采样对比帧子集s′,估算因果必要性,奖励Rcf衡量输出变化。
  • �� 结合上述奖励,定义复合奖励R,利用策略梯度方法训练πθ,优化关键帧选择。

实验设计

  • �� 在NExT-QA、EgoSchema和Video-MME三个公开数据集上进行训练和评估,验证模型的泛化能力。
  • �� 采用不同VLM模型(如LLaVA-Video-7B、GPT-4o)进行多场景测试,确保方法的适应性。
  • �� 设置候选帧池大小和最大选择数,调节超参数λ1、λ2,进行参数敏感性分析。
  • �� 进行消融实验,验证预测充分性与因果必要性模块的贡献。
  • �� 与多种非选择和帧选择方法对比,突出ReaSon的性能优势。
  • �� 评估指标主要为准确率,特别关注因果推理和长视频理解的表现。

结果分析

  • �� 在NExT-QA上,ReaSon以8帧实现81.4%的准确率,优于AKEYS的78.1%,提升3.3%。
  • �� 在EgoSchema上,ReaSon达72.2%,超越T*的66.6%,表现出色。
  • �� 在Video-MME长视频任务中,采用GPT-4o模型,66.4%的整体准确率比未筛选模型提升约10%。
  • �� Ablation研究显示,加入因果必要性模块后,性能提升明显,验证了其关键作用。
  • �� 多模型迁移实验表明,ReaSon具有良好的泛化能力,能在不同VLM和任务中持续提升性能。

应用场景

  • �� 该方法可应用于视频问答、事件检测、视频摘要等场景,尤其适合资源受限环境中的实时推理。
  • �� 在智能监控、自动驾驶等领域,通过筛选因果决定性帧,提高推理效率和准确性。
  • �� 长期来看,结合多模态信息和自监督学习,将推动自主学习系统在复杂场景中的应用,实现更智能的视觉推理。

局限与展望

  • �� 反事实干预计算成本较高,影响实时性,尤其在超长视频或高复杂度场景中。• 视觉元素检测的误差可能影响因果推断的准确性。• 当前模型对多模态信息融合仍有提升空间,未来需增强鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在厨房准备一顿饭。你需要挑选一些关键的食材(关键帧),这些食材既要能保证菜肴的味道(预测充分性),又不能太多,否则会浪费(因果必要性)。传统方法只看食材的外观是否新鲜(视觉相关性),但可能遗漏了决定味道的关键调料(因果关系)。ReaSon就像一个聪明的厨师,不仅挑选看起来新鲜的食材,还会考虑哪些调料真正影响了菜的味道。它会用一种“假设试验”的方法,试试少放某个调料,看味道是否变差(反事实干预),确保每个调料都不可或缺。这样,做出来的菜既好吃,又不浪费食材。这个方法帮我们在复杂的厨房中找到最重要的调料,让菜变得更美味,也更高效。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,目标是拼出一幅完整的图片。很多拼图片段看起来都差不多,但只有一些是真正决定图片内容的关键部分。传统的方法就像只看颜色相似的拼图片段,觉得它们很重要,但其实有些颜色相似的段落并不能帮你拼出完整的图片。而ReaSon就像一个聪明的朋友,他会用一种特殊的办法,试着把一些关键的拼图片段拿掉,看看图片是否还完整。如果图片变得不完整了,说明这些段落是关键的;如果还完整,说明它们不是那么重要。这样,他就能找到最重要的拼图片段,帮你更快更好地拼出完整的图片。这个方法让拼图变得更聪明,也更快,特别是在图片很多、难度很大的时候。

原文摘要

Keyframe selection has become essential for video understanding with vision-language models (VLMs) due to limited input tokens and the temporal sparsity of relevant information across video frames. Video understanding often relies on effective keyframes that are not only informative but also causally decisive. To this end, we propose Reinforced Causal Search with Information Bottleneck (ReaSon), a framework that formulates keyframe selection as an optimization problem with the help of a novel Causal Information Bottleneck (CIB), which explicitly defines keyframes as those satisfying both predictive sufficiency and causal necessity. Specifically, ReaSon employs a learnable policy network to select keyframes from a visually relevant pool of candidate frames to capture predictive sufficiency, and then assesses causal necessity via counterfactual interventions. Finally, a composite reward aligned with the CIB principle is designed to guide the selection policy through reinforcement learning. Extensive experiments on NExT-QA, EgoSchema, and Video-MME demonstrate that ReaSon consistently outperforms existing state-of-the-art methods under limited-frame settings, validating its effectiveness and generalization ability.

cs.CV