Reasoning as Intersection: Consensus-Frame Alignment for Visual Focus in Video-MLLMs

TL;DR

引入CF-GRPO框架,通过共识帧奖励提升视频推理性能,显著提高了多个基准测试的表现。

cs.CV 🔴 高级 2026-06-17 25 次浏览
Chengwen Liu Zhe Huang Jisheng Dang Hong Peng Qi Tian Tat-Seng Chua
视频推理 多模态模型 强化学习 帧对齐 无注释

核心发现

方法论

该研究提出了一种名为CF-GRPO的框架,结合多源信号构建共识帧先验,包括时间覆盖、场景转换和查询相关性。然后通过共识帧奖励(CFR)优化模型的帧使用分数,使其与共识先验一致。该方法无需人工时间注释,提供了高对比度的奖励信号。

关键结果

  • 在VideoMMMU基准测试中,32帧模型实现了52.4%的准确率,比Video-R1-7B提高了5.2%。
  • 在VideoMME基准测试中,从16帧增加到64帧,准确率从55.1%提高到61.1%。
  • 消融实验表明,共识先验、稀疏聚合和锐化对最终性能都有贡献。

研究意义

该研究通过引入共识帧奖励,显著提高了视频多模态大语言模型在复杂视频推理任务中的表现。这种方法不仅提高了模型的准确性,还为视频推理提供了可解释的证据框架,解决了传统方法中监督信号不足的问题。

技术贡献

CF-GRPO框架在视频推理中引入了过程级奖励信号,区别于现有方法仅依赖答案正确性或时间一致性。该方法通过多源信号构建共识帧先验,提供了新的理论保证和工程可能性。

新颖性

这是首个在视频推理中引入共识帧奖励的研究,区别于以往方法,该方法无需人工时间注释,通过多源信号自动生成帧级奖励。

局限性

  • 在某些基准测试中,增加帧数未必总是带来性能提升,可能与任务类型和帧预算有关。
  • 该方法在处理超长视频时可能会遇到计算资源的限制。

未来方向

未来研究可以探索如何在更大规模的视频数据集上应用CF-GRPO框架,并结合其他多模态信号以进一步提高性能。

AI 总览摘要

近年来,强化学习在提升大语言模型的推理能力方面取得了显著进展。然而,现有方法在视频多模态大语言模型中应用时,往往仅依赖于结果的正确性,缺乏对视觉证据的具体指导。为此,研究人员提出了一种名为CF-GRPO的新框架,通过共识帧奖励机制,提升视频推理的性能。

CF-GRPO框架通过多源信号构建共识帧先验,包括时间覆盖、场景转换和查询相关性。然后,通过共识帧奖励优化模型的帧使用分数,使其与共识先验一致。实验结果表明,该方法在多个复杂视频推理基准测试中取得了优异的表现,显著提高了模型的准确性。

尽管该方法在多个基准测试中表现出色,但在处理超长视频时可能会遇到计算资源的限制。未来研究可以探索如何在更大规模的数据集上应用该框架,并结合其他多模态信号以进一步提高性能。

深度分析

研究背景

近年来,随着多模态大语言模型的快速发展,视频推理成为一个重要的研究领域。现有方法主要依赖于答案的正确性和时间一致性,但在处理复杂视频推理任务时,往往缺乏对视觉证据的具体指导。

核心问题

视频推理任务中的一个核心问题是如何有效地选择和利用视频帧中的视觉证据。传统方法往往依赖于人工注释或简单的帧选择策略,难以适应复杂的视频场景。

核心创新

CF-GRPO框架通过引入共识帧奖励,提供了一种无需人工时间注释的过程级奖励信号。该方法结合多源信号构建共识帧先验,包括时间覆盖、场景转换和查询相关性。

方法详解

  • �� 构建共识帧先验:结合时间覆盖、场景转换和查询相关性。
  • �� 计算模型侧帧使用分数:通过视觉和响应表示的相似性。
  • �� 优化共识帧奖励:通过稀疏聚合和分布锐化。

实验设计

实验在多个视频推理基准测试上进行,包括VideoMMMU、VideoMME等。使用的评估指标包括准确率、时间一致性等。实验设计还包括消融实验,以验证各组件的贡献。

结果分析

实验结果表明,CF-GRPO在多个基准测试中取得了优异的表现。例如,在VideoMMMU基准测试中,32帧模型实现了52.4%的准确率,比现有方法提高了5.2%。

应用场景

该方法可应用于视频问答、视频内容分析等场景,尤其适用于需要复杂推理的视频任务。

局限与展望

尽管CF-GRPO在多个基准测试中表现出色,但在处理超长视频时可能会遇到计算资源的限制。此外,增加帧数未必总是带来性能提升,可能与任务类型和帧预算有关。

通俗解读 非专业人士也能看懂

想象你在看一部电影,电影中有很多场景和细节。为了理解故事,你需要关注关键的场景,而不是每一个细节。CF-GRPO就像一个聪明的助手,它能帮你找到这些关键场景,让你更好地理解电影的情节。它通过分析电影中的各种线索,比如场景的变化和与剧情相关的细节,来决定哪些场景是最重要的。这样,你就能更快、更准确地理解整个故事,而不需要看完整部电影。

简单解释 像给14岁少年讲一样

想象一下你在玩一个复杂的游戏,游戏中有很多关卡和任务。CF-GRPO就像一个超级助手,它能帮你找到游戏中最重要的线索,让你更容易过关。它会分析游戏中的各种提示,比如场景的变化和任务的要求,然后告诉你哪些线索是最重要的。这样,你就能更快地完成任务,而不需要浪费时间在不重要的细节上。

术语表

CF-GRPO (共识帧GRPO)

一种用于视频推理的过程级奖励框架,通过共识帧奖励优化模型的帧使用分数。

用于提升视频多模态大语言模型的推理性能。

CFR (共识帧奖励)

一种奖励机制,通过优化模型的帧使用分数与共识帧先验的一致性来提升推理性能。

在CF-GRPO框架中用于提供高对比度的奖励信号。

多模态模型

结合多种数据模态(如文本、图像、视频)的模型,用于复杂任务的推理和分析。

视频多模态大语言模型用于视频推理任务。

帧对齐

在视频推理中,选择和利用关键帧以支持生成的答案。

通过共识帧奖励实现帧对齐。

强化学习

一种机器学习方法,通过奖励信号优化模型的决策策略。

用于优化视频多模态大语言模型的推理性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在超长视频中有效应用CF-GRPO框架,特别是在计算资源有限的情况下。
  • 2 如何结合其他多模态信号以进一步提高视频推理性能。

应用场景

近期应用

视频问答系统

通过CF-GRPO框架提升视频问答系统的准确性和效率,适用于教育和娱乐领域。

远期愿景

自动视频分析

在自动驾驶和智能监控中应用CF-GRPO框架,实现更高效的视频内容分析。

原文摘要

Reinforcement learning has improved the reasoning ability of large language models, but applying outcome-only rewards to video multimodal large language models (Video-MLLMs) provides limited guidance on which visual evidence should support the answer. Inspired by multisensory integration, where consistent cues can enhance the salience and reliability of perceptual estimates, we introduce Consensus Frame GRPO (CF-GRPO), a temporal-annotation-free process-level reward framework for evidence-aware video reasoning. CF-GRPO constructs a consensus frame prior from intrinsic video cues, including temporal coverage, scene-transition cues, and query-conditioned visual relevance. It then computes a model-side frame-use score from visual and response representations and optimizes their agreement through the Consensus Frame Reward (CFR). With salience-aware sparse aggregation and distribution sharpening, CFR provides a high-contrast reward signal without requiring human temporal annotations. Experiments show that VideoCFR achieves competitive performance across complex video reasoning benchmarks and improves several metrics over representative Video-MLLM and RL baselines, while the consensus prior provides an interpretable view of the evidence frames emphasized during training. The implementation is available at https://github.com/1Pansy/VideoCFR.

cs.CV