ReQuest: Rethinking-based Question-Aware Frame Selection for Long-Form Video QA

TL;DR

ReQuest通过不确定性驱动的关键帧选择提高长视频问答准确率。

cs.CV 🔴 高级 2026-07-02 4 次浏览
Minkuk Kim Suyong Yun Young Tae Kim Jinyoung Moon Jinwoo Choi Seong Tae Kim
视频问答 多模态模型 关键帧选择 不确定性 长视频

核心发现

方法论

ReQuest通过轻量级问题感知选择器、再思考路由和不确定性引导的自适应非最大抑制实现关键帧选择。选择器从MLLM生成的监督中提取,路由根据模型不确定性触发额外推理,抑制策略根据问题难度调整帧间距。

关键结果

  • 在Video-MME上,ReQuest将准确率从62.6%提高到65.6%,尤其在中长视频上表现突出,分别提高到64.1%和55.8%。
  • 在MLVU和LongVideoBench上,准确率分别提升至73.9%和60.1%,展示了跨基准的泛化能力。
  • 通过自适应非最大抑制策略,ReQuest在长视频中有效地选择信息丰富的帧。

研究意义

ReQuest显著提升了长视频问答的准确性和效率,解决了传统方法在固定输入令牌预算下的证据定位困难。其创新的关键帧选择机制为多模态大语言模型在长视频理解领域提供了新的思路。

技术贡献

ReQuest无需修改或微调底层MLLM,通过插件方式提高长视频问答性能。其不确定性驱动的选择机制提供了新的理论保证和工程可能性。

新颖性

ReQuest首次结合不确定性驱动的选择策略与问题感知选择器,显著提高了长视频问答的效率和准确性。

局限性

  • 在某些复杂场景中,选择器可能无法准确识别关键帧,导致推理失败。
  • 对视频长度的依赖可能影响模型在极长视频中的性能。

未来方向

未来可以探索如何进一步优化选择器的性能,尤其是在极长视频中的表现,以及结合其他多模态信息提高问答质量。

AI 总览摘要

长视频问答一直是多模态大语言模型面临的挑战。传统方法在固定输入令牌预算下难以有效定位证据,导致信息丢失。ReQuest通过不确定性驱动的关键帧选择机制,结合轻量级问题感知选择器和再思考路由,显著提高了长视频问答的准确性和效率。

ReQuest的选择器从MLLM生成的监督中提取,能够根据问题意图选择相关视频内容。再思考路由在模型不确定时触发额外推理,确保选择的帧能够提供丰富的语义信息。

实验结果表明,ReQuest在Video-MME、MLVU和LongVideoBench上均取得了显著的准确率提升,尤其在中长视频上表现优异。其创新的选择机制为长视频理解提供了新的思路,同时保持了竞争性的计算成本。

深度分析

研究背景

随着多模态大语言模型的发展,视频问答领域取得了显著进展。然而,长视频问答仍面临挑战,特别是在固定输入令牌预算下的证据定位问题。传统方法通常采用均匀采样,但容易错过关键证据。

核心问题

长视频问答的核心问题在于如何在有限的令牌预算下有效定位证据。均匀采样往往无法捕捉关键帧,导致信息丢失,影响问答准确性。

核心创新

ReQuest通过不确定性驱动的关键帧选择机制,结合轻量级问题感知选择器和再思考路由,解决了长视频问答中的证据定位问题。其创新在于结合不确定性驱动的选择策略与问题感知选择器,提高了效率和准确性。

方法详解

  • �� 轻量级问题感知选择器:从MLLM生成的监督中提取,能够根据问题意图选择相关视频内容。
  • �� 再思考路由:在模型不确定时触发额外推理,确保选择的帧能够提供丰富的语义信息。
  • �� 自适应非最大抑制:根据问题难度调整帧间距,选择时空多样的帧。

实验设计

在Video-MME、MLVU和LongVideoBench上进行实验,使用LLaVA-Video作为基线模型。通过在1fps采样的帧上进行编码,训练选择器以回归伪目标。实验结果表明,ReQuest显著提高了问答准确性。

结果分析

ReQuest在Video-MME上将准确率从62.6%提高到65.6%,在MLVU和LongVideoBench上分别提升至73.9%和60.1%。其选择机制有效地选择了信息丰富的帧,展示了跨基准的泛化能力。

应用场景

ReQuest可用于视频问答系统,尤其适用于需要处理长视频的场景,如教育视频分析和影视内容检索。

局限与展望

ReQuest在某些复杂场景中可能无法准确识别关键帧,导致推理失败。此外,对视频长度的依赖可能影响模型在极长视频中的性能。

通俗解读 非专业人士也能看懂

想象你在看一部长电影,需要回答一些关于电影内容的问题。传统方法就像每隔几分钟截取一个画面,这样可能会错过关键情节。ReQuest就像一个聪明的助手,它会根据问题的内容选择最相关的画面,并在不确定时重新思考,确保你能得到正确答案。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个超级长的游戏,需要回答一些关于游戏的问题。传统的方法就像每隔几分钟截个屏,可能会错过关键的游戏情节。ReQuest就像一个聪明的助手,它会根据问题选择最相关的游戏画面,并在不确定时重新思考,确保你能赢得比赛!

术语表

ReQuest (请求)

一种用于长视频问答的关键帧选择机制,结合不确定性驱动的选择策略与问题感知选择器。

在论文中用于提高长视频问答的准确性。

MLLM (多模态大语言模型)

结合视觉和文本输入进行高层次推理的模型。

用于视频问答的基础模型。

关键帧选择 (Key Frame Selection)

从视频中选择最相关的帧以提高问答准确性的方法。

ReQuest的核心机制。

再思考路由 (Re-thinking Routing)

在模型不确定时触发额外推理的机制。

用于确保选择的帧提供丰富的语义信息。

自适应非最大抑制 (Adaptive NMS)

根据问题难度调整帧间距的选择策略。

用于选择时空多样的帧。

开放问题 这项研究留下的未解疑问

  • 1 如何在极长视频中进一步优化选择器的性能仍是一个开放问题。
  • 2 如何结合其他多模态信息提高问答质量仍需探索。

应用场景

近期应用

教育视频分析

通过选择关键帧提高教育视频问答系统的准确性。

远期愿景

影视内容检索

通过智能选择关键帧实现影视内容的高效检索。

原文摘要

Recent multimodal large language models (MLLMs) have substantially advanced video understanding, yet long-form video QA remains challenging under fixed input token budgets, where uniform sampling can be inefficient for evidence localization. We propose ReQuest , an uncertainty-driven, question-adaptive keyframe selection pipeline that aligns question intent with relevant video content through selective computation. ReQuest integrates (i) a lightweight question-aware selector distilled from MLLM-generated supervision, (ii) Re-thinking Routing that triggers additional inference only when the model is uncertain with a length-adaptive criterion, and (iii) uncertainty-guided adaptive non-maximum suppression that selects temporally diverse frames while adjusting spacing based on question difficulty. As a plug-andplay method, ReQuest improves long-video QA without modifying or fine-tuning the underlying MLLM. Experiments on Video-MME, MLVU, and LongVideoBench demonstrate consistent accuracy gains with competitive computational cost, with particularly strong improvements in medium and long video regimes.

cs.CV