Natural-Language Temporal Grounding in Hour-Long Videos is a Search Problem: A Benchmark and Empirical Decomposition

TL;DR

ExtremeWhenBench基准测试表明,长视频的自然语言时间定位是一个搜索问题,检索-定位混合方法性能提升6.7倍。

cs.CV 🔴 高级 2026-06-11 3 次浏览
Sukmin Seo Geewook Kim
自然语言处理 视频分析 时间定位 长视频 基准测试

核心发现

方法论

研究提出了ExtremeWhenBench,这是一个用于长视频自然语言时间定位的开源基准。方法论包括检索-定位分解,首先通过查询条件检索长时间上下文,然后在短窗口内进行定位。该方法类似于开放领域问答中的检索-阅读分解。

关键结果

  • 检索-定位混合方法在长视频上比单一Video-LLM性能提升6.7倍,mIoU达到0.354。
  • 在Charades-STA基准上,CLIP检索基线的mIoU为0.332,而在长视频上为0.269,超过所有开放Video-LLM。
  • Qwen3.5-9B在长视频上的mIoU从0.022提升到0.110,表明上下文覆盖是瓶颈。

研究意义

该研究显著推动了长视频自然语言时间定位领域的发展。通过将问题分解为搜索和定位两个阶段,研究揭示了长视频中搜索的重要性。这一发现对学术界和工业界都有重要影响,尤其是在需要处理长视频内容的应用中。

技术贡献

技术贡献包括开发了第一个长视频自然语言时间定位的开源基准ExtremeWhenBench,并提出了检索-定位分解方法。该方法在长视频中有效地解决了搜索瓶颈问题,提供了新的工程可能性。

新颖性

这是首次在长视频中进行自然语言时间定位的系统研究。与现有短视频基准不同,该研究提供了长视频的开放形式查询和公开访问,显著扩展了研究范围。

局限性

  • 当前方法依赖于单一的VLM进行1fps的字幕流生成,可能导致偏差。
  • 基准测试继承了LVBench等的题材分布,可能不适用于自我中心或监控内容。

未来方向

未来工作可以探索更强的时间感知检索器,以提高检索-定位混合方法的mIoU上限。此外,研究可以扩展到不同类型的视频内容中。

AI 总览摘要

长视频的自然语言时间定位是一个复杂的问题,现有的短视频基准无法有效解决。研究提出了ExtremeWhenBench,这是第一个用于长视频的开放基准,包含2273个查询和194个视频。通过检索-定位分解方法,研究揭示了长视频中搜索的重要性。实验结果表明,检索-定位混合方法在长视频上性能提升6.7倍,超过所有开放Video-LLM。该研究为长视频内容的处理提供了新的视角,具有重要的学术和实际意义。未来工作可以探索更强的时间感知检索器,以进一步提高性能。

深度分析

研究背景

随着视频内容的增长,自然语言时间定位成为一个重要的研究领域。现有的短视频基准,如Charades-STA和ActivityNet,无法有效处理长视频中的复杂查询。

核心问题

长视频的自然语言时间定位面临搜索和识别的双重挑战。现有方法在长视频中容易失败,主要是因为搜索空间过大。

核心创新

研究提出了ExtremeWhenBench,这是第一个用于长视频的开放基准。通过检索-定位分解方法,研究有效地解决了长视频中的搜索瓶颈问题。

方法详解

  • �� 使用Qwen3-VL-8B生成1fps字幕流
  • �� 通过GPT-5.1进行视觉边界验证
  • �� 使用CLIP进行查询条件检索
  • �� 在短窗口内进行定位

实验设计

实验使用了ExtremeWhenBench基准,包含2273个查询和194个视频。基线包括CLIP和多种Video-LLM,评估指标为mIoU。

结果分析

检索-定位混合方法在长视频上mIoU达到0.354,比单一Video-LLM提升6.7倍。CLIP检索基线在长视频上超过所有开放Video-LLM。

应用场景

该方法可用于长视频内容的自动标注和分析,尤其是在教育和媒体领域。

局限与展望

方法依赖于单一VLM进行字幕生成,可能导致偏差。基准测试的题材分布可能不适用于所有类型的视频内容。

通俗解读 非专业人士也能看懂

想象你在一个巨大的图书馆中寻找一本书。传统方法就像在每个书架上逐本查找,而新方法则是先用关键词搜索找到可能的书架,然后在这些书架上仔细查找。这种方法大大缩短了查找时间,尤其是在书架数量庞大的情况下。

简单解释 像给14岁少年讲一样

想象你在玩一个超级大的捉迷藏游戏。你需要找到一个朋友,但他可能藏在一个巨大的公园里。你可以先用望远镜找到可能的区域,然后再去这些区域仔细寻找。这种方法让你更快找到朋友!

术语表

ExtremeWhenBench (极限时间基准)

一个用于长视频自然语言时间定位的开源基准,包含2273个查询和194个视频。

用于评估长视频中的自然语言时间定位性能。

Video-LLM (视频大语言模型)

用于处理视频和自然语言的模型,能够理解和生成视频内容的描述。

研究中评估了多种Video-LLM的性能。

CLIP (对比语言-图像预训练)

一种用于图像和文本匹配的模型,通过对比学习进行训练。

作为基线用于长视频的查询条件检索。

mIoU (平均交并比)

一种用于评估模型定位精度的指标,计算预测和真实边界的交并比。

用于评估不同方法在长视频上的性能。

检索-定位分解

一种将长视频时间定位问题分解为搜索和定位两个阶段的方法。

研究中提出的核心方法论。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同类型的视频内容中有效应用检索-定位方法?
  • 2 如何提高检索器的时间感知能力以进一步提升性能?

应用场景

近期应用

教育视频分析

可以自动标注长时间的教育视频,提高教学效率。

远期愿景

媒体内容管理

帮助媒体公司更有效地管理和检索长视频内容。

原文摘要

Temporal grounding--returning the interval $[t_s, t_e]$ for a natural-language query over a video--is the language interface to long-form video, yet has been studied on short videos; the dynamics of hour-scale natural-language grounding remain underexplored. We take the position that at hour-scale, the binding constraint is search, not recognition: Video-LLMs are bottlenecked not by localizing a nearby event, but--given a natural-language query--by searching for the relevant region of a long video. To test this, we release ExtremeWhenBench, the first open hour-scale grounding benchmark (2,273 queries over 194 videos, mean 75.7 min, max 9 hr) with an open-form query distribution. Every open Video-LLM collapses while a frame-level retrieval baseline outperforms them; a failure taxonomy attributes 85% of failures to search; and a retrieve-then-ground hybrid recovers 6.7x over the monolithic Video-LLM--mirroring retrieve-then-read in open-domain QA.

cs.CV cs.AI