核心发现
方法论
研究提出了ExtremeWhenBench,这是一个用于长视频自然语言时间定位的开源基准。方法论包括检索-定位分解,首先通过查询条件检索长时间上下文,然后在短窗口内进行定位。该方法类似于开放领域问答中的检索-阅读分解。
关键结果
- 检索-定位混合方法在长视频上比单一Video-LLM性能提升6.7倍,mIoU达到0.354。
- 在Charades-STA基准上,CLIP检索基线的mIoU为0.332,而在长视频上为0.269,超过所有开放Video-LLM。
- Qwen3.5-9B在长视频上的mIoU从0.022提升到0.110,表明上下文覆盖是瓶颈。
研究意义
该研究显著推动了长视频自然语言时间定位领域的发展。通过将问题分解为搜索和定位两个阶段,研究揭示了长视频中搜索的重要性。这一发现对学术界和工业界都有重要影响,尤其是在需要处理长视频内容的应用中。
技术贡献
技术贡献包括开发了第一个长视频自然语言时间定位的开源基准ExtremeWhenBench,并提出了检索-定位分解方法。该方法在长视频中有效地解决了搜索瓶颈问题,提供了新的工程可能性。
新颖性
这是首次在长视频中进行自然语言时间定位的系统研究。与现有短视频基准不同,该研究提供了长视频的开放形式查询和公开访问,显著扩展了研究范围。
局限性
- 当前方法依赖于单一的VLM进行1fps的字幕流生成,可能导致偏差。
- 基准测试继承了LVBench等的题材分布,可能不适用于自我中心或监控内容。
未来方向
未来工作可以探索更强的时间感知检索器,以提高检索-定位混合方法的mIoU上限。此外,研究可以扩展到不同类型的视频内容中。
AI 总览摘要
长视频的自然语言时间定位是一个复杂的问题,现有的短视频基准无法有效解决。研究提出了ExtremeWhenBench,这是第一个用于长视频的开放基准,包含2273个查询和194个视频。通过检索-定位分解方法,研究揭示了长视频中搜索的重要性。实验结果表明,检索-定位混合方法在长视频上性能提升6.7倍,超过所有开放Video-LLM。该研究为长视频内容的处理提供了新的视角,具有重要的学术和实际意义。未来工作可以探索更强的时间感知检索器,以进一步提高性能。
深度分析
研究背景
随着视频内容的增长,自然语言时间定位成为一个重要的研究领域。现有的短视频基准,如Charades-STA和ActivityNet,无法有效处理长视频中的复杂查询。
核心问题
长视频的自然语言时间定位面临搜索和识别的双重挑战。现有方法在长视频中容易失败,主要是因为搜索空间过大。
核心创新
研究提出了ExtremeWhenBench,这是第一个用于长视频的开放基准。通过检索-定位分解方法,研究有效地解决了长视频中的搜索瓶颈问题。
方法详解
- �� 使用Qwen3-VL-8B生成1fps字幕流
- �� 通过GPT-5.1进行视觉边界验证
- �� 使用CLIP进行查询条件检索
- �� 在短窗口内进行定位
实验设计
实验使用了ExtremeWhenBench基准,包含2273个查询和194个视频。基线包括CLIP和多种Video-LLM,评估指标为mIoU。
结果分析
检索-定位混合方法在长视频上mIoU达到0.354,比单一Video-LLM提升6.7倍。CLIP检索基线在长视频上超过所有开放Video-LLM。
应用场景
该方法可用于长视频内容的自动标注和分析,尤其是在教育和媒体领域。
局限与展望
方法依赖于单一VLM进行字幕生成,可能导致偏差。基准测试的题材分布可能不适用于所有类型的视频内容。
通俗解读 非专业人士也能看懂
想象你在一个巨大的图书馆中寻找一本书。传统方法就像在每个书架上逐本查找,而新方法则是先用关键词搜索找到可能的书架,然后在这些书架上仔细查找。这种方法大大缩短了查找时间,尤其是在书架数量庞大的情况下。
简单解释 像给14岁少年讲一样
想象你在玩一个超级大的捉迷藏游戏。你需要找到一个朋友,但他可能藏在一个巨大的公园里。你可以先用望远镜找到可能的区域,然后再去这些区域仔细寻找。这种方法让你更快找到朋友!
术语表
ExtremeWhenBench (极限时间基准)
一个用于长视频自然语言时间定位的开源基准,包含2273个查询和194个视频。
用于评估长视频中的自然语言时间定位性能。
Video-LLM (视频大语言模型)
用于处理视频和自然语言的模型,能够理解和生成视频内容的描述。
研究中评估了多种Video-LLM的性能。
CLIP (对比语言-图像预训练)
一种用于图像和文本匹配的模型,通过对比学习进行训练。
作为基线用于长视频的查询条件检索。
mIoU (平均交并比)
一种用于评估模型定位精度的指标,计算预测和真实边界的交并比。
用于评估不同方法在长视频上的性能。
检索-定位分解
一种将长视频时间定位问题分解为搜索和定位两个阶段的方法。
研究中提出的核心方法论。
开放问题 这项研究留下的未解疑问
- 1 如何在不同类型的视频内容中有效应用检索-定位方法?
- 2 如何提高检索器的时间感知能力以进一步提升性能?
应用场景
近期应用
教育视频分析
可以自动标注长时间的教育视频,提高教学效率。
远期愿景
媒体内容管理
帮助媒体公司更有效地管理和检索长视频内容。
原文摘要
Temporal grounding--returning the interval $[t_s, t_e]$ for a natural-language query over a video--is the language interface to long-form video, yet has been studied on short videos; the dynamics of hour-scale natural-language grounding remain underexplored. We take the position that at hour-scale, the binding constraint is search, not recognition: Video-LLMs are bottlenecked not by localizing a nearby event, but--given a natural-language query--by searching for the relevant region of a long video. To test this, we release ExtremeWhenBench, the first open hour-scale grounding benchmark (2,273 queries over 194 videos, mean 75.7 min, max 9 hr) with an open-form query distribution. Every open Video-LLM collapses while a frame-level retrieval baseline outperforms them; a failure taxonomy attributes 85% of failures to search; and a retrieve-then-ground hybrid recovers 6.7x over the monolithic Video-LLM--mirroring retrieve-then-read in open-domain QA.