TempCloze: Can Video-LLMs Identify the Missing Middle?

TL;DR

TempCloze通过视频中缺失中段识别,揭示视频时序推理的主要瓶颈在对齐能力。

cs.CV 🔴 高级 2026-09-02 63 次浏览
Wenqi Pei Henry Hengyuan Zhao Yilai Liu Jiahao Meng Han Chen Ziyu Wang Hongyang Du
视频理解 时序推理 基准测试 多模态学习 模型分析

核心发现

方法论

TempCloze采用由7个来源筛选的1521个长时段或自我中心视频,构建三维干扰(语义、对齐、进展)以评估视频时序推理。模型需在已知起止片段中,从四个候选中识别出正确的中段。通过对比不同模型(包括21个开源和10个专有模型)在多维干扰下的表现,分析模型在事件语义理解、时间对齐和事件演进上的能力差异。采用光流算法筛除静态视频,利用LLM评估筛选标准,确保视频质量。干扰设计包括事件应发生、时间应匹配、事件应展开三方面,减少外观线索,强调时间关系推理。模型性能主要受对齐维度限制,表现为在识别事件内容和演进方面较好,但在时间位置精确匹配上显著不足。进一步通过误差分析和行为敏感性测试,揭示模型在候选排序、上下文方向、可见范围、帧密度和测试时尺度等因素影响下的表现变化。

关键结果

  • 在1521个视频中,最优模型的完整理解(三维全对)达70.81%,而人类基线为92%。模型在语义和事件演进方面表现较好,但对时间对齐的准确率仅为48.13%,远低于人类的98%。开源模型平均准确率为34%,但最高可达75.94%。模型在对齐任务中表现最差,尤其在扩展和倒转干扰中错误率最高。模型对候选顺序的敏感性明显,候选顺序变化导致模型输出不稳定,表现出对时间边界的依赖。行为分析显示,模型更依赖起点信息,长帧采样反而稀释关键信息。测试尺度提升模型性能,但未改变对齐的瓶颈地位。这些结果表明,当前视频大模型在时间对齐方面仍存在巨大挑战,需发展视频原生的时间建模机制。

研究意义

该研究通过提出TempCloze基准,突破了传统语言中介的评估限制,直接考察模型的视觉时序推理能力,为未来多模态视频理解提供了更为精准的评估工具。模型在事件内容和演进理解方面已取得一定进展,但对时间对齐的不足,反映出模型在处理复杂动态场景中的局限。此工作强调了提升模型对时间边界敏感性和多方向时间整合能力的必要性,为推动视频理解技术向更高层次发展提供了理论基础和实践指南。未来可结合视频原生结构设计更有效的时间建模机制,改善模型的时序推理能力,促进自动视频分析、监控、虚拟现实等应用的突破。

技术贡献

本研究提出了TempCloze作为一个多维干扰的视频时序推理基准,创新在于:1)引入三维干扰(语义、对齐、演进)设计,减少外观线索依赖;2)利用多源长时段和自我中心视频,增强时间推理难度;3)结合光流筛除静态视频,确保数据质量;4)系统评估21个开源和10个专有模型,揭示对齐为主要瓶颈。通过误差分析和行为敏感性测试,深入理解模型在候选排序、上下文利用和帧密度变化下的表现差异,为未来模型设计提供理论依据。此工作在评估方法和实验体系上实现了突破,为视频时序推理研究提供了标准化工具。

新颖性

TempCloze首次提出基于多维干扰的视觉视频中缺失中段识别任务,强调纯视觉的时间关系推理,避免语言中介偏差。与现有的TempCompass、TVBench等基准不同,它专注于视觉内容的时间对齐,利用同源场景和对象减少外观线索,强化时间推理能力。干扰设计涵盖事件应发生、时间应匹配和事件应展开三维,提供更细粒度的诊断能力。通过大规模评测不同模型,揭示模型在时间对齐方面的普遍不足,推动模型原生时间建模机制的发展。此创新在视频理解评估中具有开创性意义,为未来多模态模型的时序推理提供了新思路。

局限性

  • 目前基准仅关注缺失中段识别,未覆盖开放式生成、对话叙事或音频推理等场景,限制了模型的全面理解能力评估。
  • 候选干扰全部来自同源视频,虽然减少外观线索,但可能低估模型在真实场景中的泛化能力。
  • 模型表现受候选排序和采样密度影响较大,模型稳定性和鲁棒性仍待提升。未来需设计更复杂、多模态、多任务的评估体系,以全面衡量模型的时序理解能力。

未来方向

未来将结合视频原生结构,发展多方向时间建模机制,提升模型对时间边界和事件演进的敏感性。扩展基准到更长、更复杂的视频场景,加入多模态信息(如声音、文本)以增强推理能力。探索自监督学习和强化学习等新技术,改善模型在复杂动态环境中的表现。推动模型在实际应用中的鲁棒性和泛化能力,最终实现更接近人类水平的视觉时序理解。

AI 总览摘要

视频理解的核心难题在于捕捉事件的时间关系。传统评估多依赖语言描述,容易被表面特征或语言偏见所误导。TempCloze提出一种纯视觉的缺失中段识别任务,利用起止片段和多维干扰,逼迫模型理解事件内容、时间位置和演进过程。通过在1521个长时段和自我中心视频上测试,发现模型在事件语义和演进方面表现尚可,但在时间对齐上明显不足,尤其在复杂干扰下表现出极大差异。这揭示了当前模型在时间边界识别上的瓶颈,强调了发展视频原生时间建模机制的必要性。研究还通过误差分析和行为敏感性测试,揭示模型对候选排序、上下文方向和帧密度的敏感性,为未来模型设计提供重要参考。该工作为视频时序推理提供了标准化评估工具,推动多模态理解技术迈向更高水平。

深度分析

研究背景

视频理解技术经历了从动作识别到事件推理的演变,代表性工作包括TGIF-QA、ActivityNet-QA、LongVideoBench等,逐步拓展对长时动态和细粒度事件的理解能力。尽管如此,现有基准多依赖语言描述,容易被表面特征或语言偏见影响,限制了模型对时间关系的深层理解。近年来,TempCompass、TVBench等引入事件排序和定位任务,试图强化时间结构理解,但仍未完全解决模型在复杂场景中的时间对齐问题。随着多模态模型的发展,评估标准亟需突破传统语言中介,直观考察视觉时间推理能力,成为研究热点。

核心问题

核心问题在于,现有模型在理解视频事件的时间关系时,表现出明显瓶颈。虽然在事件内容和演进方面表现良好,但在精确对齐事件时间点时,错误率高达50%以上。原因在于模型对时间边界的敏感性不足,难以区分相似场景中的微妙时间差异。此外,模型对候选顺序和上下文方向的依赖,使得推理结果不稳定。解决这一问题对于实现更智能的视频理解系统至关重要,尤其是在自动监控、虚拟现实等应用中,时间的准确把握直接影响系统性能。

核心创新

本研究的创新点在于:1)提出多维干扰设计,涵盖事件应发生、时间应匹配、事件应展开三大维度,增强模型对时间关系的敏感性;2)利用长时段和自我中心视频,减少外观线索干扰,强化时间推理;3)引入光流算法筛除静态视频,确保数据质量;4)系统评估多模型,揭示对齐为主要瓶颈。与传统基准不同,TempCloze强调视觉内容的时间匹配,避免语言偏差,提供更真实的时序推理评估平台。这些创新推动模型对时间边界的理解,促进视频理解技术的突破。

方法详解

  • �� 数据采集:从7个公开源筛选1521个长时段或自我中心视频,过滤静态和低质量视频。• 视频预处理:采用光流算法筛除静态场景,采样中间段,确保上下文完整。• 干扰设计:构建三维干扰(语义、对齐、演进),每维度包含多种变体(如扩展、倒转、重排、重复),以测试模型对时间关系的敏感性。• 模型评估:使用21个开源和10个专有模型,统一采样16帧,测试在不同干扰下的表现。• 误差分析:分析模型在不同干扰类型中的错误分布,识别主要瓶颈。• 行为敏感性:测试候选排序、上下文方向、帧密度和测试尺度对模型稳定性和准确率的影响。

实验设计

采用多源数据集,评估模型在三维干扰下的准确率,统计完整理解(全对)比例。设置不同候选排序和采样密度,分析模型稳定性。引入TempCloze-Mixed和TempCloze-Hard两个子集,检测模型在复杂场景中的表现。通过多轮测试和温度调节,评估模型预测的稳定性和鲁棒性。实验结果显示,模型在语义和演进方面表现较好,但在对齐任务中表现最差,准确率明显低于人类水平。模型对候选顺序敏感,表现出较高的不稳定性,验证了对齐为主要瓶颈。

结果分析

模型在1521个视频中,最高达70.81%的完整理解率,但在对齐任务中仅48.13%,远低于人类的98%。开源模型平均准确率为34%,最高达75.94%。对齐干扰(如扩展、倒转)错误率最高,模型对候选顺序极敏感。行为分析显示,模型更依赖起点信息,长帧采样反而稀释关键信息。测试尺度提升后,模型性能有所改善,但对齐瓶颈依旧明显。这些数据明确指出,现有模型在时间对齐方面仍需突破,未来应发展视频原生的时间建模机制。

应用场景

该基准可用于自动视频内容分析、行为识别和事件定位,特别适合长时动态场景的理解。通过优化模型对时间边界的敏感性,可提升监控、虚拟现实和智能交互系统的性能。未来,结合多模态信息(如声音、文本)将拓展其应用范围,推动自动化视频分析向更高层次发展。

局限与展望

目前基准主要关注缺失中段识别,未覆盖开放式生成、对话叙事或音频推理场景。候选来自同源视频,可能低估模型泛化能力。模型对候选排序和采样密度敏感,表现不稳定。未来需设计更复杂、多模态、多任务的评估体系,以全面衡量模型的时序理解能力。

通俗解读 非专业人士也能看懂

想象你在看一本故事书,书的前几页和后几页都很清楚,但中间的一段被撕掉了。你需要凭借已知的前后内容,猜出中间发生了什么。这个过程就像TempCloze任务,模型要根据视频的开始和结束片段,猜出中间缺失的内容。为了让猜测更难,研究者设计了各种干扰,比如让模型区分事件是否在正确的时间发生,或者事件是否按正确的顺序展开。模型要理解事件的内容、时间点和发展过程,就像拼图一样,把碎片拼成完整的画面。这个任务帮助我们了解模型是否真正理解了视频中的时间关系,而不是仅仅依赖外观或表面特征。它就像让模型成为一个聪明的侦探,能准确判断事件发生的时间和顺序,而不是只看表面。

简单解释 像给14岁少年讲一样

想象你在看一部电影,电影的前后部分都很清楚,但中间的内容被剪掉了。你的任务是猜出中间发生了什么。你可以根据前后场景猜测,比如看到一场比赛的开始和结束,猜中间可能是比赛进行中。这个游戏看起来简单,但其实很难,因为你要理解事件的时间顺序和发展过程。研究人员设计了类似的游戏,让电脑模型也来猜中间缺失的内容。他们用各种干扰,比如让模型区分事件是否在正确的时间发生,或者事件的顺序是否正确。模型需要像侦探一样,理解视频中的每个细节,判断事件发生的时间和顺序。这个游戏帮助我们知道,电脑是不是真正理解了视频的时间关系,而不是只会看表面。未来,这样的技术可以让电脑更聪明,能更好地理解视频内容,比如自动监控、虚拟现实等都能用到。

原文摘要

Temporal reasoning benchmarks for Video-LLMs are often mediated by language, leaving room for linguistic shortcuts from option wording, answer correlations, or language priors. To reduce such shortcuts, we introduce TempCloze, a video cloze benchmark for evaluating visual temporal reasoning in Video-LLMs. Given the beginning and ending clips of a video, models must identify the true missing middle from four candidates. TempCloze contains 1,521 carefully filtered videos from seven sources, mainly long-take and egocentric videos. We construct same-source distractors along three dimensions: Semantic asks what event should happen, Alignment probes when it should occur, and Progression tests how it should unfold, while shared scenes and objects reduce appearance cues. Our evaluation of 10 proprietary and 21 open-source Video-LLMs reveals Alignment as the primary bottleneck: models often recognize plausible semantic content and local event progression but struggle with temporal alignment. We further conduct error pattern and behavioral sensitivity analyses on TempCloze-Mixed and TempCloze-Hard with four representative models to examine where errors arise and how candidate order, context direction, visible span, frame density, and test-time scaling influence model choices.

cs.CV cs.AI