MotionBlind: Probing the Illusion of Motion Understanding in Video-LLMs

TL;DR

MotionBlind揭示Video-LLMs无法准确理解视频中的运动,Gemini3.1 Pro是唯一通过的模型。

cs.CV 🔴 高级 2026-09-09 6 次浏览
Dhairya Bhatia Bishoy Galoaa Oliver Fritsche Shahid Kamal Muhammad Obaidullah Abdul Salam Umer Saleem Om Rastogi Frania Felix Chettiar Nesli Erdogmus Sarah Ostadabbas
视频理解 大语言模型 运动分析 对比基准 人工智能

核心发现

方法论

MotionBlind使用自录视频对比基准,评估物理运动属性如速度、大小和方向。每个实例包含两个几乎相同但运动不同的视频片段,配以四个是非题,要求模型全部正确才能得分。

关键结果

  • Gemini3.1 Pro是唯一通过MotionBlind的模型,达到60%准确率,而其他开源模型仅接近6.25%的随机水平。
  • 实验表明视频和正确的时间顺序是解决MotionBlind的必要条件,文本或乱序视频无法解决问题。
  • 即使增加帧数或使用更智能的帧选择策略,模型仍无法显著提高运动理解能力。

研究意义

MotionBlind挑战了Video-LLMs在物理运动理解上的能力,揭示了当前模型在速度、大小和方向识别上的不足。这对于依赖视频理解的世界模型的监督和评估有重要影响。

技术贡献

提出了一个严格的对比基准MotionBlind,专注于物理运动属性,补充了TimeBlind的语义推理。通过控制变量确保运动是唯一的信号来源。

新颖性

MotionBlind首次将物理运动属性作为对比基准的核心,区别于以往的语义推理基准,强调速度、大小和方向的独立评估。

局限性

  • 开源模型在速度和大小的识别上完全失败,说明现有技术无法有效编码这些运动属性。
  • 即使是最先进的模型Gemini3.1 Pro也在速度识别上表现不佳,揭示了代表性差距。
  • 现有帧选择策略未能解决时间顺序对运动理解的影响。

未来方向

未来研究应关注如何提高模型对物理运动属性的理解,探索新的帧选择策略和时间序列建模方法,以改善Video-LLMs的运动识别能力。

AI 总览摘要

MotionBlind是一个创新的对比基准,旨在评估视频大语言模型(Video-LLMs)对物理运动的理解能力。现有的Video-LLMs在识别静态内容上表现良好,但在运动理解上存在显著不足。MotionBlind通过自录视频对比实例,揭示了这些模型在速度、大小和方向识别上的缺陷。

实验结果显示,只有Gemini3.1 Pro模型通过了MotionBlind的评估,而其他开源模型均未能达到预期的准确率。这表明现有模型在物理运动理解上存在显著差距,无法可靠地用于世界模型的监督和评估。

未来的研究方向包括开发新的帧选择策略和时间序列建模方法,以提高Video-LLMs对物理运动属性的理解能力。这对于改善人工智能在动态环境中的表现至关重要。

深度分析

研究背景

视频大语言模型(Video-LLMs)近年来被广泛应用于世界模型的感知前端,假设它们能够读取运动信息。然而,现有研究表明,这些模型在运动理解上存在显著不足,尤其是在速度、大小和方向的识别上。

核心问题

核心问题在于Video-LLMs无法准确识别视频中的运动属性,如速度、大小和方向。这对依赖视频理解的世界模型的监督、奖励和评估构成了挑战。

核心创新

MotionBlind通过自录视频对比基准,专注于物理运动属性的评估。每个实例包含两个几乎相同但运动不同的视频片段,确保运动是唯一的信号来源。

方法详解

  • �� 使用自录视频对比基准评估物理运动属性
  • �� 每个实例包含两个几乎相同的视频片段,配以四个是非题
  • �� 要求模型全部正确才能得分,确保运动是唯一的信号来源

实验设计

实验设计包括对六个开源和两个前沿Video-LLMs的控制研究,评估视频是否存在、帧是否按正确时间顺序显示,以及帧的采样策略。

结果分析

实验结果显示,只有Gemini3.1 Pro模型通过了MotionBlind的评估,而其他开源模型均未能达到预期的准确率,表明现有模型在物理运动理解上存在显著差距。

应用场景

MotionBlind可用于评估Video-LLMs在物理运动理解上的能力,帮助开发更可靠的世界模型感知前端。

局限与展望

现有模型在速度和大小的识别上完全失败,说明现有技术无法有效编码这些运动属性。即使是最先进的模型Gemini3.1 Pro也在速度识别上表现不佳,揭示了代表性差距。

通俗解读 非专业人士也能看懂

想象你在看两段视频,一个人穿过房间。虽然你能清楚地看到他们穿什么、房间里有什么家具,但你却无法判断他们走得有多快或方向。这就是MotionBlind揭示的问题。它就像一个测验,要求模型不仅识别静态内容,还要理解运动。就像你在看电影时,不仅要知道角色是谁,还要理解他们的动作和速度。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏里有两个角色在同一个房间里走动。虽然你能看到他们穿什么衣服、房间里有什么家具,但你却无法判断哪个角色走得更快或者方向不同。这就是MotionBlind揭示的问题。它就像一个测验,要求模型不仅识别静态内容,还要理解运动。就像你在看电影时,不仅要知道角色是谁,还要理解他们的动作和速度。是不是很有趣?

术语表

Video-LLMs (视频大语言模型)

一种用于处理视频内容的大型语言模型,假设能够读取运动信息。

在研究中用于评估模型的运动理解能力。

MotionBlind (运动盲)

一个对比基准,用于评估模型对物理运动属性的理解能力。

用于揭示Video-LLMs在运动理解上的不足。

Instance Accuracy (实例准确率)

评估模型在对比基准上正确回答所有问题的能力。

用于衡量模型在MotionBlind上的表现。

Gemini3.1 Pro

唯一通过MotionBlind评估的模型,表现优于其他开源模型。

在实验中显示出较高的实例准确率。

TimeBlind

一个对比基准,专注于语义推理而非物理运动。

与MotionBlind互补,用于评估模型的时间推理能力。

开放问题 这项研究留下的未解疑问

  • 1 现有模型无法有效编码速度和大小属性,需探索新的时间序列建模方法。
  • 2 帧选择策略未能解决时间顺序对运动理解的影响,需开发新的策略。

应用场景

近期应用

视频分析

MotionBlind可用于评估Video-LLMs在物理运动理解上的能力,帮助开发更可靠的世界模型感知前端。

远期愿景

动态环境中的人工智能

提高Video-LLMs对物理运动属性的理解能力,将改善人工智能在动态环境中的表现。

原文摘要

Video large language models (Video-LLMs) are increasingly used as the perceptual front end of world models, a role that assumes they can read motion: how fast something moves, which way it travels, how hard it is pushed. We show they cannot. A Video-LLM can watch two clips of the same person in the same room, name every object in both, and still fail to say which clip moves faster. We introduce MotionBlind, a contrastive benchmark of self-recorded video for physically grounded motion(speed, magnitude, and direction), the variables a world model must predict. Each instance is a pair of near-identical clips that differ only in motion. Each clip carries two complementary yes/no questions, giving four items per instance, and a model earns credit only if all four are correct. We report Instance Accuracy(IAcc), which has a 6.25% chance floor. Single-frame, appearance, and language-only shortcuts all collapse to it. MotionBlind complements the recent TimeBlind benchmark. We run a controlled study of six open and two frontier Video-LLMs, varying whether the video is present, whether frames are shown in the correct temporal order, and how frames are sampled (1 to 24 frames, four selection strategies). Open models sit near the 6.25% floor, and scale does not help. Removing the video drops every model to zero IAcc, and shuffling frames collapses IAcc to chance, so the task genuinely needs video in order. Neither more frames nor smarter frame selection closes the gap, because these change which frames are seen, not whether motion is read. Only Gemini3.1 Pro clears the benchmark overall, and even it fails on speed. A frontend that cannot tell two speeds of the same action apart is not yet a trustworthy source of supervision, reward, or evaluation for a world model.

cs.CV