VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models

TL;DR

VANTAGE-Bench评估视觉语言模型在基础设施AI中的差距,揭示模型在事件验证和时间定位任务上的不足。

cs.CV 🔴 高级 2026-09-09 3 次浏览
Zaid Pervaiz Bhat Nimra Nayyar Arihant Jain Lap Fung Chan John Suchanek Yu Wang Varun Praveen Tomasz Kornuta Vidya Nariyambut Murali
视觉语言模型 基础设施AI 评估基准 事件验证 时间定位

核心发现

方法论

VANTAGE-Bench是一个多任务基准,专为基础设施AI设计,涵盖物流、交通和智能空间三大领域。它通过八种任务形式评估模型的语义、空间、时间和时空理解能力,超越了传统的多选题格式,提供了一个单次轨迹生成协议用于单目标跟踪。

关键结果

  • 在17个模型的零样本评估中,事件验证、指代表达和时间定位任务的表现比消费者视频基准低9到24分,而视频问答仅低5.3分。
  • 时间定位任务的mIoU不超过55.7,密集视频字幕的SODA_c不超过37.3。
  • 在短期跟踪中,前沿模型与专业跟踪器的差距约为5分,但在长期跟踪中差距扩大。

研究意义

该研究揭示了视觉语言模型在固定摄像头环境中的性能不足,强调了在实际操作环境中评估模型的重要性。通过提供一个多任务基准,VANTAGE-Bench为基础设施AI的研究和发展提供了新的方向,推动了在安全监控和操作记录等领域的应用。

技术贡献

VANTAGE-Bench通过多任务评估框架,填补了现有基准在基础设施AI领域的空白。它提供了一个开放的评估生态系统和实时公共排行榜,支持对模型在实际操作环境中的性能进行全面评估。

新颖性

VANTAGE-Bench是第一个专为基础设施AI设计的多任务基准,首次在固定摄像头视频上进行单目标跟踪评估,突破了传统基准的多选题限制。

局限性

  • 模型在时间定位和密集视频字幕任务上的表现仍然较弱,未能超过55.7 mIoU和37.3 SODA_c。
  • 在长时间跟踪任务中,模型与专业跟踪器的差距明显。

未来方向

未来研究可以关注提高模型在时间定位和密集视频字幕任务上的表现,以及在长时间跟踪任务中的鲁棒性。

AI 总览摘要

随着视觉语言模型(VLMs)的快速发展,现有研究主要集中在以消费者视频为基础的行动导向AI上,忽视了基础设施AI这一重要领域。基础设施AI依赖于固定摄像头进行安全监控和操作记录,其数据密集且视角固定,传统的互联网视频数据无法充分评估其性能。

VANTAGE-Bench是一个专为基础设施AI设计的评估基准,涵盖物流、交通和智能空间三大领域。它通过八种任务形式评估模型的语义、空间、时间和时空理解能力,超越了传统的多选题格式,提供了一个单次轨迹生成协议用于单目标跟踪。

在对17个模型的零样本评估中,VANTAGE-Bench揭示了模型在事件验证、指代表达和时间定位任务上的不足。尽管在视频问答任务中表现接近现有基准,但在时间定位和密集视频字幕任务上的表现仍然较弱。这一研究为基础设施AI的进一步发展提供了新的方向。

深度分析

研究背景

视觉语言模型(VLMs)近年来取得了显著进展,主要应用于消费者视频的行动导向AI。然而,基础设施AI作为一个重要领域,依赖固定摄像头进行安全监控和操作记录,其数据密集且视角固定。现有的互联网视频数据无法充分评估其性能,导致模型在实际操作环境中的表现存在差距。

核心问题

核心问题在于现有视觉语言模型在基础设施AI中的性能不足,特别是在事件验证和时间定位任务上。由于这些任务需要模型具备高水平的语义、空间和时间理解能力,因此对模型的评估框架提出了更高的要求。

核心创新

VANTAGE-Bench通过多任务评估框架,填补了现有基准在基础设施AI领域的空白。它首次在固定摄像头视频上进行单目标跟踪评估,突破了传统基准的多选题限制,为模型在实际操作环境中的性能评估提供了新的方法。

方法详解

  • �� VANTAGE-Bench涵盖物流、交通和智能空间三大领域。
  • �� 提供八种任务形式,包括语义、空间、时间和时空理解。
  • �� 提供单次轨迹生成协议用于单目标跟踪。
  • �� 数据集包括3,346个媒体资产,涵盖视频任务、图像定位和检测框。

实验设计

实验设计包括对17个模型的零样本评估,涵盖开放权重和专有模型。使用扩展的VLMEvalKit工具进行推理和度量计算,重点评估模型在事件验证、指代表达和时间定位任务上的表现。

结果分析

在对17个模型的零样本评估中,事件验证、指代表达和时间定位任务的表现比消费者视频基准低9到24分,而视频问答仅低5.3分。时间定位任务的mIoU不超过55.7,密集视频字幕的SODA_c不超过37.3。

应用场景

VANTAGE-Bench的应用场景包括安全监控和操作记录等基础设施AI领域。通过提供一个多任务评估框架,VANTAGE-Bench为基础设施AI的研究和发展提供了新的方向。

局限与展望

模型在时间定位和密集视频字幕任务上的表现仍然较弱,未能超过55.7 mIoU和37.3 SODA_c。在长时间跟踪任务中,模型与专业跟踪器的差距明显。

通俗解读 非专业人士也能看懂

想象一个大型仓库,里面有许多摄像头监控着每一个角落。这些摄像头就像是仓库的眼睛,负责观察和记录一切活动。VANTAGE-Bench就像是一个测试这些眼睛的工具,看看它们能否准确识别和描述发生的事情。比如,当一个工人搬运货物时,摄像头需要知道他从哪里开始,经过了哪些地方,最后把货物放在哪里。VANTAGE-Bench通过一系列复杂的任务来评估这些摄像头的表现,确保它们在实际操作中能有效工作。

简单解释 像给14岁少年讲一样

想象一下你在玩一个超级复杂的游戏,游戏里有很多任务需要完成,比如找出谁在偷东西,或者什么时候发生了事故。VANTAGE-Bench就像是这个游戏的裁判,帮助我们判断这些任务是否完成得好。它会给出一些问题,比如“这个人有没有用钥匙卡进入?”或者“什么时候发生了碰撞?”,然后看模型能不能给出正确答案。这个工具非常酷,因为它能帮助我们确保在现实生活中,监控摄像头能有效地工作,保护我们的安全。

术语表

视觉语言模型 (VLM)

视觉语言模型是一种结合图像和文本信息进行理解和生成的AI模型。

VANTAGE-Bench用于评估VLM在基础设施AI中的表现。

基础设施AI

基础设施AI依赖固定摄像头进行安全监控和操作记录,提供开放环路洞察。

VANTAGE-Bench专为评估基础设施AI设计。

事件验证

事件验证任务要求模型验证操作假设与视觉证据的一致性。

VANTAGE-Bench评估模型在事件验证任务上的表现。

时间定位

时间定位任务要求模型准确预测动作的开始和结束时间戳。

VANTAGE-Bench评估模型在时间定位任务上的表现。

单目标跟踪

单目标跟踪任务要求模型在整个序列中预测目标的坐标轨迹。

VANTAGE-Bench首次在固定摄像头视频上进行单目标跟踪评估。

开放问题 这项研究留下的未解疑问

  • 1 如何提高模型在长时间跟踪任务中的鲁棒性?现有模型在长时间跟踪任务中表现不佳,未来研究需探索更有效的跟踪算法。
  • 2 如何增强模型在时间定位任务上的表现?现有模型在时间定位任务上的mIoU不超过55.7,需开发更精确的时间预测算法。

应用场景

近期应用

安全监控

VANTAGE-Bench可用于评估监控摄像头在安全监控中的表现,确保其能准确识别和记录安全事件。

操作记录

通过评估模型在操作记录任务中的表现,VANTAGE-Bench可帮助优化仓库和交通系统的操作效率。

远期愿景

智能城市

VANTAGE-Bench可用于评估智能城市中的基础设施AI系统,推动城市管理的智能化和自动化。

原文摘要

As Vision-Language Models (VLMs) advance toward physical deployment, the focus has remained on action-oriented Embodied AI evaluated on subject-centric consumer video. This overlooks a pervasive class of Physical AI: Infrastructure AI, which relies on fixed cameras for open-loop insights like safety monitoring and operational logging. We introduce VANTAGE-Bench, a benchmark measuring this "Infrastructure AI Gap." It spans three operational domains (Logistics, Transportation, and Smart Spaces), unifies image and video evaluation across semantic, spatial, temporal, and spatio-temporal capabilities, and moves beyond multiple-choice to eight task formulations including dense captioning and spatio-temporal grounding. It adds a single-pass trajectory protocol for Single Object Tracking and, to our knowledge, the first such evaluation on fixed-camera infrastructure video, scored against specialist trackers. Annotation spans three regimes over 3,346 media assets: 3,342 video-task annotations, 4,281 image-grounding annotations, and 27,404 detection boxes. Evaluating 17 models zero-shot, we find the shortfall relative to consumer-centric benchmarks is concentrated, not general. Event verification, referring expressions, and temporal localization fall roughly 9 to 24 points at every model scale, while video question answering stays within 5.3 points of VideoMME and 2D spatial pointing shows no shortfall against BLINK. The temporal pillar is weakest in absolute terms: no system exceeds 55.7 mIoU on temporal localization or 37.3 SODA_c on dense video captioning. On tracking, frontier models come within roughly 5 points of specialist trackers over short horizons but separate as the horizon extends. Open-weight models lead 2D object localization outright, so neither scale nor proprietary access explains the pattern. Data, evaluation harness, and leaderboard: https://vantage-bench.org/

cs.CV cs.AI