From Accuracy to Visual Dependence: Auditing and Filtering Modality Collapse in Traffic VideoQA

TL;DR

提出Blind Gap和Visual Gain指标,揭示交通事故视频问答中的视觉依赖问题。

cs.CV 🔴 高级 2026-06-29 3 次浏览
Sena Korkut María Alejandra Bravo Sarmiento Sanghwan Kim Zeynep Akata
视觉问答 交通事故 数据集诊断 视觉依赖 模型评估

核心发现

方法论

研究采用Blind Gap和Visual Gain两个数据集级别诊断指标,评估视觉依赖性。此外,提出实例级Shortcut Score,用于识别易受捷径影响的问题,并进行持续过滤。

关键结果

  • 在MM-AU数据集上,移除视频输入后准确率提高,Blind Gap达到40.33,Visual Gain为负值,表明视觉输入未能提供帮助。
  • VRU-Accident数据集显示出正的Visual Gain,但Blind Gap仍然较高,表明文本可解性。
  • SUTD-TrafficQA数据集表现出最低的Blind Gap和最高的Visual Gain,显示出最强的视觉依赖性。

研究意义

研究揭示了在交通事故视频问答中,模型可能通过文本捷径而非视觉证据来回答问题。这一发现强调了在安全关键任务中,视觉依赖评估的重要性。

技术贡献

提出了Blind Gap和Visual Gain作为轻量级诊断工具,结合Shortcut Score进行实例级过滤,显著减少了捷径偏差并提高了视觉依赖评估的质量。

新颖性

首次提出结合Blind Gap和Visual Gain的诊断框架,提供了实例级的Shortcut Score,用于识别和过滤捷径问题。

局限性

  • 目前方法在某些数据集上仍然存在视觉输入无效的情况,可能与数据集设计有关。
  • 过滤机制可能导致数据集规模缩小,影响覆盖率。

未来方向

未来研究可以探索更复杂的视觉问答场景,开发更精细的视觉依赖评估工具,并改善数据集设计以减少文本捷径。

AI 总览摘要

在交通事故视频问答领域,现有模型常通过文本捷径而非视觉证据来回答问题,这在安全关键任务中尤为令人担忧。为了解决这一问题,研究提出了Blind Gap和Visual Gain两个数据集级别诊断指标,以及实例级Shortcut Score,用于识别和过滤易受捷径影响的问题。

研究发现,在MM-AU数据集上,移除视频输入后准确率反而提高,表明视觉输入未能提供帮助。相比之下,SUTD-TrafficQA数据集表现出最强的视觉依赖性,显示出正的Visual Gain和最低的Blind Gap。

这一研究强调了在安全关键任务中,视觉依赖评估的重要性,并为未来的多模态数据集设计提供了新的思路。通过减少文本捷径,研究提高了视觉依赖评估的质量,为交通事故视频问答领域的进一步发展奠定了基础。

深度分析

研究背景

随着多模态学习的发展,视觉问答领域逐渐扩展到时间和因果推理。然而,现有的交通事故视频问答数据集往往未能充分利用视觉证据,导致模型通过文本捷径回答问题。

核心问题

交通事故视频问答的核心问题在于模型是否真正依赖视觉证据来回答问题,而不是通过文本捷径。这一问题在安全关键任务中尤为重要。

核心创新

研究提出了Blind Gap和Visual Gain两个数据集级别诊断指标,以及实例级Shortcut Score,用于识别和过滤易受捷径影响的问题。这些工具帮助提高了视觉依赖评估的质量。

方法详解

  • �� 采用Blind Gap指标评估文本可解性
  • �� 使用Visual Gain指标衡量视觉输入的增益
  • �� 提出Shortcut Score进行实例级过滤,结合文本置信度和视觉必要性信号

实验设计

研究在四个交通事故视频问答数据集上进行评估,包括MM-AU、VRU-Accident、SUTD-TrafficQA和AccidentBench。通过对比文本和视频输入的准确率,分析视觉依赖性。

结果分析

在MM-AU数据集上,移除视频输入后准确率提高,Blind Gap达到40.33,Visual Gain为负值。SUTD-TrafficQA数据集表现出最低的Blind Gap和最高的Visual Gain,显示出最强的视觉依赖性。

应用场景

研究结果可用于改善交通事故视频问答模型的设计,提高视觉依赖评估的质量,减少文本捷径对模型性能的影响。

局限与展望

目前方法在某些数据集上仍然存在视觉输入无效的情况,可能与数据集设计有关。过滤机制可能导致数据集规模缩小,影响覆盖率。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要根据食谱做菜。食谱就像文本输入,而食材则是视觉输入。如果厨师只看食谱而不看食材,他可能会做出错误的菜品。在交通事故视频问答中,模型就像厨师,需要同时依赖文本和视觉输入来做出正确的判断。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要根据场景做出选择。如果你只看游戏说明书,而不看屏幕上的场景,你可能会做出错误的选择。在交通事故视频问答中,模型就像玩家,需要同时依赖说明书和屏幕上的场景来做出正确的判断。

术语表

Blind Gap (盲差距)

衡量文本输入超越随机机会的准确率差距。

用于评估文本可解性。

Visual Gain (视觉增益)

衡量添加视频输入后准确率的变化。

用于评估视觉输入的增益。

Shortcut Score (捷径分数)

结合文本置信度和视觉必要性信号的实例级分数。

用于识别和过滤易受捷径影响的问题。

MM-AU

交通事故视频问答数据集,包含58个事故类别。

用于评估视觉依赖性。

SUTD-TrafficQA

交通事件视频问答数据集,提供多种推理类型。

用于评估视觉依赖性。

开放问题 这项研究留下的未解疑问

  • 1 如何设计更复杂的视觉问答场景以提高视觉依赖性?
  • 2 如何优化数据集设计以减少文本捷径?

应用场景

近期应用

交通事故分析

通过提高视觉依赖评估质量,改善交通事故分析模型的准确性。

远期愿景

自动驾驶安全

提高视觉问答模型在自动驾驶中的应用,减少文本捷径对安全性的影响。

原文摘要

High benchmark accuracy does not guarantee genuine use of visual evidence. We study this problem in traffic accident Video Question Answering (VideoQA), where correct answers should depend on scene-specific visual evidence but may instead be inferred from textual shortcuts. Through an audit of four public benchmarks, we find that several recent open-weight Vision-Language Models (VLMs) perform competitively, and sometimes better, without video input. On the MM-AU benchmark, removing video consistently improves accuracy, and adding more frames further degrades performance. To quantify visual dependence, we introduce two dataset-level diagnostics: Blind Gap, measuring above-chance text-only performance, and Visual Gain, measuring the marginal benefit of adding video. We further propose an instance-level Shortcut Score that combines text-only confidence with visual necessity signals, enabling continuous, training-free filtering of shortcut-prone questions. The resulting subsets reduce shortcut bias and improve visual grounding. Our findings reveal large differences in grounding quality across benchmarks and show that visually grounded evaluation, not just high accuracy, is essential in safety-critical VideoQA.

cs.CV