Disentangling Pictorial Cue Understanding from Language Bias in VLMs via Depth Ordering Task

TL;DR

提出O3-D数据集,通过深度排序任务评估视觉-语言模型的深度理解能力,深度识别准确率仅47-56%。

cs.CV 🔴 高级 2026-07-02 37 次浏览
Yiqian Liu Iuliia Kotseruba John K. Tsotsos
视觉深度理解 视觉-语言模型 深度排序任务 数据集构建 认知心理学

核心发现

方法论

本文结合深度排序与奇异物识别任务,构建了包含37K真实与合成图像的O3-D数据集。通过控制9种典型的图像深度线索(如高度、遮挡、大小等),分析模型对不同线索的利用情况。采用多样化的提示变体,评估12个开源与商业模型在深度排序中的表现,并引入新指标衡量视觉与语言敏感性。实验还考察了链式推理(CoT)和上下文学习(ICL)对模型性能的影响。

关键结果

  • 模型深度排序准确率仅在47%-56%,明显低于随机水平,显示模型未充分利用深度线索。深度线索的利用率极低,模型对高度、大小等线索的敏感性不足。模型在语言偏差方面表现出强烈偏向,回答高度受语言表达模糊影响。引入ICL和CoT未显著改善模型表现,表明静态图像数据不足以实现深度理解。
  • 在不同模型中,商业模型如GPT4-mini和Gemini 2.5略优,但整体仍接近随机。深度线索的交互效果有限,模型对单一线索的利用率极低,表明当前VLM在空间结构理解方面存在显著瓶颈。
  • 提出的指标有效区分视觉与语言的影响,揭示模型在视觉信息利用上的不足,强调模型偏向语言线索的倾向。这为未来模型设计提供了量化分析工具,推动深度理解能力的提升。

研究意义

本研究首次系统性地量化VLM在深度感知中的线索利用情况,揭示其在空间理解方面的不足。通过控制深度线索与语言表达的变量,为模型的认知机制提供了新视角,有助于推动多模态理解的理论发展。数据集和指标的公开,为后续研究提供了标准化平台,有望引导模型在空间推理上的突破,促进机器人、自动驾驶等应用的智能化发展。

技术贡献

提出结合心理物理任务的深度排序评估框架,设计了控制9种深度线索的合成与真实场景数据集。引入新指标衡量视觉与语言敏感性,系统分析模型对不同线索的利用程度。实验验证显示模型普遍低效,强调模型在空间理解上的不足,为未来模型改进提供了量化依据。方法创新在于线索控制与多模态偏差分析的结合。

新颖性

首次系统性地利用深度排序和奇异物识别任务,构建了涵盖多线索控制的O3-D数据集。引入视觉-语言敏感性指标,揭示模型偏向语言线索的普遍现象。与以往仅关注整体性能不同,本研究强调线索层级的细粒度分析,为多模态空间理解提供新思路。

局限性

  • 模型在静态图像上的表现受限,未考虑动态场景与时序信息,未来需结合视频理解提升空间推理能力。
  • 深度线索的模拟虽丰富,但仍难以完全还原真实场景中的复杂空间关系,可能影响模型泛化。
  • 指标虽能区分视觉与语言敏感性,但未能完全揭示模型内部认知机制,仍需结合神经机制研究深入分析。

未来方向

未来将结合动态场景与多模态交互,探索模型在复杂空间推理中的表现。计划引入多任务学习与强化学习,增强模型对深度线索的利用。还将扩展指标体系,评估模型在实际应用中的空间认知能力,推动机器人导航、增强现实等领域的技术突破。

AI 总览摘要

本研究针对当前视觉-语言模型(VLM)在空间理解方面的不足,提出了创新的深度排序评估框架。通过构建O3-D数据集,结合心理物理学中的深度排序任务,系统控制了九种典型的图像深度线索,分析模型对空间信息的利用情况。实验结果显示,现有模型在深度排序任务中的准确率仅为47%-56%,远低于人类水平,且未能充分利用深度线索,表现出明显的视觉-语言偏差。引入的视觉-语言敏感性指标揭示模型偏向语言线索,忽视视觉空间信息。尝试采用链式推理(CoT)和上下文学习(ICL)未能显著改善性能,表明静态图像数据不足以支撑深度理解。研究的核心贡献在于提出了控制深度线索的合成与真实场景数据集,以及量化视觉与语言偏差的指标,为未来多模态空间推理模型的设计提供了重要参考。该数据集和指标的公开,将推动学界在空间认知和多模态理解方面的深入探索,促进机器人、自动驾驶等智能系统的空间感知能力提升。总体而言,本研究揭示了当前VLM在空间理解上的瓶颈,为未来模型的改进提供了理论基础和实践工具。

深度分析

研究背景

近年来,视觉深度理解逐渐成为计算机视觉的重要研究方向。早期工作主要集中在单目深度估计(如Eigen et al., 2014)和三维场景重建(如Slamore et al., 2017),但受限于数据标注与场景复杂度。随着视觉-语言模型(VLM)的兴起,研究者开始关注其空间认知能力(如Li et al., 2020),通过大小、距离、结构等间接指标评估模型的深度理解。现有数据集(如DepthCues, 2015)虽涵盖部分线索,但缺乏对单一线索的控制和分析,难以揭示模型对不同深度线索的利用机制。深度排序任务逐渐成为评估空间理解的标准方法(如Zhou et al., 2019),但多为纯视觉任务,缺乏多模态偏差分析。本文基于心理物理学中的深度排序与奇异物识别任务,结合多线索控制,填补了这一空白。

核心问题

当前VLM在空间理解方面表现不足,主要表现为深度线索利用率低,准确率仅在47%-56%,远低于人类水平。模型偏向语言表达,难以从静态图像中提取空间结构信息。现有评估多依赖整体性能指标,缺乏对线索层级和偏差的细粒度分析。这限制了模型在复杂空间推理、机器人导航、增强现实等应用中的实际表现。解决这一问题需要设计更具控制性的数据集和指标,系统分析模型对不同深度线索的敏感性。

核心创新

本研究的创新点包括:1)构建了结合心理物理任务的深度排序评估框架,利用控制九种深度线索的合成与真实场景数据,系统分析模型的空间认知能力;2)提出了视觉-语言敏感性指标,量化模型对视觉线索与语言表达的偏差,揭示模型偏向语言的普遍现象;3)通过多样化提示变体,评估模型在不同语言表达模糊度下的表现,增强评估的全面性。这些创新为多模态空间理解提供了新的分析工具和数据基础。

方法详解

  • �� 构建3D场景:模拟与真实场景结合,控制目标对象在不同深度平面。• 生成2D视图:通过调整相机位置,加入或排除九种深度线索(如遮挡、大小、光影等)。• 设计提示:多样化问题模板,变换目标指称的清晰度与描述方式。• 数据集制作:合成与真实场景共计37K图像,配合147K问答对。• 模型评估:测试12个开源与商业模型,采用深度排序准确率与偏差指标。• 统计分析:比较模型对不同线索的利用程度,分析视觉与语言偏差。• 实验还包括ICL和CoT提示的效果验证,评估模型在多模态推理中的能力。

实验设计

采用合成场景(Kubric)与真实场景相结合,控制九种深度线索,生成多样化视图。评估模型包括深度排序准确率、视觉-语言敏感性指标和偏差分析。模型涵盖主流开源(如LLaVA、BLIP2)与商业(如GPT4-mini)模型,采用多样化提示和问答格式。通过对比不同线索组合、提示策略,验证模型在空间理解中的表现。还进行了ablation研究,分析线索交互与偏差变化,确保结果的稳健性。

结果分析

所有模型深度排序准确率均在47%-56%,明显低于基线DepthAnythingV2(约93%),显示模型未充分利用深度线索。模型对高度、大小等线索的敏感性不足,偏向语言表达。引入视觉-语言偏差指标,发现模型普遍偏向语言线索,ICL和CoT未带来显著提升。模型在不同线索组合下表现差异明显,单一线索利用率极低,强调空间理解的难度。结果揭示了当前VLM在空间推理上的瓶颈,为未来改进提供了定量依据。

应用场景

该数据集和评估指标可应用于机器人自主导航、增强现实、虚拟现实等领域,帮助模型更好理解空间关系。未来可结合动态场景、多模态交互,提升模型在复杂环境中的空间认知能力。还可用于训练更具空间推理能力的多模态模型,推动智能系统在实际场景中的应用。

局限与展望

模型在静态图像上表现有限,未考虑动态变化与时序信息。深度线索模拟虽丰富,但仍难以完全还原真实场景复杂性,影响泛化能力。指标虽能区分视觉与语言偏差,但未揭示模型内部认知机制,需结合神经科学研究深入分析。未来需结合多模态、多任务学习,提升模型空间理解的深度与广度。

通俗解读 非专业人士也能看懂

想象你在一个厨房里准备做饭。厨房里有很多不同的工具和食材,有的在柜子里,有的在桌子上。你需要知道哪块肉更靠近你,哪块在更远的地方。以前,我们用肉的大小、颜色、阴影等线索猜测距离,但这些线索有时候会误导你。现在,科学家用一种特殊的“观察方法”,让电脑像你一样用不同的线索判断距离。通过设计各种厨房场景,控制每个线索的出现,测试电脑是否能正确判断距离。结果发现,电脑大多只靠语言描述,忽略了实际的空间线索,就像你只听别人说肉在桌子上,却没注意到它的大小或阴影。这个研究帮助我们理解电脑在空间认知上的不足,也为未来让它们更聪明提供了方向。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的任务是找出哪个玩偶离你更近或者更远。你可以用玩偶的大小、阴影、遮挡等线索来判断,但有时候这些线索会让你迷糊。科学家们也遇到类似的问题,他们用电脑来帮忙,但发现电脑其实很难用这些线索判断距离。于是,他们设计了一个特别的“测试场景”,让电脑在不同的图片中练习用各种线索判断距离。结果显示,电脑大部分时间都只听语言描述,忽略了图片中的空间线索,就像你只听别人说玩偶在桌子上,却没注意到它的大小或阴影。这告诉我们,电脑在理解空间关系方面还很弱,需要更多的训练和改进。未来,希望让电脑像人一样聪明,能真正理解空间中的距离和结构,就像你能轻松找到哪个玩偶更靠近你一样!

原文摘要

In this paper, we study depth perception of vision-language models (VLMs) to isolate the effects of pictorial depth cues and disentangle vision and language influences on model performance. To this end, we combine depth-ordering and odd-one-out psychophysical tasks: the VLMs are presented with images where one object is at different depth relative to other, otherwise identical, objects, and must determine whether the odd-one-out target is closer or farther to the observer. To create stimuli, we generate 2D views from simulated and real 3D scenes while controlling the presence of individual pictorial depth cues, enabling a fine-grained analysis of cue-level contributions. Language effects are examined by varying referring expression clarity. We also introduce a novel metric to quantify vision-vs-language sensitivities. Applying this methodology, we create the Odd-One-Out Depth (O3-D) dataset with 37K real and synthetic images and 147K image-question pairs. Evaluation of 12 open-source and commercial models on O3-D shows under-utilization of depth cues and depth-ordering accuracies between 47% and 56%, with no model above chance level. At the same time, our metric reveals strong linguistic bias in the answers. Neither chain-of-thought (CoT) nor in-context learning (ICL) significantly improves performance, suggesting that static image data alone may be insufficient for depth understanding. All code, the image generation pipeline, and the O3-D dataset are publicly released at https://github.com/lyiqian/o3-d.

cs.CV