Tri-Bench: Stress-Testing VLM Reliability on Spatial Reasoning under Camera Tilt and Object Interference

TL;DR

Tri-Bench基准测试VLM在倾斜相机和物体干扰下的空间推理能力,平均准确率约69%。

cs.CV 🔴 高级 2025-12-10 7 次浏览
Amit Bendkhale
视觉语言模型 空间推理 相机倾斜 物体干扰 基准测试

核心发现

方法论

Tri-Bench通过400张图像构建的基准测试,专注于平面三角形问题,评估VLM在相机姿态和场景干扰下的空间推理能力。使用单一固定提示,明确描述边界,允许通过单应性获得正确答案。

关键结果

  • VLM对3D真实值的平均准确率约为69%,在2D投影中为72%。在识别等边、等腰和直角三角形时,准确率降至约0%。
  • 在相机倾斜下,整体准确率下降约4.1%,表明模型未能正确利用提示中的参考框架。
  • 物体干扰对VLM准确率没有显著影响。

研究意义

该研究揭示了VLM在真实场景变化下的鲁棒性问题,特别是相机倾斜和物体干扰对空间推理的影响。Tri-Bench为研究VLM在几何推理中的可靠性提供了一个新的诊断工具。

技术贡献

Tri-Bench提供了一个控制良好的基准,揭示了VLM在空间推理中的关键失败模式,尤其是在3D真实世界和2D图像平面之间的误解。该研究强调了VLM在几何推理中的局限性。

新颖性

Tri-Bench首次系统地控制和隔离相机姿态和物体干扰对相对空间推理的影响,填补了现有基准测试的空白。

局限性

  • 模型在识别少数形状类别时表现不佳,准确率接近0%。
  • 相机倾斜导致准确率下降,表明模型缺乏姿态不变性。

未来方向

未来研究可以探索多视图几何推理,改进提示策略,以及扩展到更复杂的形状和场景。

AI 总览摘要

Tri-Bench基准测试揭示了视觉语言模型(VLM)在相机倾斜和物体干扰下的空间推理能力的局限性。尽管VLM在一般视觉推理中表现出色,但在真实场景变化下的鲁棒性仍然是一个未解决的障碍。

Tri-Bench通过400张图像构建,专注于平面三角形问题,评估VLM在相机姿态和场景干扰下的空间推理能力。研究表明,VLM对3D真实值的平均准确率约为69%,在2D投影中为72%。在识别等边、等腰和直角三角形时,准确率降至约0%。

该研究为VLM在几何推理中的可靠性提供了新的见解,强调了在真实场景中部署VLM的挑战。未来研究可以探索多视图几何推理,改进提示策略,以及扩展到更复杂的形状和场景。

深度分析

研究背景

视觉语言模型(VLM)在机器人导航、增强现实、3D重建等领域的应用日益广泛。然而,VLM在几何推理中的鲁棒性仍然是一个未解决的挑战。现有基准测试通常侧重于绝对距离、角度等的估计,或在抽象图中进行问题解决,但缺乏对相机姿态和物体干扰等关键因素的压力测试。

核心问题

VLM在真实场景变化下的几何推理能力不足,尤其是在相机倾斜和物体干扰的情况下。如何在这些条件下提高VLM的准确性和鲁棒性是一个亟待解决的问题。

核心创新

Tri-Bench通过控制相机姿态和物体干扰,系统地评估VLM在相对空间推理中的表现。该基准测试通过400张图像构建,专注于平面三角形问题,提供了一个新的诊断工具。

方法详解

  • �� 使用400张图像构建基准测试,专注于平面三角形问题。
  • �� 控制相机姿态(平面与倾斜)和场景干扰(10种日常物体)。
  • �� 使用单一固定提示,明确描述边界,允许通过单应性获得正确答案。
  • �� 评估六个简单任务,涵盖二元和连续目标。

实验设计

实验使用了四个最新的VLM:Gemini 2.5 Pro、Gemini 2.5 Flash、GPT-5和Qwen2.5-VL-32B。通过单一固定提示进行评估,分别报告四种捕获条件下的准确率。

结果分析

VLM对3D真实值的平均准确率约为69%,在2D投影中为72%。在识别少数形状类别时,准确率降至约0%。相机倾斜导致准确率下降约4.1%。

应用场景

Tri-Bench可用于评估VLM在机器人导航、增强现实等领域的空间推理能力,帮助改进模型的鲁棒性。

局限与展望

模型在识别少数形状类别时表现不佳,准确率接近0%。相机倾斜导致准确率下降,表明模型缺乏姿态不变性。未来研究可以探索多视图几何推理,改进提示策略。

通俗解读 非专业人士也能看懂

想象你在一个房间里,地上有一个正方形的胶带框,里面有各种各样的三角形。你的任务是通过观察这些三角形来判断它们的形状和角度。相机可能会倾斜,房间里可能会有其他物体干扰你的视线。Tri-Bench就像一个测试,看看在这些条件下,你能多准确地识别这些三角形的特征。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,地上有一个正方形的框,里面有各种三角形。你的任务是通过观察这些三角形来判断它们的形状和角度。相机可能会倾斜,房间里可能会有其他物体挡住你的视线。Tri-Bench就是一个测试,看看在这些条件下,你能多准确地识别这些三角形的特征。

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行推理的人工智能模型。

用于评估在相机倾斜和物体干扰下的空间推理能力。

单应性 (Homography)

用于将一个平面上的点映射到另一个平面上的数学变换。

用于从图像中恢复三角形的几何形状。

相机倾斜 (Camera Tilt)

相机与水平面的倾斜角度,影响图像捕获的视角。

评估VLM在不同相机姿态下的表现。

物体干扰 (Object Interference)

场景中其他物体对目标物体观察的影响。

测试VLM在场景干扰下的鲁棒性。

基准测试 (Benchmark)

用于评估模型性能的标准化测试集。

Tri-Bench用于评估VLM的空间推理能力。

开放问题 这项研究留下的未解疑问

  • 1 如何提高VLM在识别少数形状类别时的准确性?现有方法在这方面表现不佳,需要新的策略。
  • 2 相机倾斜对模型准确性的影响机制是什么?需要更深入的研究来理解。

应用场景

近期应用

机器人导航

帮助机器人在复杂环境中进行准确的空间推理,提高导航能力。

远期愿景

增强现实

提升AR应用中物体识别和空间感知的准确性,增强用户体验。

原文摘要

Verifiable geometric reasoning is a critical component for trustworthy and controllable agentic AI. Despite impressive capabilities, Vision-Language Models (VLMs) often fail under realistic scene changes. We present Tri-Bench, a compact benchmark of planar triangle problems that isolates relative geometric reasoning while stressing two deployment-critical factors: camera pose (planar vs. tilted) and scene context via object interference (10 everyday objects). To test verifiability and control, we evaluate four recent VLMs using a single, fixed prompt whose guardrail explicitly describes a surrounding square border, enabling correct answers via homography. We evaluate six simple tasks over binary and continuous targets, and observe that the overall accuracy with respect to 3D ground truth is modest, ~69% on average (best ~75%, worst ~64%). The same responses align even more closely with 2D projections in the image plane, where mean accuracy is ~72%. All four VLMs consistently fail, with accuracy falling to ~0%, on recognizing minority shape classes (equilateral, isosceles, right-angled triangles). Additionally, overall VLM accuracy degrades by ~4.1% under camera tilt. This demonstrates that models fail to correctly utilize the explicit frame-of-reference hint provided in the prompt and default to 2D image plane cues. Finally, we find that object interference has no significant effect on VLM accuracy.

cs.CV