Can Vision-Language Models See Squares? Text-Recognition Mediates Spatial Reasoning Across Three Model Families

TL;DR

研究揭示视觉语言模型在非文本视觉元素的空间推理中存在局限,文本识别路径表现优于视觉路径。

cs.CV 🔴 高级 2026-02-18 3 次浏览
Yuval Levental
视觉语言模型 空间推理 文本识别 实验研究 模型局限

核心发现

方法论

研究通过生成15个15x15的二进制网格,分别以文本符号和填充方块两种形式呈现,测试三种前沿视觉语言模型(Claude Opus、ChatGPT 5.2、Gemini 3 Thinking)的转录能力。实验考察了文本识别路径与视觉路径在空间推理中的表现差异。

关键结果

  • 在文本符号条件下,Claude和ChatGPT的单元格准确率约为91%,F1得分为84%,而Gemini的准确率为84%,F1得分为63%。在填充方块条件下,三种模型的准确率降至60-73%,F1得分为29-39%。
  • 文本与方块条件的F1差距在34到54点之间,表明文本识别路径在空间推理中显著优于视觉路径。
  • 每个模型在方块条件下表现出不同的失败模式:Claude系统性低估,ChatGPT大幅高估,Gemini出现模板幻觉。

研究意义

研究揭示了当前视觉语言模型在处理非文本视觉元素时的空间定位能力不足,这一发现对学术界和工业界具有重要意义。它挑战了VLMs在任意视觉输入上的空间推理能力的假设,指出文本识别路径在空间推理中的重要性。

技术贡献

研究首次系统地揭示了视觉语言模型在文本识别路径和视觉路径上的性能差异,并通过实验验证了这一现象的普遍性。研究为未来改进视觉语言模型的空间推理能力提供了新的视角和思路。

新颖性

本研究是首次通过简单的二进制网格实验揭示视觉语言模型在文本识别和视觉路径上的性能差异,提供了对模型空间推理能力的新理解。

局限性

  • 研究仅限于15x15的二进制网格,可能无法全面反映模型在复杂场景中的表现。
  • 实验仅在三种特定的视觉语言模型上进行,可能不适用于其他模型。

未来方向

未来研究可以扩展到更复杂的视觉场景,探索不同模型架构对文本识别和视觉路径性能的影响,并开发新的方法以提高视觉路径的空间推理能力。

AI 总览摘要

视觉语言模型(VLMs)在视觉理解任务中表现出色,但其在非文本视觉元素的空间推理能力上存在显著局限。研究通过生成15个15x15的二进制网格,以文本符号和填充方块两种形式呈现,测试了Claude Opus、ChatGPT 5.2和Gemini 3 Thinking三种模型的转录能力。结果显示,文本识别路径在空间推理中显著优于视觉路径,三种模型在文本符号条件下的F1得分明显高于填充方块条件。每个模型在方块条件下表现出不同的失败模式,表明当前VLMs在处理非文本视觉元素时的空间定位能力不足。研究揭示了VLMs在文本识别路径和视觉路径上的性能差异,为未来改进模型的空间推理能力提供了新的视角和思路。

深度分析

研究背景

视觉语言模型(VLMs)近年来在视觉理解任务中取得了显著进展,能够描述图像、解释图表、推理图示并回答视觉内容相关问题。然而,这些模型在处理非文本视觉元素时的空间推理能力仍然存在不足。研究通过生成15个15x15的二进制网格,以文本符号和填充方块两种形式呈现,测试了Claude Opus、ChatGPT 5.2和Gemini 3 Thinking三种模型的转录能力。

核心问题

研究揭示了VLMs在非文本视觉元素的空间推理中存在局限,特别是在填充方块条件下,三种模型的准确率和F1得分显著下降。研究旨在探讨文本识别路径和视觉路径在空间推理中的表现差异。

核心创新

研究首次通过简单的二进制网格实验揭示了VLMs在文本识别路径和视觉路径上的性能差异。实验结果显示,文本识别路径在空间推理中显著优于视觉路径,为未来改进模型的空间推理能力提供了新的视角。

方法详解

  • �� 生成15个15x15的二进制网格,分别以文本符号和填充方块两种形式呈现。
  • �� 测试Claude Opus、ChatGPT 5.2和Gemini 3 Thinking三种模型的转录能力。
  • �� 比较文本识别路径和视觉路径在空间推理中的表现差异。

实验设计

实验设计包括生成15个15x15的二进制网格,分别以文本符号和填充方块两种形式呈现。测试了Claude Opus、ChatGPT 5.2和Gemini 3 Thinking三种模型的转录能力,比较了文本识别路径和视觉路径在空间推理中的表现差异。

结果分析

实验结果显示,文本识别路径在空间推理中显著优于视觉路径,三种模型在文本符号条件下的F1得分明显高于填充方块条件。每个模型在方块条件下表现出不同的失败模式,表明当前VLMs在处理非文本视觉元素时的空间定位能力不足。

应用场景

研究结果对改进VLMs的空间推理能力具有重要意义,特别是在需要精确空间定位的应用场景中,如医学影像、自动驾驶系统和科学可视化。

局限与展望

研究仅限于15x15的二进制网格,可能无法全面反映模型在复杂场景中的表现。实验仅在三种特定的视觉语言模型上进行,可能不适用于其他模型。

通俗解读 非专业人士也能看懂

想象你在玩一个简单的填字游戏,游戏板上有一些格子填满了黑色,而其他格子是空的。你的任务是准确地指出哪些格子是黑色的。现在,假设你有一个助手,它可以非常好地识别字母和数字,但在识别简单的黑色方块时却表现不佳。这就是研究中发现的问题:视觉语言模型在识别文本时表现出色,但在处理简单的视觉元素时却存在困难。这就像你的助手在看到字母时能快速反应,但在看到没有字母的黑色方块时却感到困惑。

简单解释 像给14岁少年讲一样

想象一下你在玩一个拼图游戏,游戏板上有些格子是黑色的,有些是白色的。你的任务是找出所有黑色格子的位置。现在,假设你有一个超级聪明的机器人助手,它可以很快地识别字母和数字,但在识别简单的黑色方块时却有点笨拙。这就是研究中发现的问题:这些超级智能的模型在识别文本时表现出色,但在处理简单的视觉元素时却有点不靠谱。这就像你的机器人助手在看到字母时能快速反应,但在看到没有字母的黑色方块时却有点迷糊。

术语表

视觉语言模型 (Vision-Language Model)

一种结合视觉和语言处理能力的人工智能模型,能够理解和生成与视觉内容相关的文本。

在论文中用于测试模型在不同视觉条件下的空间推理能力。

空间推理 (Spatial Reasoning)

指的是理解和推断物体在空间中的位置和关系的能力。

研究中用于评估模型在不同视觉条件下的表现。

文本识别路径 (Text-Recognition Pathway)

模型用于识别和处理图像中文本元素的路径,通常表现出较高的精度。

研究中用于比较文本识别路径和视觉路径的表现差异。

视觉路径 (Visual Pathway)

模型用于处理非文本视觉元素的路径,通常在空间推理中表现较弱。

研究中用于比较文本识别路径和视觉路径的表现差异。

F1得分 (F1 Score)

一种用于评估模型性能的指标,结合了精确率和召回率。

研究中用于比较模型在不同视觉条件下的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何提高视觉路径的空间推理能力,以便在非文本视觉元素上表现更好?
  • 2 文本识别路径和视觉路径之间的性能差异是否可以通过改进训练数据来缩小?

应用场景

近期应用

医学影像分析

改进VLMs在医学影像中的空间推理能力,以提高诊断准确性。

远期愿景

自动驾驶系统

增强VLMs在复杂视觉场景中的空间推理能力,以提高自动驾驶系统的安全性和可靠性。

原文摘要

We present a simple experiment that exposes a fundamental limitation in vision-language models (VLMs): the inability to accurately localize filled cells in binary grids when those cells lack textual identity. We generate fifteen 15x15 grids with varying density (10.7%-41.8% filled cells) and render each as two image types -- text symbols (. and #) and filled squares without gridlines -- then ask three frontier VLMs (Claude Opus, ChatGPT 5.2, and Gemini 3 Thinking) to transcribe them. In the text-symbol condition, Claude and ChatGPT achieve approximately 91% cell accuracy and 84% F1, while Gemini achieves 84% accuracy and 63% F1. In the filled-squares condition, all three models collapse to 60-73% accuracy and 29-39% F1. Critically, all conditions pass through the same visual encoder -- the text symbols are images, not tokenized text. The text-vs-squares F1 gap ranges from 34 to 54 points across models, demonstrating that VLMs behave as if they possess a high-fidelity text-recognition pathway for spatial reasoning that dramatically outperforms their native visual pathway. Each model exhibits a distinct failure mode in the squares condition -- systematic under-counting (Claude), massive over-counting (ChatGPT), and template hallucination (Gemini) -- but all share the same underlying deficit: severely degraded spatial localization for non-textual visual elements.

cs.CV cs.LG