VLMs Trace Without Tracking: Diagnosing Failures in Visual Path Following

TL;DR

VLMs在视觉路径跟踪中失败,尤其在局部相似干扰下。

cs.CV 🔴 高级 2026-05-15 3 次浏览
Hyesoo Hong Minsoo Kim Wonje Jeung Sangyeon Yoon Dongjae Jeon Albert No
视觉语言模型 路径跟踪 局部竞争 实验分析 模型局限性

核心发现

方法论

研究通过设计受控的路径跟踪任务来测试VLMs的能力,排除语义和拓扑歧义,使用Swirl数据集和修改的电路连接任务进行评估。

关键结果

  • 在修改的电路任务中,Claude Sonnet 4.5的准确率仅为6.2%。
  • 在Swirl任务的高密度配置中,Gemini3-Flash的准确率低于60%。
  • 模型在局部相似干扰下表现出一致的路径偏离。

研究意义

研究揭示了VLMs在基本视觉操作上的局限性,尤其是在需要连续路径跟踪的应用中,如地铁地图导航和缠绕电缆场景。

技术贡献

本研究通过行为干预和内部分析揭示了VLMs在局部相似干扰下的路径偏离机制,并评估了标准补救措施的有效性。

新颖性

首次系统地在受控条件下研究VLMs的路径跟踪能力,明确了局部竞争对路径保持的影响。

局限性

  • 模型在局部相似干扰下的路径保持能力不足,导致路径偏离。
  • 模型规模扩展仅带来有限提升。

未来方向

未来研究可探索专门的机制以增强VLMs在局部竞争下的路径保持能力。

AI 总览摘要

视觉语言模型(VLMs)在多模态基准测试中表现出色,但在基本视觉操作上仍存在不足。本研究重点考察VLMs在视觉路径跟踪中的失败,尤其是在局部相似干扰下的路径偏离。通过设计受控的路径跟踪任务,如Swirl数据集和修改的电路连接任务,研究揭示了即使是最先进的VLMs也难以保持目标路径,尤其是在附近存在局部相似干扰时。

实验结果表明,模型在局部相似干扰下表现出一致的路径偏离,标准补救措施如模型规模扩展和显式路径指令未能有效解决这一瓶颈。研究还通过行为干预和内部分析揭示了路径偏离的机制,指出模型的内部表示倾向于被附近的干扰吸引,而非保持在真实的路径上。

研究的意义在于揭示了VLMs在需要连续路径跟踪的应用中的局限性,如地铁地图导航和缠绕电缆场景。未来研究可探索专门的机制以增强VLMs在局部竞争下的路径保持能力,从而提高其在复杂视觉任务中的可靠性。

深度分析

研究背景

视觉语言模型(VLMs)在多模态基准测试中表现优异,但在基本视觉操作上仍存在不足。先前的研究表明,VLMs在简单的视觉任务中表现不佳,通常依赖于语言先验、语义上下文或粗略的图像统计,而非真实的视觉分析。

核心问题

本研究的核心问题是VLMs在视觉路径跟踪中的失败,尤其是在局部相似干扰下的路径偏离。这一问题在需要连续路径跟踪的应用中尤为重要,如地铁地图导航和缠绕电缆场景。

核心创新

研究通过设计受控的路径跟踪任务,如Swirl数据集和修改的电路连接任务,首次系统地研究了VLMs在局部相似干扰下的路径保持能力。

方法详解

  • �� 设计受控的路径跟踪任务,排除语义和拓扑歧义
  • �� 使用Swirl数据集和修改的电路连接任务进行评估
  • �� 通过行为干预和内部分析揭示路径偏离的机制

实验设计

实验使用Swirl数据集和修改的电路连接任务,评估VLMs在不同配置下的路径跟踪能力。实验设计排除了交叉、重叠和语义捷径,以揭示核心的路径跟踪机制。

结果分析

实验结果表明,即使是最先进的VLMs在局部相似干扰下也难以保持目标路径。标准补救措施如模型规模扩展和显式路径指令未能有效解决这一瓶颈。

应用场景

研究结果对需要连续路径跟踪的应用具有重要意义,如地铁地图导航和缠绕电缆场景。这些应用要求模型能够在复杂的视觉环境中可靠地保持路径。

局限与展望

研究揭示了VLMs在局部相似干扰下的路径保持能力不足,导致路径偏离。模型规模扩展仅带来有限提升,未来研究可探索专门的机制以增强路径保持能力。

通俗解读 非专业人士也能看懂

想象你在一个迷宫中行走,墙壁上有许多相似的标记。你的任务是从起点开始,沿着特定的标记路径走到终点。但问题是,这些标记看起来非常相似,很容易让你走错路。VLMs就像你一样,在面对这些相似的标记时,也会迷失方向。即使它们在复杂的任务中表现出色,但在这种简单的路径跟踪任务中,它们也会偏离目标路径。这就像在一个拥挤的市场中,你试图跟随一个朋友,但由于周围有太多相似的人,你最终跟错了人。

简单解释 像给14岁少年讲一样

想象你在玩一个迷宫游戏,你需要从起点走到终点,但路上有很多岔路口,每条路看起来都差不多。VLMs就像是这个游戏中的玩家,它们在面对这些岔路口时,会不小心走错路。即使它们在其他复杂的任务中表现很好,但在这种简单的任务中,它们也会迷路。这就像你在学校的走廊里,试图跟随朋友去教室,但因为有太多相似的走廊,你最终走错了路。

术语表

视觉语言模型 (VLMs)

结合视觉和语言信息的人工智能模型,能够在多模态任务中表现出色。

用于测试其在视觉路径跟踪任务中的能力。

路径跟踪

沿着指定路径进行连续移动的过程,通常用于导航和图像分析。

研究中用于评估VLMs的基本视觉操作能力。

局部相似干扰

在路径跟踪任务中,附近存在与目标路径相似的干扰物,导致模型偏离目标路径。

研究揭示了这种干扰对VLMs路径保持能力的影响。

Swirl数据集

一个用于测试VLMs路径跟踪能力的受控数据集,包含不同密度的螺旋结构。

用于评估模型在不同配置下的路径跟踪能力。

电路连接任务

一种修改的路径跟踪任务,排除了交叉和重叠,以揭示核心的路径跟踪机制。

用于评估VLMs在局部相似干扰下的路径保持能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在局部相似干扰下增强VLMs的路径保持能力?
  • 2 现有的补救措施为何未能有效解决路径偏离问题?
  • 3 未来的研究方向应如何设计以提高VLMs的可靠性?

应用场景

近期应用

地铁地图导航

提高VLMs在复杂地图环境中的路径跟踪能力,帮助用户更准确地导航。

远期愿景

复杂视觉任务中的可靠性

开发专门的机制以增强VLMs在复杂视觉任务中的路径保持能力,提高其在实际应用中的可靠性。

原文摘要

Vision-language models (VLMs) achieve strong performance on multimodal benchmarks, but may still lack robust control over basic visual operations. We study \textit{line tracing}, where a model must follow a selected visual path through successive local continuations. To isolate this ability, we design controlled tracing tasks that introduce nearby competitors while reducing semantic and topological ambiguity such as crossings and overlaps. Across these tasks, even state-of-the-art VLMs frequently lose the target path and switch to nearby alternatives, especially when those alternatives look locally similar to the target. Behavioral interventions and internal analyses indicate that these failures arise from local competition: nearby similar distractors pull the model away from the true continuation. Standard remedies do not remove this bottleneck: model-size scaling provides only limited gains, reasoning partially compensates through costly substitute strategies, and explicit tracing instructions fail to recover stable path following. Finally, tests on tangled-cable scenes and metro maps with richer visual complexity show that the same path-switching failure persists beyond our controlled settings.

cs.CV cs.AI