GUI-Primitives: Diagnosing Spatial Reasoning Failures in Vision-Language GUI Grounding

TL;DR

GUI-Primitives基准测试揭示了视觉语言模型在GUI空间推理中的局限,最高准确率仅32%。

cs.CL 🔴 高级 2026-08-22 7 次浏览
Md Abrar Jahin Md Rizwan Parvez
视觉语言模型 空间推理 GUI 基准测试 机器学习

核心发现

方法论

该研究引入了GUI-Primitives基准测试,包含994个对比指令对,涵盖七种空间关系。每对保持截图和锚点不变,仅改变关系表达,以检测模型在GUI中绑定关系语言的能力。五名注释者验证了196个子集,确保了数据的准确性。

关键结果

  • 19个视觉语言模型在严格点框准确率上最高仅达到32%。
  • 在60-92%的项目中,预测落在两个候选区域之外。
  • 标记两个指定候选项可将选择准确率提高35-57个百分点。

研究意义

该研究通过GUI-Primitives基准测试,揭示了现有视觉语言模型在GUI空间推理中的局限性,尤其是在关系理解方面。这为未来模型的改进提供了明确的方向,并为学术界和工业界提供了新的评估标准。

技术贡献

该研究提供了一个新的基准测试工具,能够精确诊断视觉语言模型在GUI空间推理中的具体失败点,尤其是在候选项定位和关系理解方面的不足。通过对比分析,研究揭示了模型在不同空间关系上的表现差异。

新颖性

这是首次通过对比指令对的方式,系统性地评估视觉语言模型在GUI中的空间推理能力。与以往的基准测试不同,GUI-Primitives能够精确分离模型在关系语言绑定中的失败点。

局限性

  • 模型在包含和遮挡关系上的选择准确率未显著高于0.50,反映了关系理解的不足。
  • 大部分模型的预测落在两个候选区域之外,显示出候选项定位的困难。

未来方向

未来研究可以探索如何增强模型在复杂GUI环境中的空间推理能力,尤其是在关系理解和候选项定位方面的改进。

AI 总览摘要

在现代计算环境中,视觉语言模型被用于解析图形用户界面(GUI)中的自然语言指令。然而,现有的基准测试未能有效分离模型在关系语言绑定中的失败点。为此,研究者引入了GUI-Primitives基准测试,包含994个对比指令对,涵盖七种空间关系。通过保持截图和锚点不变,仅改变关系表达,研究者能够检测模型在GUI中绑定关系语言的能力。实验结果显示,19个视觉语言模型在严格点框准确率上最高仅达到32%。大部分预测落在两个候选区域之外,显示出候选项定位的困难。标记两个指定候选项可将选择准确率提高35-57个百分点。这一研究揭示了现有模型在GUI空间推理中的局限性,为未来的改进提供了明确的方向。

深度分析

研究背景

视觉语言模型近年来在自然语言处理和计算机视觉领域取得了显著进展。然而,在图形用户界面(GUI)中,模型需要解析复杂的空间关系,这对现有模型提出了新的挑战。尽管已有的基准测试如ScreenSpot和ScreenSpot-Pro测量了模型在目标框内点击的准确性,但未能分离模型在空间关系理解中的具体失败点。

核心问题

现有的视觉语言模型在GUI中的空间推理能力有限,尤其是在绑定关系语言到正确元素时。这导致模型在复杂的GUI环境中难以准确定位目标元素,影响了其实际应用效果。

核心创新

GUI-Primitives基准测试通过对比指令对的方式,系统性地评估模型在GUI中的空间推理能力。每对保持截图和锚点不变,仅改变关系表达,以检测模型在绑定关系语言中的能力。这种方法能够精确分离模型在关系理解中的失败点。

方法详解

  • �� 引入994个对比指令对,涵盖七种空间关系。
  • �� 五名注释者验证了196个子集,确保数据准确性。
  • �� 使用严格点框准确率评估模型表现。
  • �� 通过标记候选项提高选择准确率。

实验设计

实验使用了19个视觉语言模型,包括开源和专有系统。通过严格点框准确率和候选项标记提高选择准确率的方法,评估模型在GUI-Primitives基准测试中的表现。

结果分析

实验结果显示,模型在严格点框准确率上最高仅达到32%。大部分预测落在两个候选区域之外,显示出候选项定位的困难。标记两个指定候选项可将选择准确率提高35-57个百分点。

应用场景

GUI-Primitives基准测试可用于评估和改进视觉语言模型在复杂GUI环境中的空间推理能力,帮助开发更智能的计算机使用代理。

局限与展望

模型在包含和遮挡关系上的选择准确率未显著高于0.50,反映了关系理解的不足。大部分模型的预测落在两个候选区域之外,显示出候选项定位的困难。

通俗解读 非专业人士也能看懂

想象你在一个巨大的图书馆里找书。你有一个任务:找到在某个特定书架上左边第三本书。这个任务就像视觉语言模型在GUI中找元素一样。模型需要理解“左边第三本书”这个指令,并在复杂的书架布局中找到正确的书。GUI-Primitives基准测试就像是一个测验,测试模型能否准确找到书。结果显示,大多数模型在这个任务上表现不佳,就像在图书馆中迷失方向一样。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个游戏,你需要在屏幕上找到一个隐藏的宝藏。游戏会给你提示,比如“在左边的树旁边”。这就像是视觉语言模型在图形界面中找东西一样。科学家们用了一种叫做GUI-Primitives的测试,来看看这些模型能不能找到“宝藏”。结果显示,大多数模型都找不到正确的地方,就像在游戏中迷路了一样。科学家们希望通过这个测试,帮助模型变得更聪明,像你一样在游戏中找到所有宝藏!

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行任务的模型,常用于图像标注和问答。

在本文中,用于解析GUI中的自然语言指令。

GUI (图形用户界面)

用户通过图形元素与计算机交互的界面。

本文中,模型需要在GUI中定位目标元素。

点框准确率 (Point-in-box Accuracy)

预测点是否落在目标框内的准确率。

用于评估模型在GUI-Primitives基准测试中的表现。

对比指令对 (Contrastive Instruction Pair)

保持截图和锚点不变,仅改变关系表达的指令对。

用于检测模型在绑定关系语言中的能力。

候选项标记 (Candidate Marking)

标记两个指定候选项以提高选择准确率的方法。

实验中用于提高模型的选择准确率。

开放问题 这项研究留下的未解疑问

  • 1 如何增强模型在复杂GUI环境中的空间推理能力,尤其是在关系理解和候选项定位方面的改进。
  • 2 现有模型在包含和遮挡关系上的选择准确率未显著高于0.50,反映了关系理解的不足。

应用场景

近期应用

GUI评估

使用GUI-Primitives基准测试评估现有视觉语言模型的空间推理能力,帮助开发更智能的计算机使用代理。

远期愿景

智能界面交互

通过改进模型的空间推理能力,实现更自然和智能的人机交互界面,提升用户体验。

原文摘要

Computer-use agents ground natural-language instructions in screenshots to locate interface elements, yet existing benchmarks do not isolate whether models bind relational language to the correct element. We introduce GUI-Primitives, a 994-item benchmark of contrastive instruction pairs over seven spatial relations in graphical user interfaces (left/right, above/below, containment, alignment, proximity, list ordinal, occlusion). Each pair holds the screenshot and anchor fixed while changing the relation expression, so the correct target moves between two designated candidates. Five annotators validate a 196-item subset ($κ= 0.94$ well-formedness; $κ= 0.79$ target selection). Nineteen vision-language models reach at most $32\%$ strict point-in-box accuracy. Because models emit unconstrained coordinates, we classify each prediction by the candidate region it falls within. Predictions fall outside both candidates on $60-92\%$ of items. Conditional on falling within a candidate region, target selection reaches 0.82-0.90 for horizontal position, vertical position, proximity, and list ordinal, but does not differ significantly from 0.50 for containment and occlusion: most failures reflect candidate localization rather than relation understanding. Across ten models, benchmark accuracy correlates with ScreenSpot-Pro accuracy (Spearman $ρ= +0.74$), an exploratory association at this sample size. Marking the two designated candidates raises selection accuracy by 35--57 percentage points, an oracle diagnostic that supplies the candidate set rather than a deployable method. We release the benchmark, predictions, and code.

cs.CL