核心发现
方法论
该研究提出GUI-Perturbed框架,通过独立变换GUI场景和指令,利用Mind2Web MHTML档案和Playwright渲染引擎,系统性评估三款7B模型在空间推理和视觉鲁棒性上的表现。框架包括视觉扰动(样式、缩放、文本大小)和指令扰动(直接与关系性指令),实现多轴域随机化,分析模型在不同干扰下的性能变化。实验还结合LoRA微调和数据增强,验证模型在不同扰动条件下的表现。
关键结果
- 所有模型在空间关系指令下准确率平均下降27-56个百分点,显示空间推理能力严重不足;70%浏览器缩放显著降低模型性能,平均下降约4-8个百分点;数据增强和LoRA微调反而加剧性能退化,表明当前训练策略未能增强模型鲁棒性。
- 在不同扰动条件下,模型对视觉样式变换表现出一定的鲁棒性,但对空间关系和缩放变化极为敏感,验证了模型对绝对位置编码的依赖。Relational指令的准确率远低于直接指令,差距达56个百分点,揭示模型在空间推理上的系统性缺陷。
- 通过引入多轴扰动,GUI-Perturbed成功隔离出空间推理、视觉鲁棒性和推理校准等能力的具体退化路径,为未来模型优化提供了细粒度的诊断工具。
研究意义
该研究揭示了当前GUI定位模型在空间推理和视觉鲁棒性方面的系统性脆弱性,挑战了模型在实际应用中的可靠性。通过引入域随机化和多轴扰动,提供了比传统基准更细粒度的性能诊断手段,有助于推动模型向更具泛化能力的方向发展。研究结果对Web自动化、智能助理等场景具有重要指导意义,强调模型在多变环境下的稳健性是未来研究的关键。
技术贡献
提出GUI-Perturbed框架,结合多轴域随机化实现对GUI模型空间推理和视觉鲁棒性的系统诊断。通过引入基于DOM的扰动机制,精确控制视觉和指令变化,突破传统单一场景评估的限制。实验证明,现有7B模型在空间关系理解上存在普遍缺陷,且微调和增强数据未能改善性能,揭示训练策略的不足。该框架为未来模型设计提供了细粒度的性能分析工具,推动GUI理解模型向更稳健的方向演进。
新颖性
首次系统性引入多轴域随机化评估GUI定位模型的空间推理和视觉鲁棒性,超越传统静态场景评估的局限。通过DOM级别的扰动机制,实现对视觉和指令两个维度的独立控制,揭示模型在实际环境中的系统性脆弱性。这种多轴扰动方法在GUI理解领域尚属创新,为模型诊断和鲁棒性提升提供了新的技术路径。
局限性
- 本研究仅在Web场景下进行,尚未扩展到移动端或桌面应用,未来需考虑多平台适应性;扰动机制虽能揭示性能退化,但未提供直接的模型改进策略;模型在极端扰动下仍表现出明显的性能下降,说明鲁棒性提升仍需多方面努力。
未来方向
未来将结合强化学习和自监督学习方法,探索模型在多轴扰动环境中的自适应能力。计划扩展GUI-Perturbed框架到移动端和桌面应用场景,丰富扰动类型,提升模型在实际环境中的鲁棒性。同时,结合模型解释和可解释性技术,深入理解模型空间推理的内部机制,推动GUI理解模型的稳健性和泛化能力提升。
AI 总览摘要
当前,GUI定位模型在标准基准测试中表现优异,准确率超过85%,但在实际应用中表现出明显的脆弱性,尤其是在空间推理任务中,准确率会骤降27-56个百分点。这一差距源于现有评估方法的局限——它们多只在单一场景、单一指令下测试模型,未能反映模型在多变环境中的真实表现。为解决这一问题,本文提出GUI-Perturbed框架,通过多轴域随机化,系统性扰动GUI场景和指令,包括样式、缩放、文本大小及空间关系指令,模拟现实中浏览器设置变化、界面重绘等多种环境变化。实验在三款7B模型上进行,结果显示:空间关系指令的准确率普遍下降27-56个百分点,模型对绝对位置的依赖导致在缩放变化时性能显著退化,微调和数据增强反而加剧了性能下降。这些发现揭示了模型在空间推理和视觉鲁棒性上的系统性缺陷,强调了模型在实际应用中需要更强的泛化能力。该研究不仅提供了细粒度的性能诊断工具,也为未来模型设计指明了方向——即增强空间推理能力和环境适应性,从而实现更稳健的GUI理解。最后,研究团队还开源了数据集、扰动生成工具和微调模型,推动社区共同提升GUI模型的鲁棒性。
深度分析
研究背景
GUI理解作为人机交互的核心,近年来随着视觉语言模型的发展,取得了显著进步。代表性工作如OSWorld、ScreenSpot-v2和Mind2Web,主要关注静态场景下的元素定位,性能不断提升,但大多未考虑环境变化对模型鲁棒性的影响。实际应用中,浏览器缩放、界面重绘、暗色模式等环境变化频繁发生,模型在这些变化下的表现仍不理想。传统基准无法反映模型在多变环境中的稳定性,限制了其实际推广。近年来,域随机化技术被引入机器人学,用于训练模型的环境不变性,激发了GUI模型鲁棒性提升的思路。尽管如此,缺乏专门针对GUI场景的系统性评估框架,成为研究的瓶颈。
核心问题
现有GUI定位模型在静态场景下表现优异,但在环境变化和空间推理任务中表现出明显不足。主要问题在于模型过度依赖绝对位置编码,缺乏对空间关系的理解能力,导致在缩放、样式变化时性能大幅下降。此外,现有评估方法未能系统性区分视觉、空间和推理能力的退化路径,限制了模型优化的方向。如何设计一种能在多变环境中准确诊断模型弱点的评估框架,成为亟待解决的问题。这不仅关系到模型的实际应用效果,也影响未来GUI理解技术的研究方向。
核心创新
本文提出GUI-Perturbed框架,结合多轴域随机化,系统性扰动GUI场景和指令,实现对空间推理和视觉鲁棒性的细粒度诊断。创新点包括:1)DOM级别的扰动机制,精确控制样式、缩放和空间关系变化;2)多轴扰动设计,区分视觉、空间和推理能力的退化路径;3)结合实际Web场景,验证模型在环境变化中的表现。该方法突破了传统静态评估的局限,为模型性能分析提供了新工具,有助于推动模型在实际环境中的稳健性。
方法详解
- �� 以Mind2Web MHTML档案为基础,利用Playwright渲染网页,实现场景重建;• 设计视觉扰动(样式随机化、缩放、文本大小变化)和指令扰动(直接与关系性指令);• 通过DOM操作,精确控制扰动参数,确保多轴独立性;• 生成多样化的指令样本(直接和关系性),并捕获对应截图;• 利用过滤机制,确保数据质量,剔除异常样本;• 评估三款7B模型在不同扰动条件下的性能变化,分析空间推理和视觉鲁棒性缺陷。
实验设计
采用Mind2Web数据集,构建包含原始和扰动变体的评估集。模型包括Qwen2.5VL-7B、UI-TARS-1.5-7B和GTA1-7B,评估指标为命中率、翻转率和性能变化。通过不同扰动(样式、缩放、文本大小、空间关系)测试模型的鲁棒性,结合统计显著性检验,分析模型在空间推理和视觉变化中的表现差异。还进行微调和数据增强实验,验证训练策略对鲁棒性的影响。整体设计确保每个扰动单独作用,便于定位模型的具体弱点。
结果分析
模型在空间关系指令下准确率平均下降27-56个百分点,验证空间推理能力不足;70%的浏览器缩放显著降低性能,平均下降4-8个百分点;数据增强和LoRA微调未能改善性能,反而加剧退化。模型对视觉样式变化表现出一定鲁棒性,但对空间关系和缩放极为敏感。多轴扰动分析揭示模型过度依赖绝对位置编码,缺乏空间关系的理解能力。链式推理(CoT)部分缓解空间推理不足,但未根本解决问题。这些结果强调模型在实际环境中的适应性不足,未来需在空间推理和环境鲁棒性方面加强。
应用场景
该框架可用于Web自动化、智能助理和人机交互系统的鲁棒性评估,为模型优化提供诊断工具。通过多轴扰动,开发者可以识别模型在不同环境变化下的具体弱点,指导模型设计和训练策略改进。未来,结合强化学习和自监督方法,有望实现模型在多变环境中的自适应能力,推动GUI理解技术的产业化应用。
局限与展望
目前仅在Web场景下验证,尚未扩展到移动端和桌面应用;扰动机制虽能揭示性能退化,但未提供直接的模型改进方案;极端扰动仍导致显著性能下降,模型的泛化能力仍需提升。未来需考虑多平台适应性和更复杂的环境变化,增强模型的鲁棒性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在一家工厂工作,工厂里有很多不同的机器和操作流程。每次你需要找到某个特定的机器,比如一台装配机器人,但工厂的布置经常变,比如灯光变暗、机器位置微调,甚至工人换了位置。传统的方法就像你只记住了每台机器的具体位置和外观,但当环境变化时,你就找不到它了。现在,研究人员设计了一套测试方法,就像在工厂里不断改变机器的外观和位置,看看你还能不能找到目标。通过这种方式,他们发现很多智能模型其实只记住了机器的绝对位置,而没有理解它们之间的关系。这个发现提醒我们,要让模型变得更聪明,就得教它理解空间关系,而不是死记硬背。这个方法就像在工厂里不断变换环境,确保你能在任何情况下都能找到目标机器,真正变得灵活可靠。
简单解释 像给14岁少年讲一样
想象你在学校图书馆找一本书,可是每次你去,书架上的书都换了位置。有时候,书的颜色变了,有时候,书架变得更大或更小。以前,你只记得那本书在左边第几排,但现在,书架变得不一样了,你就找不到那本书了。这就像模型在电脑里找东西一样,它们学会了只记住了书的具体位置,而不是理解它们之间的关系。研究人员发现,这些模型在面对环境变化,比如放大或缩小屏幕、改变界面样式时,表现得很差。于是,他们设计了一个新方法,就像不断变换书架的样子,测试模型是否还能找到目标。结果显示,模型只会死记硬背,不能理解空间关系。这个研究告诉我们,要让电脑变得更聪明,就得教它理解事物之间的关系,而不是只记住它们的具体位置。这就像你学会了看书架上的书是怎么摆放的,而不是只记住某一本书的具体位置。这样,无论书架怎么变,你都能找到那本书!
原文摘要
GUI grounding models report over 85% accuracy on standard benchmarks, yet drop 27-56 percentage points when instructions require spatial reasoning rather than direct element naming. Current benchmarks miss this because they evaluate each screenshot once with a single fixed instruction. We introduce GUI-Perturbed, a controlled perturbation framework that independently varies visual scenes and instructions to measure grounding robustness. Evaluating three 7B models from the same architecture lineage, we find that relational instructions cause systematic accuracy collapse across all models, a 70% browser zoom produces statistically significant degradation, and rank-8 LoRA fine-tuning with augmented data degrades performance rather than improving it. By perturbing along independent axes, GUI-Perturbed isolates which specific capability axes are affected-spatial reasoning, visual robustness, reasoning calibration-providing diagnostic signal that aggregate benchmarks cannot. We release the dataset, augmentation pipeline, and a fine-tuned model.