UI-Zoomer: Uncertainty-Driven Adaptive Zoom-In for GUI Grounding

TL;DR

UI-Zoomer通过不确定性驱动的自适应放大提升GUI定位,提升精度达13.4%。

cs.CV 🔴 高级 2026-04-16 8 次浏览
Fei Tang Bofan Chen Zhengxi Lu Tongbo Chen Songqin Nong Tao Jiang Wenhao Xu Weiming Lu Jun Xiao Yueting Zhuang Yongliang Shen
GUI定位 不确定性 自适应放大 深度学习 计算机视觉

核心发现

方法论

UI-Zoomer是一种无需训练的自适应放大框架,将放大的触发和尺度视为预测不确定性量化问题。通过结合空间一致性和生成置信度的门控机制,仅在定位不确定时触发放大。放大时,通过总方差定律分解预测方差,计算每个实例的裁剪半径。

关键结果

  • 在ScreenSpot-Pro上,UI-Zoomer提升精度达13.4%,在UI-Vision上提升10.3%,在ScreenSpot-v2上提升4.2%。
  • 实验表明,UI-Zoomer在多种模型架构上均优于强基线,尤其在图标目标上表现显著。
  • 消融实验确认了每个组件的独立贡献和自适应裁剪尺寸的优势。

研究意义

UI-Zoomer在学术界和工业界具有重要意义,解决了小图标和密集布局的定位难题。通过不确定性驱动的放大策略,显著提升了GUI定位的精度和效率,尤其在高分辨率环境中。

技术贡献

UI-Zoomer的技术贡献在于其无需训练的自适应放大框架,结合不确定性量化和自适应裁剪,提供了新的工程可能性和理论保证,超越了现有方法。

新颖性

UI-Zoomer首次将放大触发和尺度视为不确定性量化问题,提出了结合空间一致性和生成置信度的门控机制,与现有方法相比具有显著创新。

局限性

  • 在某些情况下,放大可能导致计算开销增加,尤其在不确定性评估不准确时。
  • 在低分辨率环境中,放大的效果可能不如高分辨率环境明显。

未来方向

未来工作可探索更精细的不确定性量化方法,以及在不同界面类型上的适用性扩展。

AI 总览摘要

UI-Zoomer通过不确定性驱动的自适应放大策略,解决了GUI界面中小图标和密集布局的定位难题。现有方法在处理复杂界面时往往采用固定裁剪比例,忽略了模型的不确定性,导致精度下降和计算开销增加。UI-Zoomer通过结合空间一致性和生成置信度的门控机制,仅在定位不确定时触发放大,并通过总方差定律分解预测方差,计算每个实例的裁剪半径。

实验结果表明,UI-Zoomer在ScreenSpot-Pro、UI-Vision和ScreenSpot-v2等基准上均优于强基线,尤其在图标目标上表现显著。消融实验确认了每个组件的独立贡献和自适应裁剪尺寸的优势。UI-Zoomer在学术界和工业界具有重要意义,解决了小图标和密集布局的定位难题。

尽管UI-Zoomer在高分辨率环境中表现优异,但在低分辨率环境中效果可能不如预期。未来工作可探索更精细的不确定性量化方法,以及在不同界面类型上的适用性扩展。

深度分析

研究背景

GUI定位是自动化界面代理的重要能力,尽管通过监督微调和强化学习取得了显著进展,但在处理小图标和密集布局时仍面临挑战。现有方法在测试时采用固定裁剪比例进行放大,忽略了模型的不确定性,导致精度下降和计算开销增加。

核心问题

现有的GUI定位方法在处理小图标和密集布局时存在局限,尤其在复杂界面中,固定裁剪比例的放大策略无法有效提高定位精度,反而可能导致计算开销增加。

核心创新

UI-Zoomer通过不确定性驱动的自适应放大策略,首次将放大触发和尺度视为不确定性量化问题。结合空间一致性和生成置信度的门控机制,仅在定位不确定时触发放大,并通过总方差定律分解预测方差,计算每个实例的裁剪半径。

方法详解

  • �� UI-Zoomer通过不确定性量化来触发放大。
  • �� 结合空间一致性和生成置信度的门控机制。
  • �� 通过总方差定律分解预测方差,计算裁剪半径。
  • �� 在不确定时进行自适应放大。

实验设计

实验在ScreenSpot-Pro、UI-Vision和ScreenSpot-v2上进行,评估了UI-Zoomer在多种模型架构上的性能。使用的基线包括固定裁剪比例的方法和现有的放大策略。

结果分析

UI-Zoomer在ScreenSpot-Pro上提升精度达13.4%,在UI-Vision上提升10.3%,在ScreenSpot-v2上提升4.2%。消融实验确认了每个组件的独立贡献和自适应裁剪尺寸的优势。

应用场景

UI-Zoomer可用于提高复杂界面中小图标和密集布局的定位精度,尤其在高分辨率环境中表现优异。其自适应放大策略可减少不必要的计算开销。

局限与展望

尽管UI-Zoomer在高分辨率环境中表现优异,但在低分辨率环境中效果可能不如预期。此外,放大可能导致计算开销增加,尤其在不确定性评估不准确时。

通俗解读 非专业人士也能看懂

想象你在一个大型超市购物,寻找特定商品。超市货架上商品密集排列,你需要一种方法来快速找到目标商品。UI-Zoomer就像一个智能购物助手,它会根据你的不确定性来决定是否放大某个货架区域,帮助你更快找到商品。通过结合货架上商品的排列一致性和你的购物清单信心指数,UI-Zoomer只在你不确定时才会放大视野,避免不必要的时间浪费。

简单解释 像给14岁少年讲一样

想象你在玩一个找东西的游戏,屏幕上有很多小图标和密集的布局。UI-Zoomer就像一个聪明的放大镜,只在你不确定时才会放大某个区域,帮助你更快找到目标。它会根据图标的排列一致性和你的信心指数来决定是否放大,这样你就不会浪费时间在不需要放大的地方。是不是很酷?

术语表

不确定性驱动 (Uncertainty-Driven)

一种根据模型预测不确定性来触发操作的方法。

在UI-Zoomer中用于决定是否进行放大。

自适应放大 (Adaptive Zoom-In)

根据具体实例的需求动态调整放大比例的方法。

用于提高GUI定位的精度。

总方差定律 (Law of Total Variance)

一种分解随机变量方差的方法,用于分析预测不确定性。

在UI-Zoomer中用于计算裁剪半径。

空间一致性 (Spatial Consensus)

不同预测结果在空间上的一致性度量。

用于评估预测的可靠性。

生成置信度 (Generation Confidence)

模型在生成预测时的置信度度量。

用于决定是否触发放大。

开放问题 这项研究留下的未解疑问

  • 1 如何在低分辨率环境中提高UI-Zoomer的放大效果?
  • 2 如何进一步优化不确定性量化方法以减少计算开销?

应用场景

近期应用

复杂界面定位

UI-Zoomer可用于提高复杂界面中小图标和密集布局的定位精度,尤其在高分辨率环境中表现优异。

远期愿景

智能界面交互

UI-Zoomer的自适应放大策略可应用于智能界面交互,减少不必要的计算开销,提高用户体验。

原文摘要

GUI grounding, which localizes interface elements from screenshots given natural language queries, remains challenging for small icons and dense layouts. Test-time zoom-in methods improve localization by cropping and re-running inference at higher resolution, but apply cropping uniformly across all instances with fixed crop sizes, ignoring whether the model is actually uncertain on each case. We propose \textbf{UI-Zoomer}, a training-free adaptive zoom-in framework that treats both the trigger and scale of zoom-in as a prediction uncertainty quantification problem. A confidence-aware gate fuses spatial consensus among stochastic candidates with token-level generation confidence to selectively trigger zoom-in only when localization is uncertain. When triggered, an uncertainty-driven crop sizing module decomposes prediction variance into inter-sample positional spread and intra-sample box extent, deriving a per-instance crop radius via the law of total variance. Extensive experiments on ScreenSpot-Pro, UI-Vision, and ScreenSpot-v2 demonstrate consistent improvements over strong baselines across multiple model architectures, achieving gains of up to +13.4\%, +10.3\%, and +4.2\% respectively, with no additional training required.

cs.CV cs.AI cs.CL