One Forward Beats Two: InnerZoom for Accurate and Efficient GUI Grounding

TL;DR

InnerZoom通过单次前向传递实现高效准确的GUI定位,显著提升了基准测试成绩。

cs.CV 🔴 高级 2026-06-29 2 次浏览
Chen Liu Ling Chen Hanzhang Zhou Liangyu Chen Chenglin Cai Xin Yu Steven Hoi Yue Wang
GUI定位 机器学习 跨层证据 高效计算 深度学习

核心发现

方法论

InnerZoom通过单次前向传递实现跨层证据桥接,避免了传统ZoomIn方法的额外计算成本。其核心在于将中间层的目标区域证据转化为紧凑的跨层状态,并在后续解码层中保留、优化和重新注入该状态以指导坐标预测。

关键结果

  • InnerZoom在六个GUI定位基准测试中表现出色,OSWorld-G上得分64.7,UI-Vision上得分40.2,OSWorld-GR上得分73.1,MMBench-GUI上得分87.6,分别比之前的最佳结果高出4.1、3.2、2.9和2.3分。
  • 在4B设置下,InnerZoom平均提高了5.3分,并在减少31.8%延迟和29%计算量的同时,超越了双次ZoomIn方法1.3分。
  • 消除了目标区域证据在最终坐标预测中的丢失问题,通过跨层证据状态的维护和优化,实现了更高的定位精度。

研究意义

InnerZoom的提出解决了GUI定位中区域到点的转换瓶颈,显著减少了计算成本和延迟时间。这一方法不仅提升了定位精度,还为交互式GUI代理提供了更高效的解决方案,具有重要的学术和工业应用价值。

技术贡献

InnerZoom在技术上通过单次前向传递实现了跨层证据的桥接,避免了传统方法的额外计算开销。它引入了迭代证据适配器和证据引导解码机制,提供了新的工程可能性和理论保证。

新颖性

InnerZoom首次实现了在单次前向传递中跨层证据的有效桥接,与现有的ZoomIn方法相比,提供了更高效的解决方案,避免了额外的推理过程。

局限性

  • 在某些复杂界面中,目标区域的识别可能仍然不够精确,影响最终的坐标预测。
  • 对大规模模型的适应性和扩展性需要进一步验证。

未来方向

未来的研究可以探索InnerZoom在更大规模数据集上的表现,以及如何进一步优化跨层证据状态的提取和利用。

AI 总览摘要

在图形用户界面(GUI)定位中,传统方法通常需要多次前向传递以提高精度,这导致了计算成本和延迟的增加。InnerZoom通过单次前向传递实现了高效的GUI定位,其核心在于跨层证据的桥接。该方法将中间层的目标区域证据转化为紧凑的跨层状态,并在后续解码层中保留、优化和重新注入该状态以指导坐标预测。

实验结果显示,InnerZoom在多个基准测试中取得了显著的性能提升,尤其是在OSWorld-G、UI-Vision等数据集上均超越了现有的最佳结果。此外,InnerZoom显著减少了计算延迟和资源消耗,为交互式GUI代理提供了更高效的解决方案。

尽管InnerZoom在精度和效率上取得了突破,但在复杂界面中的适应性仍需进一步研究。未来的工作可以探索其在更大规模数据集上的表现,以及如何进一步优化跨层证据状态的提取和利用。

深度分析

研究背景

随着人机交互技术的发展,图形用户界面(GUI)定位成为了一个重要的研究领域。传统方法往往依赖于多次前向传递以提高定位精度,但这带来了计算成本和延迟的增加。近年来,基于机器学习的大模型方法逐渐成为主流,但在区域到点的转换过程中仍存在瓶颈。

核心问题

GUI定位的核心问题在于如何在不增加计算成本的情况下提高定位精度。传统的ZoomIn方法虽然提高了精度,但需要额外的推理过程,导致计算资源的浪费。

核心创新

InnerZoom的核心创新在于通过单次前向传递实现跨层证据的桥接。该方法避免了传统ZoomIn方法的额外计算开销,通过维护和优化跨层证据状态,实现了更高效的坐标预测。

方法详解

  • �� 提取目标区域证据:从中间层解码器响应中提取目标区域线索。
  • �� 证据状态优化:通过迭代证据适配器优化跨层证据状态。
  • �� 证据引导解码:将优化后的证据状态注入到目标区域位置的键/值投影中。

实验设计

实验采用了多个公开数据集,包括OS-Atlas、OmniAct等,评估了InnerZoom在不同基准测试中的表现。通过与现有方法的对比,验证了InnerZoom在精度和效率上的优势。

结果分析

InnerZoom在多个基准测试中均超越了现有的最佳结果,尤其是在OSWorld-G和UI-Vision数据集上,分别提高了4.1和3.2分。此外,InnerZoom显著减少了计算延迟和资源消耗。

应用场景

InnerZoom可直接应用于交互式GUI代理中,提高其响应速度和精度。其高效的计算方式使其在资源受限的环境中具有广泛的应用潜力。

局限与展望

尽管InnerZoom在精度和效率上取得了突破,但在复杂界面中的适应性仍需进一步研究。此外,对大规模模型的适应性和扩展性也需要进一步验证。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。传统的方法就像是每次做一道菜都要先把所有的食材准备好,然后再开始做,这样虽然能保证每道菜都很精致,但时间和精力的消耗很大。而InnerZoom的方法就像是提前准备好一些基础的调料和食材,然后在做每道菜的时候根据需要灵活调整,这样不仅节省了时间,还能保证每道菜的质量。通过这种方式,InnerZoom在不增加额外计算成本的情况下,提高了GUI定位的精度和效率。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要快速点击屏幕上的目标。传统的方法就像是每次都要先放大屏幕,找到目标再点击,这样虽然准确但很慢。而InnerZoom的方法就像是直接在游戏中标记出目标的位置,让你可以快速点击,不用每次都放大屏幕。这样不仅提高了游戏的速度,还能保证你每次都能准确点击到目标。是不是很酷?

术语表

GUI定位

图形用户界面定位是指在用户界面中根据指令找到并点击目标位置的过程。

在论文中用于描述InnerZoom的应用场景。

跨层证据

跨层证据是指在神经网络的不同层之间传递和优化的目标区域信息。

用于InnerZoom方法中指导坐标预测的核心机制。

ZoomIn方法

一种通过多次前向传递提高GUI定位精度的方法。

与InnerZoom进行对比的传统方法。

证据适配器

证据适配器是一种用于优化和传递跨层证据状态的机制。

在InnerZoom中用于优化目标区域证据。

目标区域

目标区域是指在GUI中需要定位和点击的具体区域。

在InnerZoom中通过中间层解码器响应提取。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的界面中提高目标区域识别的精度?
  • 2 InnerZoom在大规模模型上的适应性如何?

应用场景

近期应用

交互式GUI代理

InnerZoom可以应用于交互式GUI代理中,提高其响应速度和精度,适用于资源受限的环境。

远期愿景

智能人机交互系统

InnerZoom可以为智能人机交互系统提供更高效的解决方案,推动该领域的发展。

原文摘要

MLLM-based GUI grounding methods commonly formulate target localization as autoregressive coordinate generation, enabling models to leverage the strong instruction-following and semantic understanding capabilities of MLLMs. However, this formulation requires the model to retain region-level target evidence while decoding coordinate tokens with the spatial precision demanded by GUI clicking. Our diagnostic analysis reveals that target-region awareness emerges in intermediate decoder layers but is neither retained nor translated into the final coordinate prediction. Existing ZoomIn-style methods address this issue through an external crop-and-rerun pass, which improves localization but increases end-to-end latency and computational cost. To retain the accuracy benefits of two-pass zooming without this extra cost, we propose InnerZoom, a single-forward framework for cross-layer evidence bridging. InnerZoom transforms target-related cues from the original forward pass into a compact cross-layer evidence state, then preserves, refines, and reinjects this state throughout later decoding layers to guide coordinate prediction. Extensive experimental results suggest that InnerZoom-4B achieves state-of-the-art performance on all six GUI grounding benchmarks, obtaining 64.7 on OSWorld-G, 40.2 on UI-Vision, 73.1 on OSWorld-GR, and 87.6 on MMBench-GUI, surpassing the previous best results by 4.1, 3.2, 2.9, and 2.3 points, respectively. Under a controlled 4B setting, InnerZoom improves the same SFT+RL baseline by 5.3 points on average and outperforms two-pass ZoomIn by 1.3 points on average, while reducing end-to-end latency by up to 31.8% and TFLOPs by about 29%. Code and models will be publicly available.

cs.CV