GUI-G$^2$: Gaussian Reward Modeling for GUI Grounding

TL;DR

提出GUI-G²,基于高斯奖励模型,将GUI定位从二值变为连续高斯分布,显著提升性能。

cs.LG 🔴 高级 2025-07-22 47 次浏览
Fei Tang Zhangxuan Gu Zhengxi Lu Xuyang Liu Shuheng Shen Changhua Meng Wen Wang Wenqi Zhang Yongliang Shen Weiming Lu Jun Xiao Yueting Zhuang
GUI理解 强化学习 高斯建模 空间推理 奖励机制

核心发现

方法论

该方法通过将GUI元素建模为二维高斯分布,设计点奖励和覆盖奖励两大机制,结合自适应方差调节,实现连续空间优化。采用GRPO算法进行策略优化,利用高斯分布的平滑梯度引导模型学习。具体包括:• 高斯点奖励评估元素中心的定位精度;• 高斯覆盖奖励衡量预测区域与目标区域的空间重叠;• 自适应机制根据元素尺寸调节方差,确保不同尺度元素的奖励一致性。此框架将稀疏二值奖励转变为密集连续信号,有效缓解训练中的梯度稀疏问题。

关键结果

  • 在ScreenSpot、ScreenSpot-v2和ScreenSpot-Pro三个基准上,GUI-G²分别达到了92.0%、93.3%和47.5%的准确率,超越最先进的UI-TARS-72B模型,尤其在ScreenSpot-Pro上提升24.7%。实验显示,该模型在不同界面布局和复杂场景中表现出更强的鲁棒性和泛化能力,验证了连续高斯奖励在空间推理中的优势。
  • 对比离散奖励,连续高斯奖励在训练稳定性和收敛速度上显著优越,训练过程中奖励的平滑梯度引导模型快速逼近目标,减少了训练波动。
  • 通过消融实验验证了点奖励和覆盖奖励的协同作用及自适应方差机制的重要性,确保模型在多尺度、多样化界面中均能有效学习。

研究意义

该研究突破了GUI定位中稀疏二值奖励的局限,将空间推理从离散点变为连续高斯分布,极大提升了模型的学习效率和泛化能力。其创新的奖励设计与自适应机制,为未来GUI智能交互提供了理论基础和工程方案,有望推动自动化界面理解、无监督学习和人机交互等领域的深度融合,解决现有方法在复杂场景下鲁棒性不足的问题。

技术贡献

核心技术在于引入二维高斯分布作为空间表示,结合点奖励与覆盖奖励的双重机制,利用自适应方差调节不同尺度元素的奖励范围。通过将稀疏二值奖励转化为密集连续梯度,显著改善训练稳定性和收敛速度。该方法在策略优化中实现了平滑梯度流,增强了模型对空间细节的敏感性,开创了GUI空间推理的全新范式。

新颖性

本研究首次提出将GUI元素建模为连续高斯分布,并设计双重奖励机制,区别于传统的点或区域二值奖励。创新点在于引入自适应方差调节,确保不同尺度元素的奖励一致性,解决多尺度界面中的空间推理难题。这一方法不仅增强了空间连续性理解,也为强化学习在GUI任务中的应用提供了新思路。

局限性

  • 当前模型在极端复杂界面或极小元素(如微小按钮)上的表现仍有限,主要由于高斯模型对尺度变化的敏感性未完全覆盖所有场景。
  • 训练过程中对超参数(如α)依赖较强,需针对不同任务进行调优,影响泛化效率。
  • 模型在极端非结构化界面或动态变化场景中的适应性尚未充分验证,未来需结合动态建模和多模态信息增强鲁棒性。

未来方向

未来将探索多尺度、多模态融合的高斯建模策略,提升模型对复杂界面和动态变化的适应能力。同时,结合无监督学习和迁移学习,减少对标注数据的依赖,推动GUI理解的自主化和普适化。还计划将该框架扩展到三维空间和多模态交互场景,拓展其在虚拟现实和增强现实中的应用潜力。

AI 总览摘要

随着人机交互方式的不断演进,自动化GUI理解成为智能系统的重要研究方向。传统方法多依赖二值奖励,导致空间推理稀疏且学习效率低,难以应对复杂多变的界面环境。本文提出的GUI-G²框架,通过将GUI元素建模为二维高斯分布,创新性地引入点奖励和覆盖奖励机制,结合自适应方差调节,有效缓解了稀疏梯度问题。

该方法将空间定位从离散点转变为连续概率分布,利用高斯分布的平滑梯度,为模型提供丰富的学习信号。实验结果显示,在多个GUI基准上,GUI-G²显著优于现有最先进方法,尤其在高分辨率复杂界面中表现出更强的鲁棒性和泛化能力。这一突破为未来GUI智能交互提供了新的理论基础和工程方案。

通过详细的算法设计和大量实证验证,本文不仅丰富了空间推理的理论体系,也为强化学习在实际场景中的应用开辟了新路径。未来,结合多模态信息和无监督学习,GUI-G²有望在自动化界面理解、虚拟现实等领域发挥更大作用,推动人机交互迈向更智能、更自然的新时代。

深度分析

研究背景

GUI理解作为人机交互的核心,经历了从基于规则的图像处理到深度学习模型的演变。早期方法依赖手工特征和模板匹配,效果有限。近年来,深度卷积神经网络(如ResNet、EfficientNet)结合自然语言处理模型(如BERT、GPT)推动了界面理解的发展。代表性工作包括HTML结构解析、视觉特征提取、OCR和SAM等视觉模型的结合,显著提升了元素定位的准确性。然而,现有方法多采用二值奖励,导致训练稀疏,难以捕捉空间连续性,限制了模型的泛化能力。尽管如此,深度强化学习的引入为GUI任务提供了新的优化路径,但奖励设计仍是瓶颈。

核心问题

核心问题在于,GUI元素的空间定位本质上是连续空间中的优化问题,二值奖励无法充分利用空间信息,导致训练过程中的梯度稀疏,模型难以学习到细粒度的空间关系。此外,界面元素尺度差异大,固定参数的奖励机制难以适应多样化场景,影响模型的泛化能力。如何设计一种既能反映空间连续性,又能适应多尺度元素的奖励机制,成为提升GUI理解性能的关键。

核心创新

本研究提出将GUI元素建模为二维高斯分布,解决空间连续性的问题。具体创新包括:1)引入高斯点奖励,利用指数衰减的概率分布评估元素中心的定位精度;2)设计高斯覆盖奖励,衡量预测区域与目标区域的空间重叠,增强区域感知;3)实现自适应方差调节,根据元素尺寸动态调整奖励分布,确保多尺度元素的奖励一致性。这一机制突破了传统二值奖励的限制,提供了平滑、密集的梯度信号,有效提升训练效率和模型鲁棒性。

方法详解

  • �� 输入:界面截图和自然语言指令。
  • �� 目标:预测元素的像素位置(边界框)。
  • �� 高斯建模:将元素边界框转化为二维高斯分布,定义均值为元素中心,协方差根据元素尺寸自适应调节。
  • �� 高斯点奖励:计算预测中心与目标高斯分布的匹配程度,利用指数函数提供连续梯度。
  • �� 高斯覆盖奖励:衡量预测区域与目标区域的空间重叠,采用Bhattacharyya系数的闭式解。
  • �� 自适应机制:根据元素尺寸调整标准差,确保奖励在不同尺度下合理。
  • �� 训练:结合两种奖励,利用GRPO算法进行策略优化,最大化奖励总和。
  • �� 结果:模型在多个基准上实现了优异性能,训练稳定,泛化能力强。

实验设计

采用ScreenSpot、ScreenSpot-v2和ScreenSpot-Pro三个公开基准,比较不同奖励机制的效果。模型基于Qwen2.5-VL-7B,训练参数包括学习率1e-6,批次大小8,采样响应数为8。对比离散奖励(点、IoU)和连续高斯奖励,评估指标为准确率。通过消融实验验证点奖励、覆盖奖励和自适应机制的贡献。模型在不同界面类型和复杂度场景中表现出色,验证了方法的普适性和优越性。

结果分析

在三个基准上,GUI-G²分别达到92.0%、93.3%和47.5%的准确率,超越所有RL方法,尤其在ScreenSpot-Pro上提升24.7%。实验还显示,连续高斯奖励训练更稳定,收敛更快,模型对界面变化的鲁棒性明显增强。消融分析确认双重奖励和自适应机制的协同作用,显著改善多尺度、多样化场景中的性能。

应用场景

该方法适用于自动化界面操作、智能助手、虚拟现实等场景,尤其在需要高精度空间定位的任务中表现优异。可结合自然语言理解模型,实现端到端的界面交互系统,提升用户体验和操作效率。未来还可扩展到多模态、多尺度、多场景的复杂交互环境中。

局限与展望

模型在极端复杂或微小元素(如微调按钮)上的表现仍有限,主要由于高斯模型对尺度变化的敏感性。训练过程中对超参数依赖较强,泛化到动态变化场景仍需优化。未来需结合多模态信息和动态建模,提升适应性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,目标是找到调料瓶。传统方法就像用手指点一点,告诉你是否在瓶子上,但这种方式很粗糙,容易错过。现在,如果用一张模糊的照片,模糊中带有清晰的中心点和逐渐变淡的边缘,你就能更准确地找到调料瓶的具体位置。这就像用高斯分布描述GUI元素,既能告诉你元素的中心,又能描述它的范围。这样,厨师(模型)就能更快、更准地找到调料瓶,做饭也更顺利。这种连续的“模糊”方式,让机器学习变得更自然、更高效。

简单解释 像给14岁少年讲一样

想象你在玩寻宝游戏,你要找到藏在房间里的宝箱。用传统的方法,就是看见宝箱就算对了,否则就算错了,特别难找到隐藏得很好的宝箱。而现在,如果你用一张带有模糊中心的地图,宝箱的可能位置会在地图上逐渐变淡,中心最清楚,边缘模糊。这样,你可以根据地图的模糊区域,逐步缩小范围,更容易找到宝箱。这就像用高斯分布描述GUI元素,让模型知道元素的中心和范围,从而更快更准地定位目标。这个方法让找目标变得像玩游戏一样简单又有趣!

原文摘要

Graphical User Interface (GUI) grounding maps natural language instructions to precise interface locations for autonomous interaction. Current reinforcement learning approaches use binary rewards that treat elements as hit-or-miss targets, creating sparse signals that ignore the continuous nature of spatial interactions. Motivated by human clicking behavior that naturally forms Gaussian distributions centered on target elements, we introduce GUI Gaussian Grounding Rewards (GUI-G$^2$), a principled reward framework that models GUI elements as continuous Gaussian distributions across the interface plane. GUI-G$^2$ incorporates two synergistic mechanisms: Gaussian point rewards model precise localization through exponentially decaying distributions centered on element centroids, while coverage rewards assess spatial alignment by measuring the overlap between predicted Gaussian distributions and target regions. To handle diverse element scales, we develop an adaptive variance mechanism that calibrates reward distributions based on element dimensions. This framework transforms GUI grounding from sparse binary classification to dense continuous optimization, where Gaussian distributions generate rich gradient signals that guide models toward optimal interaction positions. Extensive experiments across ScreenSpot, ScreenSpot-v2, and ScreenSpot-Pro benchmarks demonstrate that GUI-G$^2$, substantially outperforms state-of-the-art method UI-TARS-72B, with the most significant improvement of 24.7% on ScreenSpot-Pro. Our analysis reveals that continuous modeling provides superior robustness to interface variations and enhanced generalization to unseen layouts, establishing a new paradigm for spatial reasoning in GUI interaction tasks.

cs.LG cs.AI cs.CL cs.CV cs.HC