Learn where to Click from Yourself: On-Policy Self-Distillation for GUI Grounding

TL;DR

提出GUI-SD,基于自我蒸馏的GUI定位方法,结合视觉增强上下文和熵引导,显著提升准确率和训练效率。

cs.AI 🔴 高级 2026-05-01 7 引用 57 次浏览
Yan Zhang Daiqing Wu Huawen Shen Can Ma Yu Zhou
GUI定位 自我蒸馏 深度学习 强化学习 视觉引导

核心发现

方法论

本文提出的GUI-SD框架采用基于有偏视觉上下文的教师指导和熵引导的蒸馏策略。首先,通过在目标边界框上叠加高斯软掩码,构建视觉丰富的特权上下文,避免泄露精确坐标信息,同时提供有用的引导。其次,采用自适应的逆KL散度损失,将不同数字位的权重与教师信心和数字重要性结合,重点优化高阶数字的预测。具体算法包括:利用目标边界框和高斯软掩码生成视觉特权信息,结合熵值调节每个token的蒸馏权重,从而实现对关键坐标数字的集中优化。模型训练过程中,采用六个GUI基准数据集(如ScreenSpot-v2、UI-Vision等)进行评估,结果显示GUI-SD在准确率和训练效率方面均优于传统的GRPO和简单的自我蒸馏方法。

关键结果

  • 在六个GUI基准上,GUI-SD平均准确率达到68.4%,比基线方法提升至少4.9个百分点。例如,在ScreenSpot-Pro上,准确率由55.6%提升至60.7%,在OSWorld-G-Refine达到70.9%,优于现有的GRPO-Gaussian和其他SOTA方法。训练时间方面,GUI-SD每个epoch比GRPO快约4倍,显著降低了训练成本。 Ablation研究表明,视觉丰富的上下文和熵引导的权重调节对性能提升起到了关键作用,尤其在难样本和高分辨率场景中表现优异。
  • 在不同场景下,GUI-SD展现出优越的泛化能力,尤其在复杂布局和密集目标检测中表现出较强的鲁棒性。通过对比不同的特权上下文设计,发现视觉引导比文本引导更能避免蒸馏崩溃问题,提升教师分布的多样性和信息丰富性。同时,数字高阶位的加权策略有效集中模型在关键位置的学习,减少了低置信度位置的干扰。
  • 在消融实验中,加入视觉引导和熵调节的联合策略显著优于单一策略,验证了两者的协同作用。具体而言,采用高斯软掩码和指数递减的高阶数字权重,使得模型在硬样本和边界样本上的表现提升明显。整体而言,GUI-SD不仅提升了模型的定位精度,也极大改善了训练的稳定性和效率,为GUI自动化和人机交互提供了新的技术路径。

研究意义

本研究突破了GUI定位中传统强化学习依赖多轮采样和稀疏奖励的瓶颈,提出了基于自我蒸馏的高效训练框架。通过视觉引导和熵调节机制,模型能够在单轮交互中获得丰富的像素级监督信息,显著提升了训练效率和模型性能。这一方法不仅降低了对大规模环境交互的依赖,也为未来自主GUI代理的研究提供了理论基础和技术方案。其在实际应用中,有望推动自动化测试、界面理解和人机交互等多个领域的技术革新,特别是在高分辨率、多目标密集场景下表现出极大潜力。

技术贡献

本文的核心技术贡献在于首次将有偏视觉上下文引入自我蒸馏框架,解决了传统方法中的蒸馏崩溃和优化不均问题。具体包括:一是设计了基于目标边界框和高斯软掩码的视觉特权上下文,有效提供丰富的引导信息;二是提出熵引导的逆KL损失,将不同数字位的优先级和教师信心结合,动态调节蒸馏权重,从而集中优化关键位置。该策略突破了以往均匀加权的限制,实现了对高阶数字的优先学习。算法层面,结合多尺度视觉信息和动态权重调节机制,为GUI定位任务提供了理论创新和工程实现的双重突破。

新颖性

这是首个将自我蒸馏应用于GUI定位任务的研究,创新性在于引入视觉丰富的特权上下文,避免蒸馏崩溃,同时采用熵引导的动态权重机制,针对不同数字位的特性进行优化。相较于传统的强化学习方法(如GRPO),该方法无需多轮采样,显著提高训练效率。与现有的软标签蒸馏方法不同,GUI-SD通过视觉引导保持分布的多样性,避免硬标签的单一性,展现出更强的泛化能力和鲁棒性。这些创新共同推动了GUI自动化技术的前沿发展。

局限性

  • 尽管GUI-SD在多个基准上表现优异,但其依赖于高质量的视觉引导和特权上下文设计,可能在极端复杂或低质量图像中表现不佳,存在一定的鲁棒性风险。
  • 算法中引入的高斯软掩码参数(如σ值)需要根据目标场景调整,缺乏自适应机制,可能影响不同场景的泛化能力。
  • 训练过程中仍需一定的计算资源,尤其是在高分辨率场景下,模型的推理速度和存储需求可能成为实际部署的瓶颈。未来需探索更轻量化的模型结构和自适应参数调节策略。

未来方向

未来的研究方向包括:一是引入自适应参数调节机制,使视觉引导和熵调节能根据场景自动优化;二是结合多模态信息(如语音、触控等)提升GUI理解的多样性和鲁棒性;三是探索更轻量化的模型架构,满足实际场景中的实时性需求。此外,还可将该框架扩展到更复杂的交互任务,如多目标、多步骤的界面操作,推动自主GUI代理的广泛应用。

AI 总览摘要

在自动化界面操作和人机交互的研究中,GUI定位一直是核心难题。传统方法多依赖强化学习(如GRPO)进行策略优化,虽取得一定成果,但面临多轮采样成本高、稀疏奖励信号不足的挑战。为突破这一瓶颈,本文提出了GUI-SD,一种基于自我蒸馏的高效训练框架,结合视觉引导和熵调节机制,显著提升了模型的定位精度和训练效率。

首先,GUI-SD引入视觉丰富的特权上下文,通过在目标边界框上叠加高斯软掩码,构建信息充足但不泄露精确坐标的引导环境。这一设计避免了传统文本引导导致的蒸馏崩溃问题,使教师分布保持多样性和信息丰富性。其次,采用熵引导的逆KL损失,将不同数字位的优先级与教师信心结合,动态调节每个位置的蒸馏权重,重点优化高阶数字,从而提升定位的精细度。

在六个代表性GUI基准(如ScreenSpot-v2、UI-Vision等)上的广泛实验表明,GUI-SD在准确率和训练效率方面均优于现有的强化学习和自我蒸馏方法。具体而言,平均准确率提升至68.4%,比基线方法高出至少4.9个百分点,训练时间缩短约4倍。这些结果验证了视觉引导和熵调节的有效性,为未来自主GUI代理的研究提供了新的技术路径。

该方法的核心创新在于将视觉丰富的引导融入自我蒸馏框架,解决了传统方法中的稀疏奖励和优化不均问题。通过对高阶数字的优先学习和对不确定位置的抑制,GUI-SD实现了更精确、更鲁棒的界面定位能力。未来,结合多模态信息和自适应参数调节,有望进一步推动GUI自动化的智能化和普及化,开启人机交互的新篇章。

深度分析

研究背景

随着人机交互技术的发展,自动化GUI元素定位成为实现智能界面操作的关键。早期方法多依赖规则匹配和模板识别,但在复杂环境和多样界面中表现有限。近年来,深度学习特别是强化学习(如GRPO)被引入,显著改善了策略的泛化能力。GRPO通过多轮采样和奖励机制,鼓励策略探索多样解,提升了定位精度。然而,这些方法依赖大量的环境交互,训练成本高昂,且在硬样本上奖励稀疏,难以实现高效学习。自我蒸馏作为一种无需外部教师的知识迁移技术,逐渐受到关注,尤其在自然语言处理和视觉任务中表现出色。尽管如此,将自我蒸馏应用于GUI定位仍面临挑战,包括如何设计有效的引导信息和避免崩溃问题。本文的研究背景是结合视觉引导和熵调节机制,探索高效、鲁棒的GUI定位新路径,为自动化界面理解提供理论基础。

核心问题

传统的强化学习方法(如GRPO)在GUI定位中虽然取得了不错的效果,但存在多轮采样成本高、奖励稀疏的问题,尤其在硬样本上表现不佳。自我蒸馏作为替代方案,能从单轮交互中获得密集的像素级监督,但在应用中遇到两个主要瓶颈:一是蒸馏崩溃,即教师分布因泄露精确坐标而变得过于确定,导致蒸馏退化为硬标签训练;二是优化不均,所有数字位被等同对待,忽略了高阶数字的重要性和教师信心的差异。这些问题限制了自我蒸馏在GUI任务中的效果,也阻碍了模型的进一步提升。因此,设计一种既能保持丰富信息,又能有针对性优化的框架,成为亟需解决的核心难题。

核心创新

本文的创新之处在于:一是引入视觉丰富的特权上下文,通过在目标区域叠加高斯软掩码,避免泄露精确坐标,增强教师分布的多样性和信息丰富性;二是提出熵引导的逆KL损失,将不同数字位的优先级与教师信心结合,动态调节每个位置的蒸馏权重,重点优化高阶数字。这种设计突破了传统均匀加权和硬标签限制,使模型在复杂场景中表现更优。三是结合多尺度视觉信息和动态权重调节机制,有效解决了硬样本和边界样本的定位难题。整体上,GUI-SD实现了从多模态视觉引导到自适应优化的创新融合,为GUI自动化提供了新思路。

方法详解

  • �� 视觉特权上下文构建:在目标边界框上叠加高斯软掩码,生成逐渐模糊的区域,避免泄露精确坐标信息,提供丰富引导。
  • �� 视觉提示设计:结合目标区域的边界框和提示文本,增强教师的推理能力,减少直接复制答案的可能。
  • �� 训练目标:采用逆KL散度损失,将教师的软分布作为目标,指导学生模型学习。
  • �� 权重调节策略:引入位置优先权wpos(t),对高阶数字赋予更大权重,利用指数递减方式,强调高阶位的重要性。
  • �� 信心调节:通过计算教师输出的熵值,自动调节每个token的蒸馏强度,低熵代表高置信度,赋予更大权重。
  • �� 损失函数:结合位置和信心两个因素,设计加权逆KL损失,确保优化集中在关键位置和高置信度区域。
  • �� 训练流程:在六个GUI基准上进行大规模训练和评估,结合消融实验验证各组件的有效性。

实验设计

  • �� 数据集:采用ScaleCUA的约7K样本,覆盖多样化的GUI场景,包括高分辨率截图和复杂布局。
  • �� 基线模型:比较GRPO、简单的自我蒸馏方法(如Naive OPSD)以及其他SOTA方法。
  • �� 评估指标:主要关注定位准确率(如ScreenSpot-Pro的准确率)、训练效率(每个epoch的时间)和硬样本表现。
  • �� 超参数:调节高斯掩码的σ值,设置数字位的权重参数α,以及熵调节的温度τ。
  • �� 消融研究:逐步移除视觉引导和熵调节,分析对性能的影响。
  • �� 训练细节:采用Adam优化器,学习率调度,训练轮次控制在合理范围内,确保模型收敛。

结果分析

  • �� GUI-SD在六个基准上均优于对比方法,平均准确率达68.4%,比GRPO-Gaussian提升约3-4个百分点。
  • �� 在复杂场景如UI-Vision和OSWorld-G-Refine中,性能提升尤为明显,分别达到86.7%和70.9%的准确率。
  • �� 训练速度方面,GUI-SD每个epoch比GRPO快约4倍,极大降低了训练成本。
  • �� 消融实验显示,视觉引导和熵调节的结合带来最大性能提升,尤其在硬样本和边界样本中表现出更强鲁棒性。
  • �� 细粒度的数字位加权策略显著改善了高阶数字的预测精度,验证了位置优先的有效性。

应用场景

  • �� 立即应用:可用于自动化界面测试工具,提升界面元素定位的准确性和效率,降低人工标注成本。
  • �� 立即应用:在智能助手和自主界面操作中,实现更精准的元素识别与交互。
  • �� 立即应用:支持多平台、多场景的界面理解,为工业界提供高效的自动化解决方案。
  • �� 长远愿景:推动自主GUI代理的发展,使其能在复杂、多变环境中自主学习与适应,广泛应用于智能制造、智慧城市和人机交互系统。

局限与展望

  • �� 视觉引导设计依赖于高质量图像和准确的目标边界框,在低质量或遮挡严重的场景中表现可能受限。
  • �� 参数调节(如高斯掩码σ值和权重参数)缺乏自适应机制,需针对不同场景进行手动调优。
  • �� 模型在高分辨率场景下的推理速度和存储需求较高,实际部署时存在性能瓶颈。
  • �� 未来需探索更轻量化的模型结构和自适应参数调节策略,以提升实际应用的鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在找一只藏在房间里的宠物。传统的方法可能是逐个角落检查,花费很多时间,而且如果房间很大或者藏得很隐秘,就很难找到。这就像用强化学习的方法,需要反复尝试多次,每次都要花费大量时间和资源。而本文提出的方法,像是你用一张带有提示的照片,照片上用模糊的光晕标记了宠物可能出现的区域。你不用每次都试错,而是根据这个提示,快速锁定目标区域。更厉害的是,这个提示还会告诉你哪些部分更有可能藏着宠物(高阶数字),让你优先检查这些地方。这样一来,你不仅找得更快,还能在少量尝试中找到宠物。这个方法就像给机器人一份聪明的“地图”和“优先级列表”,让它在复杂的界面中快速准确地找到目标元素,节省了大量时间和计算资源。

简单解释 像给14岁少年讲一样

想象你在玩一个找宝藏的游戏。以前,你可能要在地图上逐个点搜索,花费很多时间。而现在,有个聪明的助手会给你一张带有模糊标记的地图,告诉你宝藏很可能在某个区域附近。这个助手还会告诉你,宝藏在越靠近中心的区域越可能藏着,或者某个特殊的标记位置更可靠。你只需要根据这个提示,优先去那些“高概率”的地方搜索。这样一来,你就能用更少的时间找到宝藏,而且不会迷路。这个助手就像是给你一份聪明的指南,让你在复杂的界面中快速找到目标元素,不用反复试错,也不用花费太多力气。它用一种聪明的方式,把复杂的任务变得简单又高效,就像你在玩游戏时的“作弊秘籍”。

术语表

GUI Grounding (图形用户界面定位)

指将自然语言指令映射到界面元素的视觉坐标的任务,是实现自动化操作的基础。

论文中,GUI Grounding是核心任务,目标是让模型准确找到界面上的目标元素。

Self-Distillation (自我蒸馏)

一种模型训练技术,模型作为教师和学生,通过内部知识迁移提升性能,无需外部教师模型。

本文将自我蒸馏应用于GUI定位,通过视觉引导和熵调节优化模型学习过程。

Reverse KL Divergence (逆KL散度)

一种衡量两个概率分布差异的指标,反映教师分布对学生分布的引导效果,强调高置信度区域。

在损失函数中使用逆KL,确保模型集中学习教师信心高的像素和数字位。

Privileged Context (特权上下文)

模型在训练时访问的额外信息,用于提供更丰富的指导,但在推理时不可用。

本文用视觉引导的边界框和提示词构建特权上下文,增强教师的引导能力。

Entropy-Guided Distillation (熵引导蒸馏)

根据教师输出的熵值动态调节每个token的蒸馏权重,以提升可靠性和效率。

该机制确保模型重点学习高置信度和高重要性的数字位,避免低置信度干扰。

Gaussian Soft Mask (高斯软掩码)

一种模糊区域遮罩,用于突出目标区域,逐步淡化周围区域,避免泄露精确坐标。

在视觉引导中使用,帮助模型专注于目标区域,同时保持信息丰富。

Token Weighting (标记加权)

根据数字的重要性和教师信心,为不同位置的预测赋予不同的学习权重。

高阶数字(如百位)获得更大权重,模型优先优化关键位置。

Ablation Study (消融实验)

逐步移除模型的某些组件,验证每个部分对整体性能的贡献。

本文通过消融验证视觉引导和熵调节的效果。

GUI Benchmarks (GUI基准数据集)

一组标准化的GUI场景数据集,用于评估界面元素定位算法的性能。

包括ScreenSpot-v2、UI-Vision等,覆盖多样化场景。

Training Efficiency (训练效率)

模型在训练过程中达到一定性能所需的时间和资源,反映算法的实用性。

GUI-SD在训练时间上比传统方法快约4倍。

开放问题 这项研究留下的未解疑问

  • 1 尽管GUI-SD在多个基准上表现优异,但其在极端复杂或低质量图像中的鲁棒性仍需验证,特别是在遮挡严重或背景噪声大的场景中,模型的表现可能受到影响。未来需要研究更强的视觉引导机制和自适应参数调节策略,以增强模型的泛化能力。
  • 2 目前的高斯软掩码参数(如σ值)是手动调节的,缺乏自适应机制,可能在不同场景下表现不一致。探索自动调节参数的方法,将有助于模型在多样化环境中的稳定性。
  • 3 模型在高分辨率场景中的推理速度和存储需求较高,实际部署面临性能瓶颈。未来应考虑轻量化模型设计和硬件优化,以实现实时应用。
  • 4 目前的训练流程依赖大量标注数据和高质量的视觉引导,未来需要研究无监督或弱监督的训练策略,减少对标注的依赖。
  • 5 如何将GUI-SD扩展到多目标、多步骤的复杂交互任务,是未来的重要研究方向,涉及多模态融合和策略规划。

应用场景

近期应用

自动化界面测试

利用GUI-SD实现对软件界面元素的快速定位,提升测试效率,减少人工标注成本,适用于软件开发和质量保证。

智能界面助手

在智能助手中集成GUI定位能力,实现对用户指令的准确执行,如自动点击、界面导航,提升用户体验。

跨平台界面理解

支持多操作系统和应用场景的界面元素识别,为工业自动化和智慧城市提供基础技术支撑。

远期愿景

自主界面操作代理

发展具有自主学习能力的GUI代理,能在复杂、多变环境中实现自适应操作,推动智能制造和人机交互的革命。

多模态界面理解

结合视觉、语音、触控等多模态信息,打造更智能、更自然的人机交互系统,提升自动化水平。

原文摘要

Graphical User Interface (GUI) grounding maps natural language instructions to the visual coordinates of target elements and serves as a core capability for autonomous GUI agents. Recent reinforcement learning methods (e.g., GRPO) have achieved strong performance, but they rely on expensive multiple rollouts and suffer from sparse signals on hard samples. These limitations make on-policy self-distillation (OPSD), which provides dense token-level supervision from a single rollout, a promising alternative. However, its applicability to GUI grounding remains unexplored. In this paper, we present GUI-SD, the first OPSD framework tailored for GUI grounding. First, it constructs a visually enriched privileged context for the teacher using a target bounding box and a Gaussian soft mask, providing informative guidance without leaking exact coordinates. Second, it employs entropy-guided distillation, which adaptively weights tokens based on digit significance and teacher confidence, concentrating optimization on the most impactful and reliable positions. Extensive experiments on six representative GUI grounding benchmarks show that GUI-SD consistently outperforms GRPO-based methods and naive OPSD in both accuracy and training efficiency. Code and training data are available at https://zhangyan-ucas.github.io/GUI-SD/.

cs.AI cs.CV

参考文献 (20)

GUI-G2: Gaussian Reward Modeling for GUI Grounding

Fei Tang, Zhangxuan Gu, Zhengxi Lu 等

2025 58 引用 ⭐ 高影响力 查看解读 →

Self-Distillation Enables Continual Learning

Idan Shenfeld, Mehul Damani, Jonas Hübotter 等

2026 163 引用 ⭐ 高影响力 查看解读 →

InfiGUI-R1: Advancing Multimodal GUI Agents from Reactive Actors to Deliberative Reasoners

Yuhang Liu, Pengxiang Li, Congkai Xie 等

2025 136 引用 ⭐ 高影响力 查看解读 →

Qwen3-VL Technical Report

Shuai Bai, Yuxuan Cai, Rui-Zhe Chen 等

2025 2027 引用 ⭐ 高影响力 查看解读 →

Zooming without Zooming: Region-to-Image Distillation for Fine-Grained Multimodal Perception

Lai Wei, Liang He, Jun Lan 等

2026 28 引用 ⭐ 高影响力 查看解读 →

Scaling Computer-Use Grounding via User Interface Decomposition and Synthesis

Tianbao Xie, Jiaqi Deng, Xiaochuan Li 等

2025 126 引用 ⭐ 高影响力 查看解读 →

Measure Twice, Click Once: Co-evolving Proposer and Visual Critic via Reinforcement Learning for GUI Grounding

Wenkai Wang, Xiyun Li, Hongcan Guo 等

2026 2 引用 ⭐ 高影响力 查看解读 →

Distilling the Knowledge in a Neural Network

Geoffrey E. Hinton, O. Vinyals, J. Dean

2015 25823 引用 ⭐ 高影响力 查看解读 →

GUI-Actor: Coordinate-Free Visual Grounding for GUI Agents

Qianhui Wu, Kanzhi Cheng, Rui Yang 等

2025 87 引用 查看解读 →

ToDi: Token-wise Distillation via Fine-Grained Divergence Control

Seongryong Jung, Suwan Yoon, Donggeon Kim 等

2025 18 引用 查看解读 →

GUI-G1: Understanding R1-Zero-Like Training for Visual Grounding in GUI Agents

Yuqi Zhou, Sunhao Dai, Shuai Wang 等

2025 68 引用 查看解读 →

LPO: Towards Accurate GUI Agent Interaction via Location Preference Optimization

Jiaqi Tang, Yu Xia, Yi-feng Wu 等

2025 16 引用 查看解读 →

MobileIPL: Enhancing Mobile Agents Thinking Process via Iterative Preference Learning

Kun Huang, Weikai Xu, Yuxuan Liu 等

2025 7 引用 查看解读 →

GTA1: GUI Test-time Scaling Agent

Yan Yang, Dongxu Li, Yutong Dai 等

2025 97 引用 查看解读 →

Enhancing Visual Grounding for GUI Agents via Self-Evolutionary Reinforcement Learning

Xinbin Yuan, Jian Zhang, Kaixin Li 等

2025 72 引用 查看解读 →

GUI-R1 : A Generalist R1-Style Vision-Language Action Model For GUI Agents

Run Luo, Lu Wang, Wanwei He 等

2025 241 引用 查看解读 →

SeeClick: Harnessing GUI Grounding for Advanced Visual GUI Agents

Kanzhi Cheng, Qiushi Sun, Yougang Chu 等

2024 602 引用 查看解读 →

Navigating the Digital World as Humans Do: Universal Visual Grounding for GUI Agents

Boyu Gou, Ruohan Wang, Boyuan Zheng 等

2024 401 引用 查看解读 →

DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models

Zhihong Shao, Peiyi Wang, Qihao Zhu 等

2024 8441 引用 查看解读 →

OS-ATLAS: A Foundation Action Model for Generalist GUI Agents

Zhiyong Wu, Zhenyu Wu, Fangzhi Xu 等

2024 356 引用 查看解读 →

被引用 (7)

Test-Time Self-Evolving GUI Visual Grounding via Reflection-Guided On-Policy Self-Distillation

2026 ⭐ 高影响力 查看解读 →

Trust the Right Teacher: Quality-Aware Self-Distillation for GUI Grounding

2026 ⭐ 高影响力 查看解读 →

Latent On-Policy Self-Distillation

SkillLens: Visual Skill Cards for Retrieval-Augmented GUI Action Prediction and On-Policy Distillation

The Next Screenshot Knows: Gated Hindsight Distillation for Mobile GUI Agents

IoU-PD: IoU-Aware Privileged Distillation for Visual Grounding with Multimodal Large Language Models

A Brief Overview: On-Policy Self-Distillation In Large Language Models

2026 6 引用 查看解读 →