核心发现
方法论
本文提出一种结合软正确性门控与教师概率缩放的质量感知自蒸馏方法,针对GUI定位中的坐标-令牌信号。利用目标边界框验证教师预测的空间合理性,门控机制根据预测是否在边界内调节信号强度,教师概率则用作置信度校准。采用反向KL散度作为损失函数,动态调节不同令牌的蒸馏权重。实验在六个GUI基准上验证,显著优于传统方法。
关键结果
- 在六个GUI基准上,平均准确率提升至72.23%,比基线GUI-SD高出2.16个百分点,显示信号质量提升带来的性能增强。与纯门控或概率缩放单一机制相比,结合两者的方案表现更优,验证了机制的互补性。 Ablation研究表明,单独使用任一机制效果有限,但结合后性能提升明显,说明两者协同作用关键。
- 在UIEG和MMG等细粒度场景中,模型在坐标预测精度上提升了约4-5个百分点,验证了方法在复杂场景中的鲁棒性。
- 通过对不同门控强度和缩放系数的调节,找到最优参数λ=3和α=0.5,确保信号筛选与校准的平衡。
研究意义
该研究突破了GUI定位中教师信号的可靠性瓶颈,提出的质量感知机制有效缓解了教师信号在偏离目标时的误导风险,为视觉-语言模型的细粒度空间理解提供了新思路。其在多场景、多数据集上的优异表现,彰显了方法的实用价值,有望推动自动界面理解、智能交互等应用的发展,解决现有方法在复杂场景中性能不足的问题。
技术贡献
核心技术在于引入空间验证的软门控机制,结合教师预测置信度进行动态调节,显著改善教师信号的质量。创新点包括利用目标边界验证教师预测的空间合理性,结合概率缩放实现信号校准,以及在反向KL散度基础上设计的加权损失函数。该方案在保证信号丰富性的同时,有效抑制了误导性信号,提升了自蒸馏的效果。
新颖性
首次将空间验证机制引入教师信号质量评估,结合软门控与概率缩放,系统性解决教师信号不可靠带来的问题。不同于传统单一指标(如熵或概率)的方法,本研究利用目标边界的空间一致性作为直接的可靠性指标,创新性地实现了教师信号的动态筛选与校准,显著提升了GUI定位的精度和鲁棒性。
局限性
- 该方法依赖于目标边界框的准确性,在边界框存在误差或遮挡时,验证机制可能失效,影响信号质量判断。
- 在极端复杂场景中,空间验证可能无法完全排除误导性信号,仍存在一定的误导风险。
- 模型训练过程中引入额外的门控和缩放机制,增加了计算复杂度,可能限制在资源有限的环境中的应用。
未来方向
未来可结合多模态信息增强空间验证的鲁棒性,探索自适应门控参数的学习策略,提升在动态变化场景中的适应性。同时,结合强化学习优化信号筛选策略,进一步提升模型的泛化能力和定位精度。
AI 总览摘要
图形用户界面(GUI)定位是视觉-语言模型(VLMs)中的一项关键任务,旨在从高分辨率截图中精确识别目标元素的屏幕坐标。传统方法多依赖硬标签,限制了细粒度空间信息的利用。自蒸馏(Self-Distillation)作为一种软监督策略,能提供丰富的令牌级教师信号,但在GUI场景中面临信号可靠性不足的问题。本文提出一种基于质量感知的自蒸馏方法,通过软正确性门控和教师概率缩放,有效筛选和校准教师信号,提升模型性能。
该方法利用目标边界框验证教师预测的空间合理性,动态调节信号强度,结合教师置信度进行校准,避免误导性信号影响训练。实验在六个GUI基准上验证,平均准确率提升至72.23%,优于现有最强基线。 Ablation分析显示,门控和概率缩放的结合是性能提升的关键,单独使用效果有限。
该研究为GUI定位提供了新的信号质量控制机制,有助于推动视觉-语言模型在复杂交互场景中的应用。未来可结合多模态信息和强化学习,进一步提升模型鲁棒性和泛化能力,拓展自动界面理解的边界。
深度分析
研究背景
GUI定位作为智能交互的基础,近年来随着视觉-语言模型的发展,逐步实现了从简单的目标检测到复杂的空间理解。代表性工作包括SeeClick、CogA-gent等,采用监督学习或强化学习优化坐标预测,但在高分辨率、多目标场景中仍面临精度不足和信号噪声问题。自蒸馏技术的引入,为模型提供了更丰富的令牌级监督信息,但其在空间验证方面的应用尚未充分探索。
核心问题
核心难题在于教师信号的可靠性,尤其是在自回归生成中,偏离目标的预测会导致教师提供误导性信息,影响模型训练效果。传统自蒸馏未考虑信号空间一致性,容易引入噪声,限制了模型在复杂GUI场景中的表现。如何有效筛选和校准教师信号,成为提升定位精度的关键。
核心创新
本研究提出空间验证的软正确性门控机制,结合教师置信度进行动态调节,首次将空间一致性作为教师信号质量的直接指标。创新点包括:• 利用目标边界框验证教师预测空间合理性;• 设计软门控策略,避免信号硬性舍弃;• 结合教师概率进行细粒度校准,提升信号质量。这些创新显著改善了教师信号的可靠性,推动GUI定位技术向更高精度发展。
方法详解
- �� 输入:指令、截图、目标边界框。• 构建:在训练中引入布局保持区域遮挡的教师专用输入。• 预测:学生生成响应,教师基于空间验证评估预测合理性。• 门控:判断教师预测是否仍在目标边界内,软调节信号强度。• 置信度:利用教师概率缩放调节信号权重。• 损失:加权反向KL散度,动态调节不同令牌的蒸馏贡献。• 训练:端到端优化,结合空间验证和概率校准,提升模型鲁棒性。
实验设计
在六个GUI基准(如ScreenSpot-Pro、UI-Vision Element等)上,采用Qwen-3.5-9B作为基础模型,比较不同方法的性能。设置不同的门控强度和缩放系数,进行消融分析。指标包括宏平均准确率,验证信号筛选效果。通过多轮调优,确定最优参数λ=3和α=0.5,确保性能最优。
结果分析
实验结果显示,结合空间验证的质量感知机制显著优于传统自蒸馏和基线方法,平均准确率提升至72.23%,在六个基准中均表现优异。 Ablation研究验证了门控和概率缩放的互补性,单独使用效果有限。模型在复杂场景中的鲁棒性增强,验证了信号筛选策略的有效性。
应用场景
该方法适用于自动界面识别、智能助手、自动化测试等场景,能显著提升目标元素定位的准确性。依赖于高质量的边界框和空间验证机制,适合在多模态交互系统中部署,推动人机交互智能化。未来可结合多模态信息,拓展到动态变化的界面环境。
局限与展望
依赖边界框的准确性,边界误差会影响验证效果。在极端复杂场景中,空间验证可能不足以排除所有误导信号。此外,增加的门控和缩放机制会带来计算成本,限制在资源有限环境中的应用。未来需优化验证机制和算法效率。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,每次放调料都要尝试一下味道是否合适。老师的信号就像调料的味道,有时候太咸或太淡,会误导你做菜。为了做出好菜,你会用味觉判断调料是否合适,还会根据经验调整用量。这篇论文就像是给厨师设计了一套聪明的味觉检测系统,能判断调料是否放得恰当,并根据味道的自信程度调整用量。这样,厨师就能做出更美味的菜肴,而不用担心调料放错了。
简单解释 像给14岁少年讲一样
想象你在玩一个游戏,要找到屏幕上的宝藏位置。游戏里的助手会告诉你宝藏在哪,但有时候它的提示不准,可能会误导你。为了变得更聪明,你可以用一些聪明的方法来判断助手的提示是否靠谱,比如:它说的范围是不是符合地图上的标记?如果它说的范围太模糊或不在正确区域,你会少听它的话。这个论文就像是给助手装了一个聪明的“眼睛”,可以判断它的提示是否靠谱,然后只听那些“眼睛”确认的提示。这样,你就能更快找到宝藏,避免被误导。
术语表
Self-Distillation (自蒸馏)
一种模型训练方法,模型用自己生成的预测作为教师信号,提升自身性能。
论文中用来提供丰富的令牌级监督信息。
Teacher Probability (教师概率)
教师模型对某个预测的置信度,反映预测的确定性。
用作信号校准的重要指标。
Soft Correctness-Aware Gating (软正确性门控)
根据空间验证结果动态调节教师信号的强度,避免误导。
核心机制之一,用于筛选可靠的教师预测。
Reverse KL Divergence (反向KL散度)
衡量两个概率分布差异的指标,用于模型输出的对齐。
作为训练中的损失函数,调节学生与教师的预测差异。
GUI Grounding (GUI定位)
在图形用户界面中识别目标元素的空间位置。
论文的主要研究任务。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升空间验证在极端复杂场景中的鲁棒性?
- 2 能否结合多模态信息增强信号筛选?
- 3 在动态变化界面中,验证机制如何适应?
应用场景
近期应用
自动界面元素定位
在自动化测试和界面识别中,提升目标元素的识别准确率,减少人工干预。
智能交互助手
增强虚拟助手对界面元素的理解能力,实现更自然的操作反馈。
远期愿景
全面自动化界面理解
实现跨平台、多场景的自动界面分析与交互,推动智能系统自主操作。
原文摘要
Graphical user interface (GUI) grounding requires vision-language models (VLMs) to identify small target elements in high-resolution screenshots and predict precise screen coordinates. On-policy self-distillation (OPSD) is a promising post-training approach for this coordinate-sensitive task, since it provides dense token-level teacher signals beyond hard coordinate labels. However, naive OPSD is not well suited to GUI grounding: OPSD evaluates the teacher on student-generated prefixes, the quality of coordinate-token teacher signals can degrade when the prefix has already deviated from the target coordinate, leading to unreliable teacher signal. To mitigate this, We propose quality-aware self-distillation for VLM-based GUI grounding, which improves coordinate-token teacher-signal quality through soft correctness-aware gating and teacher-probability scaling. The soft correctness-aware gate checks whether the teacher's current coordinate-token prediction can still be completed into the ground-truth box under the student-generated prefix. If not, the corresponding teacher signal is down-weighted. Teacher-probability scaling then uses the teacher's confidence as a lightweight factor to further calibrate the strength of the gated supervision. A key empirical finding is that neither component alone improves overall performance, whereas combining them consistently improves performance. This suggests that the two mechanisms play complementary roles: correctness-aware gating suppresses unreliable coordinate-token supervision, while teacher-probability scaling calibrates the strength of the remaining signals. Experiments across six GUI grounding benchmarks show that our method consistently improves the base model and outperforms strong baselines.