核心发现
方法论
VISTA是一种基于GRPO的训练框架,通过多视图构建比较组,保持目标元素可见,进行语义等价但几何不同的输入比较。引入自验证跨视图锚点,优化奖励加权损失。
关键结果
- 在ScreenSpot-Pro上,VISTA将Qwen3-VL 4B/8B/30B-A3B的准确率从55.5/52.7/53.7提高到63.4/65.8/67.0。
- 在五个基准测试中,VISTA显著提高了定位准确性,尤其是在复杂界面上。
- VISTA结合MVP方法进一步提高了模型的鲁棒性和准确性。
研究意义
VISTA通过多视图比较和自验证机制解决了GUI定位中的奖励退化问题,显著提高了模型在复杂界面上的定位准确性,对学术界和工业界具有重要意义。
技术贡献
VISTA通过多视图比较和自验证锚点,突破了传统GRPO方法的局限,提供了新的理论保证和工程可能性,显著提高了定位准确性。
新颖性
VISTA首次在GUI定位中引入多视图比较和自验证锚点,解决了奖励退化问题,与现有方法相比具有显著创新。
局限性
- 在复杂视图下,坐标生成可能不稳定,影响训练效果。
- 多视图比较增加了计算成本。
- 自验证机制可能在某些情况下无法激活。
未来方向
未来工作可探索更高效的多视图生成方法,并进一步优化自验证机制,以提高模型的鲁棒性和准确性。
AI 总览摘要
VISTA是一种创新的训练框架,通过多视图比较和自验证机制显著提高了GUI定位的准确性。现有方法在处理复杂界面时常常出现奖励退化问题,导致学习信号丢失。
VISTA通过构建多视图比较组,保持目标元素可见,进行语义等价但几何不同的输入比较,解决了这一问题。自验证跨视图锚点进一步稳定了坐标生成过程。
实验结果显示,VISTA在多个基准测试中显著提高了定位准确性,尤其是在复杂界面上。结合MVP方法,VISTA进一步提高了模型的鲁棒性和准确性,对学术界和工业界具有重要意义。
深度分析
研究背景
GUI定位是自动化代理与数字界面交互的关键技术,近年来取得了显著进展。现有方法多采用监督微调和强化学习,但在复杂界面上常出现奖励退化问题。
核心问题
现有方法在处理复杂界面时,奖励退化问题导致学习信号丢失,影响模型的定位准确性。如何构建有效的比较组成为关键。
核心创新
VISTA通过多视图比较和自验证机制解决了奖励退化问题。多视图比较保持目标元素可见,进行语义等价但几何不同的输入比较,自验证锚点稳定坐标生成。
方法详解
- �� 构建多视图比较组,保持目标元素可见
- �� 自验证跨视图锚点,优化奖励加权损失
- �� 结合MVP方法,提高模型鲁棒性
实验设计
在五个基准测试上进行实验,使用Qwen3-VL模型,比较VISTA与现有方法的性能。重点分析多视图比较和自验证机制的影响。
结果分析
VISTA显著提高了模型的定位准确性,尤其是在复杂界面上。结合MVP方法,进一步提高了模型的鲁棒性和准确性。
应用场景
VISTA可用于自动化测试、界面设计优化等场景,显著提高界面交互的准确性和效率。
局限与展望
多视图比较增加了计算成本,自验证机制可能在某些情况下无法激活,需进一步优化。
通俗解读 非专业人士也能看懂
想象一个厨房,厨师需要根据食谱找到特定的调料。现有方法就像只看一个角度,可能找不到正确的调料。VISTA就像让厨师从多个角度观察厨房,确保找到正确的调料。自验证机制就像厨师确认调料的正确性,确保不会出错。
简单解释 像给14岁少年讲一样
想象你在玩游戏,需要点击屏幕上的一个按钮。现有方法就像只看一个角度,可能会点错。VISTA就像让你从多个角度看屏幕,确保点到正确的按钮。自验证机制就像游戏提示你点对了,确保不会出错。
术语表
多视图比较 (Multi-view Comparison)
通过多个视图进行比较,以提高模型的鲁棒性和准确性。
VISTA中用于构建比较组。
自验证锚点 (Self-verified Anchor)
一种机制,通过验证模型生成的结果来稳定训练过程。
VISTA中用于稳定坐标生成。
奖励退化 (Reward Degeneracy)
奖励信号丢失,导致学习效果下降。
现有方法在复杂界面上常出现的问题。
MVP方法 (MVP Method)
一种推理时的多视图聚合方法,提高模型的鲁棒性。
VISTA中用于提高模型性能。
Qwen3-VL模型 (Qwen3-VL Model)
一种用于GUI定位的模型,具有较高的准确性。
VISTA中使用的基准模型。
开放问题 这项研究留下的未解疑问
- 1 如何进一步优化多视图生成方法,提高模型的鲁棒性?
- 2 自验证机制在某些情况下无法激活,如何解决这一问题?
应用场景
近期应用
自动化测试
提高界面交互的准确性和效率,减少人工测试成本。
远期愿景
界面设计优化
通过提高定位准确性,优化界面设计,提高用户体验。
原文摘要
When applying Group Relative Policy Optimization (GRPO) for GUI Grounding, rollouts are sampled from a single screenshot view; groups often become either all failures on difficult instances or all successes on easy ones, yielding no useful relative advantage. We propose VISTA (View-Consistent Self-Verified Training), a GRPO-based training framework that constructs each comparison group from multiple target-preserving views of the same GUI instance.Each view is generated by a crop that keeps the target element visible and remaps its box exactly, so model rollouts are compared across semantically equivalent but geometrically different inputs. To stabilize short coordinate generation without turning reinforcement learning into unconditional imitation, VISTA further adds a self-verified cross-view anchor: an oracle answer optimized with an advantage-weighted loss, excluded from the group baseline and activated only when the model has produced a maximum-reward rollout. Across five GUI-grounding benchmarks and multiple Qwen backbones, VISTA consistently improves grounding accuracy.On ScreenSpot-Pro, it raises Qwen3-VL 4B/8B/30B-A3B from 55.5/52.7/53.7 to 63.4/65.8/67.0. Robustness analyses further show higher worst-view accuracy and lower prediction flip rates.