核心发现
方法论
GUI-Eyes采用强化学习框架,结合视觉工具如裁剪和缩放,进行两阶段推理。第一阶段进行粗略探索,第二阶段进行细粒度定位。通过设计空间连续奖励函数,结合位置接近性和区域重叠,提供密集监督。
关键结果
- 在ScreenSpot-Pro基准上,GUI-Eyes-3B使用仅3,000个标记样本实现44.8%的定位准确率,显著优于监督和RL基线。
- 在CAD、开发工具和科学软件中表现尤为出色,分别达到48.2%、70.8%和69.4%的准确率。
- 通过消融实验验证了工具奖励设计的有效性,完整奖励函数显著提高了定位准确率。
研究意义
GUI-Eyes通过工具增强的主动感知,显著提高了GUI代理的鲁棒性和数据效率,解决了传统方法中数据标注成本高和泛化能力不足的问题。这一框架为视觉和决策的集成提供了新的思路,推动了人机交互领域的进步。
技术贡献
GUI-Eyes在视觉工具的主动调用和奖励函数设计上有所突破,提出了两阶段推理策略和空间连续奖励函数,显著提高了模型的感知和决策能力。
新颖性
GUI-Eyes首次将工具增强的主动感知引入GUI任务,通过两阶段推理和奖励设计,实现了视觉和决策的深度融合,区别于现有的静态输入方法。
局限性
- 在复杂界面中,工具调用策略可能导致计算开销增加。
- 模型在低对比度或模糊界面上的表现仍需提升。
未来方向
未来工作可探索更多视觉工具的集成,如动态缩放和多视角融合,以进一步提高模型的适应性和泛化能力。
AI 总览摘要
近年来,视觉语言模型和强化学习的进步推动了GUI自动化的发展。然而,大多数现有方法依赖于静态的视觉输入,缺乏主动感知能力。GUI-Eyes通过引入工具增强的主动感知框架,显著提高了界面定位的准确性。该框架采用两阶段推理策略,第一阶段进行粗略探索,第二阶段进行细粒度定位。通过设计空间连续奖励函数,结合位置接近性和区域重叠,提供密集监督,缓解了GUI环境中常见的奖励稀疏问题。
在ScreenSpot-Pro基准上,GUI-Eyes-3B使用仅3,000个标记样本实现了44.8%的定位准确率,显著优于现有的监督和RL基线。这一结果表明,工具感知的主动感知对于构建鲁棒且数据高效的GUI代理至关重要。
尽管取得了显著进展,GUI-Eyes在复杂界面中的计算开销和低对比度界面的表现仍需进一步优化。未来工作可探索更多视觉工具的集成,以提高模型的适应性和泛化能力。
深度分析
研究背景
随着大规模语言模型和视觉语言模型的发展,GUI自动化成为人机交互研究的热点。然而,现有方法主要依赖于监督微调,需要大量标注数据,且在不熟悉环境中的鲁棒性不足。强化学习通过交互和奖励优化行为,减少了监督需求,提高了适应性和泛化能力。
核心问题
现有GUI代理主要依赖于静态视觉输入,缺乏主动感知能力,难以应对复杂界面和模糊指令。模型需要集成感知和决策,学习何时观察和如何观察,以支持稳健的视觉定位。
核心创新
GUI-Eyes通过引入工具增强的主动感知框架,采用两阶段推理策略和空间连续奖励函数,实现了视觉和决策的深度融合。与传统方法相比,显著提高了模型的感知和决策能力。
方法详解
- �� 引入工具增强的主动感知框架,结合视觉工具如裁剪和缩放。
- �� 采用两阶段推理策略,第一阶段进行粗略探索,第二阶段进行细粒度定位。
- �� 设计空间连续奖励函数,结合位置接近性和区域重叠,提供密集监督。
实验设计
在ScreenSpot、ScreenSpot-v2和ScreenSpot-Pro基准上进行评估,使用3,000个标记样本进行训练。与现有的监督和RL基线进行比较,验证了模型的鲁棒性和数据效率。
结果分析
GUI-Eyes-3B在ScreenSpot-Pro基准上实现了44.8%的定位准确率,显著优于现有的监督和RL基线。在CAD、开发工具和科学软件中表现尤为出色,分别达到48.2%、70.8%和69.4%的准确率。
应用场景
GUI-Eyes可用于自动化测试、用户界面设计和人机交互研究,显著提高了界面定位的准确性和效率。
局限与展望
在复杂界面中,工具调用策略可能导致计算开销增加。模型在低对比度或模糊界面上的表现仍需提升。未来工作可探索更多视觉工具的集成,以提高模型的适应性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭,GUI-Eyes就像一个聪明的助手,帮你决定何时需要使用工具,比如刀具或搅拌机,以更好地完成任务。它会先大致观察厨房,然后根据需要选择合适的工具进行细致处理。这样,它不仅能节省时间,还能确保每一步都做得更好。这种方法类似于在复杂的用户界面中,智能地选择何时使用视觉工具来提高界面定位的准确性。
简单解释 像给14岁少年讲一样
想象你在玩一个需要找隐藏物品的游戏。GUI-Eyes就像一个超级助手,它不仅能告诉你在哪里找,还能帮你放大或裁剪画面,让你更容易找到目标。它就像一个聪明的侦探,知道什么时候需要更仔细地观察,什么时候可以直接找到答案。这样,你就能更快地完成任务,而且不容易出错!
术语表
GUI代理
图形用户界面代理,用于自动化界面交互任务。
在论文中用于实现主动感知和决策的模型。
主动感知
通过动态调整观察策略来获取更有用的信息。
在论文中指GUI-Eyes的关键能力。
强化学习
通过奖励信号优化行为策略的机器学习方法。
用于训练GUI-Eyes的框架。
视觉工具
用于增强视觉输入的工具,如裁剪和缩放。
在论文中用于提高界面定位的准确性。
空间连续奖励函数
结合位置接近性和区域重叠的奖励设计。
用于提供密集监督,缓解奖励稀疏问题。
开放问题 这项研究留下的未解疑问
- 1 如何在低对比度界面上提高工具调用策略的准确性?
- 2 在复杂界面中,如何降低计算开销?
- 3 如何集成更多视觉工具以提高适应性?
应用场景
近期应用
自动化测试
GUI-Eyes可用于软件的自动化测试,提高测试效率和准确性。
用户界面设计
通过增强的界面定位能力,帮助设计师更好地理解和优化用户界面。
远期愿景
智能人机交互
未来可用于更复杂的人机交互场景,提高用户体验和系统智能性。
原文摘要
Recent advances in vision-language models (VLMs) and reinforcement learning (RL) have driven progress in GUI automation. However, most existing methods rely on static, one-shot visual inputs and passive perception, lacking the ability to adaptively determine when, whether, and how to observe the interface. We present GUI-Eyes, a reinforcement learning framework for active visual perception in GUI tasks. To acquire more informative observations, the agent learns to make strategic decisions on both whether and how to invoke visual tools, such as cropping or zooming, within a two-stage reasoning process. To support this behavior, we introduce a progressive perception strategy that decomposes decision-making into coarse exploration and fine-grained grounding, coordinated by a two-level policy. In addition, we design a spatially continuous reward function tailored to tool usage, which integrates both location proximity and region overlap to provide dense supervision and alleviate the reward sparsity common in GUI environments. On the ScreenSpot-Pro benchmark, GUI-Eyes-3B achieves 44.8% grounding accuracy using only 3k labeled samples, significantly outperforming both supervised and RL-based baselines. These results highlight that tool-aware active perception, enabled by staged policy reasoning and fine-grained reward feedback, is critical for building robust and data-efficient GUI agents.