GUI-C$^2$: Coarse-to-Fine GUI Grounding via Difficulty-Aware Reinforcement Learning

TL;DR

GUI-C²通过难度感知强化学习实现精细化GUI定位,性能提升46.4%。

cs.CV 🔴 高级 2026-05-29 9 次浏览
Junlong Li Chao Hao Lap-Pui Chau Yi Wang
强化学习 GUI定位 难度感知 视觉裁剪 数据挖掘

核心发现

方法论

本文提出了一种名为GUI-C²的强化学习框架,通过难度感知数据挖掘和区域门控的粗到细策略来优化GUI定位。该方法包括GUI-D数据过滤管道和多阶段视觉细化机制,利用模型内部的不确定性信号进行裁剪。

关键结果

  • GUI-C²在ScreenSpot-Pro基准上实现了46.4%的准确率,使用仅4624个训练样本,显著优于需要17000个样本的GUI-G1。
  • 在CAD图标和开发文本/图标样本上表现最佳,尤其在图标类型目标上显示出更强的定位准确性。
  • 通过消融实验验证了难度感知和粗到细策略对性能提升的关键作用。

研究意义

该研究显著提高了GUI定位的效率和准确性,解决了传统方法在复杂桌面界面和小图标上的定位困难问题。它为自主语言代理提供了更强的视觉工具使用能力,推动了人机交互领域的进步。

技术贡献

GUI-C²通过引入难度感知数据权重和区域门控策略,突破了现有SOTA方法的局限,提供了新的理论保证和工程可能性。它简化了决策过程,减少了推理时间。

新颖性

这是首次将难度感知引入到GUI定位的强化学习中,与现有方法相比,GUI-C²通过区域门控策略实现了更精细的视觉细化。

局限性

  • 在复杂界面上可能仍存在定位误差,尤其是视觉干扰较多的情况下。
  • 模型对参数设置敏感,可能需要针对不同应用进行调优。

未来方向

未来可以探索更复杂的界面场景下的应用,进一步优化策略参数,并扩展到其他人机交互领域。

AI 总览摘要

现有的GUI定位方法在复杂界面和小图标上表现不佳,难以实现高效准确的定位。GUI-C²通过难度感知强化学习框架,提出了一种新的解决方案。该方法包括GUI-D数据过滤管道和区域门控的粗到细策略,利用模型内部的不确定性信号进行裁剪。实验结果显示,GUI-C²在多个基准上实现了SOTA性能,尤其在图标类型目标上表现突出。该研究不仅提升了定位效率,还为自主语言代理提供了更强的视觉工具使用能力,推动了人机交互领域的进步。尽管如此,模型在复杂界面上可能仍存在定位误差,未来工作将致力于优化策略参数并扩展应用场景。

深度分析

研究背景

随着人机交互的不断发展,GUI定位成为自主语言代理的重要能力。然而,现有方法在复杂桌面界面和小图标上表现不佳。近年来,强化学习被引入到GUI定位中,但仍面临数据处理和策略复杂性的问题。

核心问题

现有方法在处理不同难度的训练样本时缺乏有效的策略,导致训练效率低下。此外,如何在保持足够上下文的同时减少冗余也是一个挑战。

核心创新

GUI-C²通过难度感知数据挖掘和区域门控的粗到细策略实现了创新。它利用模型内部的不确定性信号进行裁剪,适应不同目标的上下文需求。

方法详解

  • �� GUI-D数据过滤管道识别训练价值样本并分配难度分数。 • 区域门控机制逐步缩小视觉范围,适应大目标的上下文需求并提高小目标的精度。 • 改进感知阶段奖励确保每次细化都能真正推进定位。

实验设计

在ScreenSpot-Pro等基准上进行实验,使用4624个训练样本。比较了不同方法的性能,包括GUI-G1和GUI-Eyes。消融实验验证了难度感知和粗到细策略的有效性。

结果分析

GUI-C²在多个基准上实现了SOTA性能,尤其在图标类型目标上表现突出。消融实验显示,难度感知和粗到细策略对性能提升至关重要。

应用场景

该方法可直接应用于复杂桌面界面的GUI定位,适用于自主语言代理的视觉工具使用,推动人机交互领域的进步。

局限与展望

模型在复杂界面上可能仍存在定位误差,尤其是视觉干扰较多的情况下。未来工作将致力于优化策略参数并扩展应用场景。

通俗解读 非专业人士也能看懂

想象你在一个大型超市购物,寻找特定商品。传统方法就像在整个超市中寻找商品,耗时且容易出错。GUI-C²就像使用一个智能购物助手,它会根据商品的难度和位置,逐步缩小搜索范围,最终精准定位商品。这种方法不仅提高了效率,还减少了不必要的搜索。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要找到隐藏在复杂地图中的宝藏。传统方法就像在整个地图上寻找,耗时且容易迷路。GUI-C²就像一个聪明的向导,它会根据宝藏的难度和位置,逐步缩小搜索范围,最终精准定位宝藏。这样不仅提高了效率,还减少了不必要的搜索。

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练模型。

用于训练GUI-C²中的视觉工具使用行为。

GUI定位 (GUI Grounding)

在图形用户界面中识别并定位目标元素的过程。

本文的核心任务,通过强化学习优化。

区域门控 (Area-Gated)

一种策略,通过预测区域来决定是否进行进一步裁剪。

用于GUI-C²的视觉细化过程。

难度感知 (Difficulty-Aware)

根据样本的难度分配训练权重的策略。

用于GUI-D数据过滤管道。

消融实验 (Ablation Study)

通过移除某些组件来测试模型性能的实验。

验证难度感知和粗到细策略的有效性。

开放问题 这项研究留下的未解疑问

  • 1 如何在复杂界面中进一步提高定位准确性?
  • 2 难度感知策略在其他领域的应用潜力如何?

应用场景

近期应用

复杂界面定位

适用于复杂桌面界面的GUI定位,提高自主语言代理的视觉工具使用能力。

远期愿景

人机交互进步

推动人机交互领域的发展,扩展到其他视觉识别应用。

原文摘要

Existing agentic reinforcement learning methods for GUI grounding have limitations at two levels. At the data level, current approaches typically treat all training samples equally, although their training value to the baseline model varies with difficulty. Overlooking this can greatly reduce training efficiency or even cause collapse. At the strategy level, existing frameworks struggle to balance the trade-off between cropping larger regions for sufficient context and smaller ones for reduced redundancy, a tension inherent to tool-augmented grounding agents. In addition, overly complex decision-making is difficult for small-parameter models and significantly increases inference time. To address these issues, at the data level, we propose GUI-D, a data mining and difficulty scoring pipeline that identifies the training-worthy samples by proper testing and assigns difficulty scores to guide subsequent training weights. At the strategy level, we propose GUI-C$^2$, which employs an area-gated coarse-to-fine refinement mechanism that progressively narrows the visual field via model-internal uncertainty signals, adaptively reserving context for large targets while amplifying precision for small ones, reinforced by improvement-aware stage rewards that ensure each refinement genuinely advances grounding. Meanwhile, we simplify the decision-making process to greatly reduce additional inference time. Finally, extensive experiments show that our method achieves state-of-the-art performance. The code and data will be publicly available.

cs.CV