Enhancing Trustworthy GUI Grounding via Self-Critiqued Reinforcement Learning

TL;DR

HyperClick通过自我批判强化学习提升GUI定位的可信度,显著提高了信心对齐。

cs.CV 🔴 高级 2025-10-31 1 次浏览
Shaojie Zhang Pei Fu Ruoceng Zhang Jiahui Yang Anan Du Xiuwen Xi Shaokang Wang Ying Huang Bin Qin Zhenbo Luo Jian Luan
GUI定位 强化学习 自信度 自我批判 自动化

核心发现

方法论

HyperClick结合了正确性奖励和信心对齐奖励,通过自我评估优化定位准确性和信心可靠性。该框架不仅输出点击预测,还提供明确的信心估计,采用自我批判强化学习(SCRL)方法。

关键结果

  • 在ScreenSpot-Pro基准上,HyperClick在高分辨率和复杂环境中表现出色,信心对齐误差从0.631降至0.249。
  • 在多平台和任务设置中,HyperClick在GUI定位准确性上保持竞争力,尤其是在复杂视觉布局中表现出色。
  • 通过SCRL训练,HyperClick能区分可靠点击与不确定点击,减少过度自信错误。

研究意义

HyperClick在学术界和工业界具有重要意义,解决了GUI自动化中信心估计不准确的问题。通过提供更好的信心对齐,支持基于信心的放弃决策,提高了自动化的安全性和可靠性。

技术贡献

HyperClick引入了SCRL,结合二元正确性和空间信心目标的双重奖励机制,优化了定位准确性和信心对齐。与现有方法相比,提供了新的理论保证和工程可能性。

新颖性

HyperClick首次将自我批判强化学习应用于GUI定位,通过信心对齐提高了模型的可靠性,与传统方法相比,提供了更精细的信心估计。

局限性

  • 在某些复杂环境中,信心估计仍可能不够准确,导致错误决策。
  • 模型在处理极小或极大UI元素时可能表现不佳。

未来方向

未来工作可以探索更复杂的信心建模方法,以及在更广泛的应用场景中验证HyperClick的有效性。

AI 总览摘要

在现代人机交互中,自动化GUI代理依赖于准确的GUI定位来执行用户命令。然而,现有模型的信心信号往往与实际定位准确性不符,导致过度自信和不可靠的预测。为解决此问题,研究人员提出了HyperClick框架,通过自我批判强化学习(SCRL)提高GUI定位的可信度。HyperClick结合了正确性奖励和信心对齐奖励,训练策略模型输出点击预测和明确的信心估计。实验表明,HyperClick在挑战性基准上保持了强大的定位性能,并提供了更好对齐的信心估计。通过暴露GUI操作中的不确定性,HyperClick支持基于信心的放弃决策,增强了GUI自动化的安全性。

深度分析

研究背景

随着自动化技术的发展,GUI代理在移动应用、网页平台和复杂桌面软件中扮演着重要角色。GUI定位是将语言指令映射到屏幕坐标的关键任务,决定了代理能否成功执行用户命令。近年来,通过大规模数据集的监督微调和可验证奖励的强化学习推动了GUI定位的进步。

核心问题

现有模型的信心估计与实际定位准确性不符,导致过度自信的预测。这在动态、连续的真实世界GUI任务中尤为关键,因为中间步骤的单一错误可能导致整体任务失败。

核心创新

HyperClick通过自我批判强化学习(SCRL)增强GUI定位的可信度。与以往将定位视为二元分类任务的方法不同,HyperClick将信心估计明确集成到决策过程中。每个预测不仅提供目标UI元素,还包括可靠的自我评估信心声明。

方法详解

  • �� 采用点击预测形式,直接匹配可执行的GUI操作。
  • �� 结合正确性奖励和信心对齐奖励,优化定位准确性和信心可靠性。
  • �� 使用高斯核构建有界空间信心表示,提供平滑的信心对齐监督信号。

实验设计

在ScreenSpot、ScreenSpot-V2、ScreenSpot-Pro和MMBench-GUI四个基准上评估HyperClick的GUI定位能力。实验涵盖多种平台和任务设置,包括移动、桌面和网页环境。

结果分析

HyperClick在高分辨率和复杂环境中表现出色,信心对齐误差显著降低。通过SCRL训练,模型能够区分可靠点击与不确定点击,减少过度自信错误。

应用场景

HyperClick可用于提高GUI自动化的安全性和可靠性,特别是在需要精确空间定位的应用场景中,如移动应用和复杂桌面软件。

局限与展望

在某些复杂环境中,信心估计仍可能不够准确,导致错误决策。模型在处理极小或极大UI元素时可能表现不佳。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,HyperClick就像一个聪明的助手,它不仅能帮你找到需要的食材,还能告诉你它对找到食材的信心有多高。如果助手对找到的食材信心不足,它会建议你再检查一下。这种方法确保了你不会因为助手的过度自信而用错食材。

简单解释 像给14岁少年讲一样

想象你在玩一个需要点击屏幕上正确位置的游戏。HyperClick就像一个聪明的游戏助手,它不仅帮你找到正确的点击位置,还会告诉你它对这个位置有多自信。如果它不太确定,它会建议你小心点。这就像在游戏中有个可靠的队友,帮你避免失误!

术语表

自我批判强化学习 (Self-Critiqued Reinforcement Learning)

一种结合自我评估机制的强化学习方法,优化模型的决策准确性和信心对齐。

用于提高GUI定位的可信度。

信心对齐 (Confidence Alignment)

模型输出的信心估计与实际预测准确性的一致性。

用于评估模型预测的可靠性。

GUI定位 (GUI Grounding)

将语言指令映射到用户界面元素的空间坐标的过程。

核心任务是提高自动化GUI代理的执行能力。

高斯核 (Gaussian Kernel)

用于构建平滑信心表示的数学函数,强调中心点的高信心。

用于信心对齐的监督信号。

二元正确性 (Binary Correctness)

预测是否准确定位到目标区域的二元判断。

用于评估GUI定位的成功与否。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的环境中提高信心估计的准确性?现有方法在处理极端UI元素时表现不佳。
  • 2 如何扩展HyperClick以支持更多类型的用户界面和交互场景?

应用场景

近期应用

移动应用自动化

HyperClick可用于提高移动应用中自动化任务的安全性和可靠性,特别是在需要精确点击的场景中。

远期愿景

跨平台GUI自动化

HyperClick可用于实现跨平台的GUI自动化,提高不同操作系统和设备上的用户体验。

原文摘要

Autonomous graphical user interface (GUI) agents rely on accurate GUI grounding, which maps language instructions to on-screen coordinates, to execute user commands. However, current models, whether trained via supervised fine-tuning (SFT) or reinforcement learning (RL), often provide confidence signals that are poorly aligned with actual grounding correctness, leading to overconfident and unreliable predictions. To address this, we propose HyperClick, a novel framework that enhances trustworthy GUI grounding through self-critiqued reinforcement learning (SCRL). HyperClick combines a correctness reward and a confidence alignment reward, training the policy model to output both a click prediction and an explicit confidence estimate. This approach jointly optimizes grounding accuracy and confidence reliability through confidence-based self-assessment. Extensive experiments on challenging benchmarks show that HyperClick maintains strong grounding performance while providing better-aligned confidence estimates. By exposing uncertainty alongside GUI actions, HyperClick supports confidence-based abstention in GUI automation. Code will be released here.

cs.CV