PAGER: Bridging the Semantic-Execution Gap in Point-Precise Geometric GUI Control

TL;DR

PAGER通过拓扑感知的代理,提升几何GUI控制的精确度,任务成功率提高4.1倍。

cs.AI 🔴 高级 2026-05-15 9 次浏览
Jingxuan Wei Xi Bai Shan Liu Caijun Jia Zheng Sun Xinglong Xu Siyuan Li Linzhuang Sun Bihui Yu Conghui He Cheng Tan
几何控制 GUI代理 强化学习 精确度 拓扑结构

核心发现

方法论

PAGER采用拓扑感知的代理,将构建过程分解为依赖结构的规划和像素级执行。通过像素监督调优建立可执行动作语法,并通过精度对齐的强化学习减少偏差。实验显示,PAGER在任务成功率上显著优于现有模型。

关键结果

  • PAGER在任务成功率上比最强的基线高出4.1倍,步骤成功率从不到9%提升至62%以上,显著超越现有GUI专用代理。
  • 一般多模态模型在动作类型准确率上超过88%,但任务成功率低于6%。
  • PAGER通过精度对齐的强化学习,显著减少了因偏差导致的错误传播。

研究意义

该研究在学术界和工业界具有重要意义,解决了长期以来在几何GUI控制中精确度不足的问题。通过提高任务成功率和步骤成功率,PAGER为精确几何构建提供了新的解决方案。

技术贡献

PAGER在技术上与现有方法有根本区别,通过拓扑感知的规划和像素级执行,实现了新的理论保证和工程可能性。其精度对齐的强化学习策略有效减少了偏差传播。

新颖性

PAGER首次将拓扑感知引入几何GUI控制,通过精度对齐的强化学习,解决了现有模型在精确度上的不足。

局限性

  • PAGER在处理复杂的几何依赖关系时可能会出现性能下降,尤其是在坐标误差传播严重的情况下。
  • 该方法在其他类型的精确界面上可能需要额外的适配。

未来方向

未来研究可以探索PAGER在其他精确界面中的应用,如CAD和科学可视化,并优化其在更复杂环境中的表现。

AI 总览摘要

PAGER通过拓扑感知的代理,解决了几何GUI控制中的精确度问题。传统的GUI代理通常依赖区域容忍的交互范式,导致在精确几何构建中表现不佳。PAGER通过依赖结构的规划和像素级执行,显著提高了任务成功率和步骤成功率。

实验结果显示,PAGER在任务成功率上比最强的基线高出4.1倍,步骤成功率从不到9%提升至62%以上。这一进步不仅在学术界具有重要意义,也为工业界提供了新的解决方案。

尽管PAGER在精确度上取得了显著进展,但在处理复杂的几何依赖关系时仍存在挑战。未来研究可以探索其在其他精确界面中的应用,并优化其在更复杂环境中的表现。

深度分析

研究背景

近年来,大型视觉语言模型显著推动了GUI代理的发展,使其能够在网络、移动和桌面界面中进行可执行的交互。然而,这些进展主要依赖于区域容忍的交互范式,导致在精确几何构建中表现不佳。精确几何构建要求动作必须落在连续画布空间的点上,而不是容忍区域。

核心问题

传统的GUI代理在精确几何构建中表现不佳,因为它们依赖于区域容忍的交互范式,无法处理需要点级精确度的任务。这导致局部坐标误差可能引发级联拓扑失败,扭曲下游对象并使最终构建无效。

核心创新

PAGER通过拓扑感知的代理,将构建过程分解为依赖结构的规划和像素级执行。其精度对齐的强化学习策略有效减少了偏差传播,显著提高了任务成功率和步骤成功率。

方法详解

  • �� PAGER采用拓扑感知的代理,将构建过程分解为依赖结构的规划和像素级执行。
  • �� 像素监督调优建立可执行动作语法。
  • �� 精度对齐的强化学习减少偏差传播,提高任务成功率。

实验设计

实验在PAGE Bench数据集上进行,包含4906个问题和超过224K的像素级GUI动作。通过与多种基线模型的比较,验证了PAGER在任务成功率和步骤成功率上的显著提升。

结果分析

PAGER在任务成功率上比最强的基线高出4.1倍,步骤成功率从不到9%提升至62%以上。一般多模态模型在动作类型准确率上超过88%,但任务成功率低于6%。

应用场景

PAGER可应用于需要高精度几何构建的场景,如CAD设计和科学可视化。其精度对齐的强化学习策略可用于优化其他精确界面的表现。

局限与展望

PAGER在处理复杂的几何依赖关系时可能会出现性能下降,尤其是在坐标误差传播严重的情况下。未来研究可以探索其在其他精确界面中的应用,并优化其在更复杂环境中的表现。

通俗解读 非专业人士也能看懂

想象你在画一幅画,每一笔都必须非常精确。PAGER就像一个聪明的助手,它能帮你确保每一笔都画在正确的位置上,不会因为一个小错误而影响整幅画。它通过一种叫做拓扑感知的技术,确保每个步骤都能顺利进行,即使有小的偏差也能及时纠正。

简单解释 像给14岁少年讲一样

想象你在玩一个需要精确操作的游戏,比如用鼠标点击屏幕上的小点。PAGER就像一个超级助手,它能帮你确保每次点击都非常准确,不会因为一点小失误而导致游戏失败。它通过一种叫做拓扑感知的技术,确保每个动作都能顺利完成,即使有小的偏差也能及时调整。

术语表

拓扑感知 (Topology-aware)

一种能够识别和利用系统中元素之间关系的技术,确保操作的准确性和一致性。

在PAGER中用于规划和执行几何构建任务。

像素级执行 (Pixel-level execution)

在图形用户界面中,操作精确到单个像素,以确保高精度的几何构建。

PAGER通过像素级执行实现精确的几何控制。

精度对齐的强化学习 (Precision-aligned reinforcement learning)

一种强化学习策略,通过精确度反馈优化模型的决策过程。

用于减少PAGER中的偏差传播。

级联拓扑失败 (Cascading topological failures)

由于局部坐标误差导致的连锁反应,影响整个系统的拓扑结构。

在精确几何构建中,PAGER通过拓扑感知技术减少这种失败。

区域容忍 (Region-tolerant)

一种允许操作在较大区域内进行的交互范式,适用于不需要高精度的任务。

传统GUI代理依赖于区域容忍的交互范式。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的几何依赖关系中保持高精度?现有方法在处理复杂依赖时可能会出现性能下降。
  • 2 如何将PAGER应用于其他精确界面,如CAD和科学可视化?

应用场景

近期应用

CAD设计

PAGER可用于提高CAD设计中的几何构建精度,减少因坐标误差导致的设计失败。

远期愿景

科学可视化

通过精度对齐的强化学习,PAGER可在科学可视化中实现更高的精确度和一致性。

原文摘要

Large vision-language models have significantly advanced GUI agents, enabling executable interaction across web, mobile, and desktop interfaces. Yet these gains largely rely on a forgiving region-tolerant paradigm, where many nearby pixels inside the same component remain valid. Precise geometric construction breaks this assumption: actions must land on points in continuous canvas space rather than tolerant regions. Because geometric primitives carry ontological dependencies, a local coordinate error can induce cascading topological failures that distort downstream objects and invalidate the final construction. We identify this regime as precision-sensitive GUI tasks, requiring point-level accuracy, geometry-aware verification, and robustness to dependency-driven error propagation. To benchmark it, we introduce PAGE Bench, with 4,906 problems and over 224K process-supervised, pixel-level GUI actions. We further propose PAGER, a topology-aware agent that decomposes construction into dependency-structured planning and pixel-level execution. Pixel-grounded supervised tuning establishes executable action grammar, while precision-aligned reinforcement learning mitigates rollout-induced exposure bias through state-conditioned geometric feedback. Experiments reveal a pronounced Semantic-Execution Gap: general multimodal models can exceed 88% action type accuracy yet remain below 6% task success. PAGER closes this gap, delivering 4.1x higher task success than the strongest evaluated general baseline and raising step success rate from below 9% for GUI-specialized agents to over 62%, establishing a new state of the art for point-precise GUI control.

cs.AI