核心发现
方法论
PAGER采用拓扑感知的代理,将构建过程分解为依赖结构的规划和像素级执行。通过像素监督调优建立可执行动作语法,并通过精度对齐的强化学习减少偏差。实验显示,PAGER在任务成功率上显著优于现有模型。
关键结果
- PAGER在任务成功率上比最强的基线高出4.1倍,步骤成功率从不到9%提升至62%以上,显著超越现有GUI专用代理。
- 一般多模态模型在动作类型准确率上超过88%,但任务成功率低于6%。
- PAGER通过精度对齐的强化学习,显著减少了因偏差导致的错误传播。
研究意义
该研究在学术界和工业界具有重要意义,解决了长期以来在几何GUI控制中精确度不足的问题。通过提高任务成功率和步骤成功率,PAGER为精确几何构建提供了新的解决方案。
技术贡献
PAGER在技术上与现有方法有根本区别,通过拓扑感知的规划和像素级执行,实现了新的理论保证和工程可能性。其精度对齐的强化学习策略有效减少了偏差传播。
新颖性
PAGER首次将拓扑感知引入几何GUI控制,通过精度对齐的强化学习,解决了现有模型在精确度上的不足。
局限性
- PAGER在处理复杂的几何依赖关系时可能会出现性能下降,尤其是在坐标误差传播严重的情况下。
- 该方法在其他类型的精确界面上可能需要额外的适配。
未来方向
未来研究可以探索PAGER在其他精确界面中的应用,如CAD和科学可视化,并优化其在更复杂环境中的表现。
AI 总览摘要
PAGER通过拓扑感知的代理,解决了几何GUI控制中的精确度问题。传统的GUI代理通常依赖区域容忍的交互范式,导致在精确几何构建中表现不佳。PAGER通过依赖结构的规划和像素级执行,显著提高了任务成功率和步骤成功率。
实验结果显示,PAGER在任务成功率上比最强的基线高出4.1倍,步骤成功率从不到9%提升至62%以上。这一进步不仅在学术界具有重要意义,也为工业界提供了新的解决方案。
尽管PAGER在精确度上取得了显著进展,但在处理复杂的几何依赖关系时仍存在挑战。未来研究可以探索其在其他精确界面中的应用,并优化其在更复杂环境中的表现。
深度分析
研究背景
近年来,大型视觉语言模型显著推动了GUI代理的发展,使其能够在网络、移动和桌面界面中进行可执行的交互。然而,这些进展主要依赖于区域容忍的交互范式,导致在精确几何构建中表现不佳。精确几何构建要求动作必须落在连续画布空间的点上,而不是容忍区域。
核心问题
传统的GUI代理在精确几何构建中表现不佳,因为它们依赖于区域容忍的交互范式,无法处理需要点级精确度的任务。这导致局部坐标误差可能引发级联拓扑失败,扭曲下游对象并使最终构建无效。
核心创新
PAGER通过拓扑感知的代理,将构建过程分解为依赖结构的规划和像素级执行。其精度对齐的强化学习策略有效减少了偏差传播,显著提高了任务成功率和步骤成功率。
方法详解
- �� PAGER采用拓扑感知的代理,将构建过程分解为依赖结构的规划和像素级执行。
- �� 像素监督调优建立可执行动作语法。
- �� 精度对齐的强化学习减少偏差传播,提高任务成功率。
实验设计
实验在PAGE Bench数据集上进行,包含4906个问题和超过224K的像素级GUI动作。通过与多种基线模型的比较,验证了PAGER在任务成功率和步骤成功率上的显著提升。
结果分析
PAGER在任务成功率上比最强的基线高出4.1倍,步骤成功率从不到9%提升至62%以上。一般多模态模型在动作类型准确率上超过88%,但任务成功率低于6%。
应用场景
PAGER可应用于需要高精度几何构建的场景,如CAD设计和科学可视化。其精度对齐的强化学习策略可用于优化其他精确界面的表现。
局限与展望
PAGER在处理复杂的几何依赖关系时可能会出现性能下降,尤其是在坐标误差传播严重的情况下。未来研究可以探索其在其他精确界面中的应用,并优化其在更复杂环境中的表现。
通俗解读 非专业人士也能看懂
想象你在画一幅画,每一笔都必须非常精确。PAGER就像一个聪明的助手,它能帮你确保每一笔都画在正确的位置上,不会因为一个小错误而影响整幅画。它通过一种叫做拓扑感知的技术,确保每个步骤都能顺利进行,即使有小的偏差也能及时纠正。
简单解释 像给14岁少年讲一样
想象你在玩一个需要精确操作的游戏,比如用鼠标点击屏幕上的小点。PAGER就像一个超级助手,它能帮你确保每次点击都非常准确,不会因为一点小失误而导致游戏失败。它通过一种叫做拓扑感知的技术,确保每个动作都能顺利完成,即使有小的偏差也能及时调整。
术语表
拓扑感知 (Topology-aware)
一种能够识别和利用系统中元素之间关系的技术,确保操作的准确性和一致性。
在PAGER中用于规划和执行几何构建任务。
像素级执行 (Pixel-level execution)
在图形用户界面中,操作精确到单个像素,以确保高精度的几何构建。
PAGER通过像素级执行实现精确的几何控制。
精度对齐的强化学习 (Precision-aligned reinforcement learning)
一种强化学习策略,通过精确度反馈优化模型的决策过程。
用于减少PAGER中的偏差传播。
级联拓扑失败 (Cascading topological failures)
由于局部坐标误差导致的连锁反应,影响整个系统的拓扑结构。
在精确几何构建中,PAGER通过拓扑感知技术减少这种失败。
区域容忍 (Region-tolerant)
一种允许操作在较大区域内进行的交互范式,适用于不需要高精度的任务。
传统GUI代理依赖于区域容忍的交互范式。
开放问题 这项研究留下的未解疑问
- 1 如何在更复杂的几何依赖关系中保持高精度?现有方法在处理复杂依赖时可能会出现性能下降。
- 2 如何将PAGER应用于其他精确界面,如CAD和科学可视化?
应用场景
近期应用
CAD设计
PAGER可用于提高CAD设计中的几何构建精度,减少因坐标误差导致的设计失败。
远期愿景
科学可视化
通过精度对齐的强化学习,PAGER可在科学可视化中实现更高的精确度和一致性。
原文摘要
Large vision-language models have significantly advanced GUI agents, enabling executable interaction across web, mobile, and desktop interfaces. Yet these gains largely rely on a forgiving region-tolerant paradigm, where many nearby pixels inside the same component remain valid. Precise geometric construction breaks this assumption: actions must land on points in continuous canvas space rather than tolerant regions. Because geometric primitives carry ontological dependencies, a local coordinate error can induce cascading topological failures that distort downstream objects and invalidate the final construction. We identify this regime as precision-sensitive GUI tasks, requiring point-level accuracy, geometry-aware verification, and robustness to dependency-driven error propagation. To benchmark it, we introduce PAGE Bench, with 4,906 problems and over 224K process-supervised, pixel-level GUI actions. We further propose PAGER, a topology-aware agent that decomposes construction into dependency-structured planning and pixel-level execution. Pixel-grounded supervised tuning establishes executable action grammar, while precision-aligned reinforcement learning mitigates rollout-induced exposure bias through state-conditioned geometric feedback. Experiments reveal a pronounced Semantic-Execution Gap: general multimodal models can exceed 88% action type accuracy yet remain below 6% task success. PAGER closes this gap, delivering 4.1x higher task success than the strongest evaluated general baseline and raising step success rate from below 9% for GUI-specialized agents to over 62%, establishing a new state of the art for point-precise GUI control.