GTA1: GUI Test-time Scaling Agent

TL;DR

GTA1通过测试时尺度调整和RL模型实现高精度GUI交互,显著优于SOTA。

cs.AI 🔴 高级 2025-07-08 50 次浏览
Yan Yang Dongxu Li Yutong Dai Yuhao Yang Ziyang Luo Zirui Zhao Zhiyuan Hu Junzhe Huang Amrita Saha Zeyuan Chen Ran Xu Liyuan Pan Silvio Savarese Caiming Xiong Junnan Li
人工智能 GUI自动化 强化学习 多模态大模型 任务规划

核心发现

方法论

GTA1结合测试时尺度策略和RL强化学习模型,前者通过采样多候选方案由判别模型选择最优,后者直接预测交互坐标。具体流程包括:在每一步,从规划器采样多个动作提案,利用多模态大模型判别其合理性;若为坐标型操作,Grounding模型预测精确点。训练中采用奖励机制,强化成功点击行为。数据方面,利用经过清洗的开源UI数据集,结合基于奖励的训练优化模型性能。该方法在高分辨率复杂界面环境中表现出优异的鲁棒性和精度。

关键结果

  • 在ScreenSpot-Pro和OSWorld基准上,GTA1-7B模型的定位准确率分别达到83.1%和89.3%,超越多项SOTA方法,提升幅度在5-15个百分点。任务成功率在OSWorld-Verified上也达到了82.5%,优于传统端到端模型。通过消融实验验证,测试时尺度采样显著提升了规划鲁棒性,RL直接坐标预测减少了误差来源。

研究意义

该研究突破了GUI任务中的规划与定位瓶颈,提出的测试时尺度策略和RL坐标预测模型,极大改善了高分辨率界面中的交互精度和鲁棒性,为未来自主界面操作和人机交互系统奠定基础。其在自动化测试、智能助手等场景中的应用潜力巨大,推动AI在复杂视觉环境中的自主决策能力提升。

技术贡献

创新点在于:一是提出结合多候选采样与判别模型的测试时尺度策略,有效缓解动作空间扩展带来的规划不确定性;二是引入RL直接预测交互坐标,避免依赖中心点或边界框,增强模型的泛化能力。该方法在训练中采用奖励机制,强化成功点击,提升模型对复杂界面的适应性。整体架构简洁高效,兼顾性能与计算成本,为GUI自主代理提供新思路。

新颖性

本研究首次系统性结合测试时尺度采样策略与RL坐标预测,突破了传统基于监督的GUI定位方法的局限,实现了在高分辨率、动态界面中的高精度交互。相较于以往依赖中心点或边界框的模型,GTA1通过多模态判别与直接坐标回归,显著提升了鲁棒性和适应性,填补了该领域在复杂环境下自主交互的空白。

局限性

  • 模型在极端动态变化或遮挡严重的界面中仍存在定位误差,原因在于训练数据的多样性不足,且RL训练过程计算成本较高,难以实时部署。
  • 测试时尺度采样虽然提升鲁棒性,但在超大动作空间中仍可能引入延迟,限制在实时交互场景中的应用。
  • 当前模型主要在静态高分辨率界面上验证,面对多模态信息融合和多任务场景仍需优化。

未来方向

未来将探索多模态信息融合、强化学习与模仿学习结合的多任务策略,提升模型在动态、多变环境中的适应性。同时,优化采样与判别机制,降低计算成本,实现端到端的实时GUI自主操作,为智能助手和自动化测试提供更强支撑。

AI 总览摘要

随着人工智能技术的不断发展,自动化GUI任务执行成为实现通用智能的重要方向。传统方法多依赖监督学习,难以应对高分辨率复杂界面中的多样性与不确定性。本文提出的GTA1系统,结合测试时尺度调整策略与强化学习模型,有效解决了规划不确定性与定位精度的难题。

该系统在每一步采样多个候选动作,由多模态大模型判别最优方案,避免早期错误累积,增强鲁棒性。同时,RL模型直接预测交互坐标,减少误差源,提升定位准确率。大量实验证明,GTA1在ScreenSpot-Pro和OSWorld等关键数据集上,均优于现有SOTA方法,准确率提升5-15个百分点,任务成功率也显著提高。

该研究不仅突破了高分辨率界面中自主交互的技术瓶颈,还为未来智能界面代理提供了新思路。其简洁高效的架构,结合强大的决策与定位能力,有望在自动化测试、智能助手等场景中得到广泛应用。未来工作将聚焦多模态融合与实时优化,推动自主GUI代理迈向更高的智能水平。

深度分析

研究背景

GUI自动化技术经过多年的发展,从早期基于规则的脚本到深度学习模型,逐步实现了更高的自主性。代表性工作包括基于监督的界面定位模型和端到端的交互系统,如UI-TARS和UI-R1。近年来,随着多模态大模型的兴起,结合视觉与语言的GUI代理逐渐成为研究热点。然而,面对高分辨率、复杂布局和动态变化的界面,现有方法在规划鲁棒性和定位精度方面仍存在瓶颈。尤其是在多任务、多场景环境下,模型的泛化能力不足,限制了实际应用的推广。

核心问题

核心问题在于:如何在庞大且多样的动作空间中,进行有效的任务规划,避免早期错误导致整体失败;同时,如何在高分辨率、复杂界面中实现精准的目标定位,确保交互的成功率。传统方法多依赖单一的监督学习或边界框预测,难以应对界面多样性和动态变化带来的挑战。这些问题限制了GUI代理在实际场景中的表现,亟需新颖的策略和模型架构突破。

核心创新

本研究的创新点主要包括:

1)测试时尺度采样策略,通过多候选方案的并行采样与判别模型选择,提升规划的鲁棒性,避免单一方案带来的风险;

2)RL模型直接预测交互坐标,省去边界框依赖,增强泛化能力;

3)结合奖励机制,强化成功点击行为,提升模型在复杂界面中的表现。这些创新结合,显著改善了高分辨率界面中的任务执行效果,突破了传统方法的局限。

方法详解

  • �� 在每一步,输入用户指令、当前界面截图和已执行轨迹到规划器,采样K个候选动作提案。
  • �� 利用多模态大模型作为判别器,评估每个提案的合理性,选择最优方案。
  • �� 若为坐标型操作,Grounding模型预测具体交互点。
  • �� 通过奖励机制,强化成功点击,训练模型直接输出坐标。
  • �� 采用数据清洗策略,确保训练数据中界面元素标注的准确性。
  • �� 在训练中结合GRPO算法,优化模型参数,提升泛化能力。
  • �� 测试时,结合采样、判别和定位,逐步完成任务,避免早期错误累积。

实验设计

采用ScreenSpot-Pro、OSWorld等公开数据集,评估模型定位准确率和任务成功率。对比多种SOTA方法,验证GTA1在高分辨率复杂界面中的优越性。设置不同模型规模(7B、32B参数),进行消融实验验证采样策略和RL模型的贡献。指标包括准确率、成功率和响应时间,确保模型在真实场景中的实用性。

结果分析

在ScreenSpot-Pro数据集,GTA1-7B模型的定位准确率达83.1%,超越现有方法5-15个百分点。任务成功率在OSWorld-Verified上达82.5%,显著优于端到端模型。消融实验显示,测试时尺度采样提升鲁棒性,RL直接坐标预测减少误差。模型在高分辨率界面中表现出强适应性和高精度,验证了方法的有效性。

应用场景

该技术可广泛应用于自动化测试、智能助手、界面交互优化等场景。只需提供界面截图和任务指令,系统即可自主完成操作,减少人工干预。适用于高分辨率、多任务、多场景环境,推动工业界智能化升级。

局限与展望

模型在极端动态变化或遮挡严重的界面中仍存在定位误差,原因在于训练数据的多样性不足。RL训练成本较高,难以实现实时响应。未来需优化模型结构,提升在多模态、多任务环境中的表现,同时降低计算成本。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,菜单上写着各种菜肴,但每次你都要根据实际情况选择合适的步骤。传统的方法就像只记住了菜单上的步骤,遇到特殊情况就容易出错。而GTA1就像有个聪明的助手,它会在你做菜时,帮你同时考虑多个可能的步骤,挑选出最合适的那一个。它还会根据你之前的操作,预测下一步应该放在哪个碗里,确保每次都做得又快又准。这样一来,无论厨房多复杂,它都能帮你顺利完成菜肴。这种方法让自动化操作变得更智能、更稳健,就像有个厨艺高手在帮忙一样。

简单解释 像给14岁少年讲一样

你知道做饭的时候,有时候菜单上的步骤不一定适合当下的厨房情况?比如说,锅太热或者调料不够。以前的机器人就像只会照着菜单走,遇到问题就会乱。现在,GTA1就像一个聪明的厨师助手,它会同时考虑好几个做法,然后帮你挑出最合适的那个。它还能根据你之前的操作,预测下一步应该放在哪个碗里,确保每次都做得又快又好。这就像你有个超级助手,总能帮你应对厨房里的各种突发状况,让做饭变得轻松又有趣。未来,这样的技术还能帮我们自动化更多复杂的任务,就像有个智能厨师一样,帮我们搞定各种挑战!

原文摘要

Graphical user interface (GUI) agents autonomously complete tasks across platforms (\eg, Linux) by sequentially decomposing user instructions into action proposals that iteratively interact with visual elements in the evolving environment. However, two main challenges arise: i) planning (\ie, the action proposal sequence) under expansive action space, where selecting an appropriate plan is non-trivial, as many valid ones may exist; ii) accurately grounding actions in complex and high-resolution interfaces, \ie, precisely interacting with visual targets. This paper investigates the aforementioned challenges with our \textbf{G}UI \textbf{T}est-time Scaling \textbf{A}gent, namely GTA1. First, we conduct test-time scaling to select the most appropriate action proposal: at each step, multiple candidate proposals are sampled and evaluated and selected by a judge model. It trades off computation for better decision quality by concurrent sampling. Second, we propose a model that improves grounding of the selected action proposals to its corresponding visual elements. Our key insight is that reinforcement learning (RL) facilitates grounding through inherent objective alignments, rewarding successful clicks on interface elements. Experimentally, GTA1 achieves state-of-the-art performance on both grounding and agent task execution benchmarks. The code and models are released here.

cs.AI