Scaling GUI Agents with Visual State Transitions

TL;DR

提出状态转移预训练(STP),通过联合优化逆动力学与正动力学提升GUI代理性能。

cs.AI 🔴 高级 2026-07-27 34 次浏览
Xiangyan Liu Kaixin Li Haonan Wang Biao Wu Meng Fang Longxu Dou Chao Du Michael Qizhe Shieh Tianyu Pang
人工智能 GUI代理 多模态学习 动态建模 迁移学习

核心发现

方法论

本文提出STP框架,利用多模态统一模型(如BAGEL)在视觉状态转移数据上进行预训练,优化逆动力学(预测动作)与正动力学(预测下一状态)两个目标。通过从现有轨迹中提取无标注的状态转移元组,训练模型理解GUI动态。该模型在微调任务轨迹后,显著优于仅用轨迹微调的基线,提升成功率和定位精度。实验证明联合优化带来稳定性能提升,且性能随转移数据规模增长而稳步提升。

关键结果

  • 在AgentNetBench上,STP使平均成功率提升2.3%至6.2%,在AndroidControl和GUIOdyssey中,成功率分别提升0.9%和0.6%。在不同数据规模下,STP均表现出优越性,尤其在有限轨迹数据条件下效果显著。
  • 联合优化逆正动力学比单一目标更稳定,模型在转移数据规模扩大时性能持续提升,验证了结构化学习信号的有效性。
  • 即使在数据重叠条件下,预训练仍带来性能改善,表明其不仅依赖于新数据,还增强了模型对GUI动态的理解能力。

研究意义

该研究突破了GUI代理在大规模应用中的数据效率瓶颈,通过引入无标注的状态转移预训练,有效提升模型的泛化能力和动态理解能力。为未来自主学习、迁移学习提供了理论基础,推动GUI自动化向更高层次发展,具有重要的学术和工业价值。

技术贡献

创新点在于将逆动力学与正动力学联合优化,构建无标注状态转移的预训练任务,突破了传统轨迹依赖的限制。采用多模态模型(如BAGEL)实现跨模态理解与生成,提供了更丰富的视觉和动作表示。该方法显著改善了模型的动态建模能力,为GUI智能代理的规模化提供了新路径。

新颖性

首次提出将无标注的视觉状态转移作为预训练任务,结合逆正动力学优化,系统性提升GUI代理的动态理解能力。与以往仅依赖轨迹标注或强化学习不同,该方法利用大规模无标注数据实现模型预训练,具有较强的创新性。

局限性

  • 当前方法主要依赖静态状态转移数据,难以捕捉复杂交互中的长时依赖关系,可能影响复杂任务的表现。
  • 预训练模型在极端复杂或噪声环境下的鲁棒性仍需验证,未来需结合强化学习等方法增强适应性。
  • 大规模预训练带来计算成本较高,实际部署时需考虑效率优化。

未来方向

未来将探索结合强化学习的动态优化策略,增强模型对复杂任务的适应性。还计划扩展多模态数据源,提升模型对多样化GUI场景的泛化能力。此外,将研究更高效的预训练机制,降低训练成本,推动实际应用落地。

AI 总览摘要

随着人机交互界面(GUI)在日常生活中的普及,构建高效、泛化能力强的GUI智能代理成为研究热点。传统方法多依赖大量轨迹标注,成本高且难以扩展。本文提出的状态转移预训练(STP)框架,通过联合优化逆动力学和正动力学目标,利用无标注的视觉状态转移数据,显著提升模型对GUI动态的理解能力。

STP采用多模态统一模型(如BAGEL)作为基础架构,将状态转移数据中的连续截图和动作信息转化为训练信号,训练模型预测下一状态和推断动作,从而构建内在的GUI世界模型。这一预训练阶段为后续的轨迹微调提供了更优的初始化,有效缓解数据稀缺问题,并增强模型的动态感知能力。

在多个桌面和移动GUI基准测试中,STP模型在成功率和定位精度方面均优于仅用轨迹微调的基线。实验还表明,联合优化目标比单一目标更稳定,性能随转移数据规模增长而持续提升。这一方法不仅提升了模型的泛化能力,也为大规模自主学习提供了新思路。

总之,STP通过利用无标注的状态转移数据,突破了传统依赖标注的限制,为GUI代理的规模化和智能化发展提供了强大动力。未来,结合强化学习和多模态数据,将进一步推动GUI智能代理的应用落地,开启人机交互的新篇章。

深度分析

研究背景

GUI作为人机交互的核心,近年来随着深度学习的发展,出现了多种基于视觉和语言的自动化代理。早期方法依赖手工设计规则或强化学习,面临数据稀缺和泛化困难的问题。近年来,视觉-语言模型(如CLIP、ALIGN)推动了多模态理解的发展,但在GUI动态建模方面仍存在挑战。传统轨迹微调虽有效,但受限于高成本和数据依赖。为解决这一问题,研究者开始探索无标注的状态转移数据,旨在通过自监督学习提升模型的动态理解能力。

核心问题

核心问题在于如何高效利用大量无标注的GUI状态转移数据,提升模型对界面动态的理解和预测能力。现有方法多依赖昂贵的轨迹标注,难以扩展到大规模应用。同时,单一目标优化(如轨迹微调)难以兼顾视觉、动作和任务规划,导致模型泛化能力不足。如何设计一种结构化、可扩展的预训练策略,成为制约GUI代理发展的瓶颈。

核心创新

本文创新点在于引入无标注状态转移的预训练任务,结合逆动力学(预测动作)与正动力学(预测下一状态)两个目标,构建结构化学习信号。采用多模态模型(如BAGEL)实现跨模态理解,增强模型对GUI动态的感知能力。该方法区别于传统依赖轨迹标注的策略,利用大规模无标注数据实现预训练,提升模型的泛化和迁移能力,为GUI代理的规模化提供新路径。

方法详解

  • �� 构建无标注状态转移数据集,从现有轨迹中提取连续截图和动作元组。
  • �� 设计联合优化目标:逆动力学(st, st+1 → at)和正动力学(st, at → st+1),通过多模态模型(如BAGEL)实现。
  • �� 训练过程中,模型同时学习预测动作和下一状态,形成内在的GUI世界模型。
  • �� 预训练完成后,进行轨迹微调,结合任务指令,提升任务执行能力。
  • �� 实验中采用多尺度数据集,比较不同预训练目标和数据规模对性能的影响。

实验设计

采用AgentNet、AndroidControl和GUIOdyssey等公开数据集,分别在桌面和移动场景中测试。模型在不同轨迹数据量(如2K、5K、18K轨迹)基础上进行微调,评估指标包括成功率、定位精度和任务完成率。对比仅用轨迹微调的模型,验证STP的有效性。还进行了不同目标组合和数据规模的消融实验,分析预训练的贡献。

结果分析

在AgentNetBench上,STP模型成功率提升2.3%至6.2%,在AndroidControl和GUIOdyssey中,成功率分别提升0.9%和0.6%。联合优化目标比单一目标更稳定,性能随转移数据规模增长持续改善。即使在数据重叠条件下,预训练仍带来性能提升,验证了其结构化学习信号的有效性。整体结果表明,STP显著增强模型的动态理解和泛化能力。

应用场景

该方法适用于自动化测试、界面交互优化和智能助手等场景。只需无标注的状态转移数据即可预训练模型,降低数据采集成本。未来可结合强化学习实现自主探索,应用于复杂交互环境,推动工业界的自动化和智能化升级。

局限与展望

当前模型主要依赖局部状态转移信息,难以捕获长时依赖。复杂场景中的鲁棒性和泛化能力仍需验证。预训练成本较高,实际部署时需优化模型效率。未来应结合强化学习和多任务训练,增强模型适应性。

通俗解读 非专业人士也能看懂

想象一个工厂里,工人每天都在不同的岗位上操作机器。每次操作后,机器的状态会发生变化,比如开关被打开或关闭。工厂管理者希望让机器人学会这些操作背后的规律,能提前知道操作后会发生什么。于是,他们让机器人观察很多操作的记录,学习每次操作会带来哪些变化。这样,机器人就能在没有指示的情况下,自己预测未来的状态,知道哪些操作会带来什么结果。这个过程就像我们教孩子玩拼图游戏,让他们通过观察拼图的变化,学会下一步怎么拼。最终,机器人变得更聪明,可以自主完成复杂的任务,而不需要每次都告诉它具体怎么做。这就是本文提出的状态转移预训练的核心思想,用大量无标注的操作变化数据,让模型理解界面动态,从而更好地完成任务。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每次你点击屏幕上的按钮,界面会发生变化。有时候你会忘记哪些操作会带来什么结果,但如果你能提前知道下一步会发生什么,就能更快完成任务。这个研究就像让机器人看很多你做的操作记录,然后学会预测每次点击后界面会变成什么样。这样,机器人就能自己猜到下一步该怎么做,而不用每次都告诉它具体操作。它就像一个聪明的助手,能提前知道界面会变成什么样,帮你节省很多时间。研究中,科学家用一种特别的方法,让机器人通过观察界面变化,学习动作和界面之间的关系。结果显示,这样的学习方式让机器人变得更聪明,能更好地完成各种任务。未来,这种技术还能用在手机、电脑等设备上,让我们的生活变得更方便。

原文摘要

We introduce State Transition Pretraining (STP) as a new scaling axis for GUI agents. During the STP stage, we continually pretrain a unified multimodal model on visual state transitions by jointly optimizing inverse dynamics (predicting actions from state changes) and forward dynamics (predicting next states from current states and actions). This optimization equips the model with better action-grounded visual representations and an internal world model of GUI dynamics. When subsequently fine-tuned on trajectories with task instructions, our STP-trained models consistently outperform baselines trained solely via direct trajectory fine-tuning across agent benchmarks in both desktop and mobile GUI scenarios (AgentNetBench, AndroidControl, and GUIOdyssey). Further empirical studies show that joint dynamics optimization yields stable improvements over single-objective training, and downstream performance scales steadily with the volume of transition data.

cs.AI