GSAR: Goal-State-Anchor Rewards for Mobile GUI Agents with Self-Evolving Data Synthesis

TL;DR

提出GSAR奖励框架,通过自我演化数据合成和目标状态锚定提升GUI代理训练效率。

cs.AI 🔴 高级 2026-08-24 46 次浏览
Long Zhang Yuhan Chen Chaoran Zhang Wanxia Cao Kun Huang Pengzhi Gao Wei Liu Jian Luan Chenliang Li Lixin Zou
强化学习 GUI代理 数据合成 奖励机制 自我演化

核心发现

方法论

本文提出的GSAR框架结合自我演化数据合成与目标状态锚定机制,实现任务多样性生成与奖励信号的可靠性保障。通过模拟环境交互,自动生成多环境、多任务数据,利用状态锚点自动标注成功轨迹中的UI元素作为参考锚,结合目标状态信息,为强化学习提供高质量奖励。具体包括:• 自我演化数据合成:通过随机探索和任务复杂化,自动扩展任务空间,生成多样化环境和轨迹;• 目标状态锚定:从成功轨迹中提取终态,自动识别关键UI元素作为锚点,构建奖励参考;• 结合动作历史与锚点信息,设计高效奖励评估模型。

关键结果

  • 在AndroidControl和GUI-Odyssey两个基准测试中,采用GSAR的奖励机制使得离线轨迹验证准确率超过90%,优于传统模型评估方法,逼近基于规则的理想水平。
  • 在实际训练中,使用GSAR奖励的代理在AndroidWorld和自建基准上表现出显著提升,任务成功率分别提高了8-23%,训练收敛速度加快,表现出优异的泛化能力。
  • 消融实验表明,结合目标状态锚点与动作历史的奖励设计,能最大程度降低误判率,提升奖励信噪比,验证了机制的有效性和鲁棒性。

研究意义

该研究突破了GUI强化学习中环境多样性与奖励信号的瓶颈,提供了一套自动化、可扩展的任务生成与评价体系。通过自我演化与目标锚定机制,显著降低了人工设计成本,增强了训练的稳定性和泛化能力,为未来大规模自主交互系统的开发奠定基础。这不仅推动了AI在移动端自动化操作的应用,也为复杂任务的高效学习提供了新思路,具有深远的理论和实践意义。

技术贡献

技术创新主要体现在:• 提出自我演化数据合成机制,实现环境与任务的自动多样化生成,突破了依赖人工配置的限制;• 引入目标状态锚定机制,自动识别关键UI元素作为奖励参考,提升奖励的准确性和稳定性;• 结合动作历史与锚点信息,设计了高效的奖励评估模型,显著改善了奖励信号的质量。该框架兼容多种强化学习算法,支持大规模自动化训练,具有良好的扩展性和鲁棒性。

新颖性

本研究首次将自我演化数据合成与目标状态锚定机制结合应用于GUI代理训练,解决环境多样性不足和奖励信号不可靠的核心难题。相比传统基于规则或模型的奖励方法,GSAR实现了完全自动化的任务环境生成和高精度奖励评估,极大提升了训练效率和泛化能力。这一创新为强化学习在复杂交互场景中的应用提供了全新技术路径,具有重要的学术突破意义。

局限性

  • 当前方法在极端复杂或多步骤任务中,目标状态识别仍存在一定误差,影响奖励的绝对准确性,需进一步优化UI元素识别算法。
  • 自我演化过程依赖于探索策略的质量,探索不足可能导致任务多样性不足,影响训练效果。
  • 在极大规模环境中,状态锚点的自动标注和环境管理仍存在计算成本较高的问题,需提升算法效率。

未来方向

未来将结合多模态信息增强目标状态识别的鲁棒性,探索多任务、多智能体协同训练机制,扩展到更复杂的交互场景。同时,计划引入元学习和迁移学习策略,提升模型在新环境中的适应能力,推动GUI代理向更高层次的自主性发展。

AI 总览摘要

随着移动设备界面日益复杂,开发高效、稳定的GUI代理成为人工智能研究的重要方向。传统方法依赖人工设计环境和奖励规则,难以应对多样化任务和大规模环境,限制了强化学习的应用潜力。本文提出的GSAR框架,通过自我演化数据合成与目标状态锚定机制,解决了环境多样性不足和奖励信号不可靠的难题。

该方法首先利用随机探索和任务复杂化,自动生成丰富的环境和轨迹数据,极大扩展了训练样本空间。随后,从成功轨迹中自动提取终态,识别关键UI元素作为锚点,构建稳定的奖励参考。结合动作历史信息,设计了高效的奖励评估模型,显著提升了奖励信号的准确性和鲁棒性。

在多个公开基准和自建任务中,GSAR实现了超过90%的轨迹验证准确率,优于传统模型评估方法。代理在实际训练中表现出更快的收敛速度和更强的泛化能力,任务成功率提升8-23%。消融实验验证了目标状态锚定和动作历史的协同作用。该框架为GUI强化学习提供了可扩展、自动化的解决方案,推动了自主交互系统的研究与应用。未来,将结合多模态信息和迁移学习,进一步提升系统的智能水平。

深度分析

研究背景

移动端界面自动化操作的研究经历了从规则驱动到深度学习的演变。早期依赖手工编写规则,效率低且难以适应复杂场景。近年来,基于视觉和语言模型的GUI理解逐渐兴起,如GUITAR、Rico数据集等推动了端到端学习方法的发展。强化学习在界面操作中的应用也逐步展开,但受限于环境多样性和奖励信号的准确性,训练效果不稳定,泛化能力不足。现有研究多依赖人工配置环境或规则验证,难以实现大规模自动化训练,限制了技术的推广。

核心问题

核心问题在于环境多样性不足和奖励信号不可靠。手动环境配置繁琐,难以自动生成丰富的任务样本,限制了大规模强化学习的实现。同时,现有奖励机制如模型评估或规则验证,存在准确率低、扩展性差的问题,导致训练过程不稳定、效果不佳。解决这些瓶颈对于实现自主、通用的GUI代理至关重要。

核心创新

本研究提出两大创新:• 自我演化数据合成:通过环境交互自动生成多样任务和轨迹,突破人工配置限制;• 目标状态锚定:自动识别成功轨迹终态中的UI元素作为奖励参考,提升奖励的准确性和稳定性。这两项创新结合,极大改善了环境多样性和奖励信号的质量,为大规模自主训练提供了技术基础。

方法详解

  • �� 任务环境的自我演化:通过随机探索和任务复杂化,自动扩展环境和任务空间;• 轨迹采集与筛选:利用GPT-4o执行生成任务,筛除不合理轨迹;• 目标状态提取:从成功轨迹中自动识别终态屏幕;• UI元素锚定:利用可访问性树自动标注关键UI元素,构建奖励参考;• 奖励评估:结合动作历史和锚点信息,训练高效的奖励模型。

实验设计

采用AndroidControl、GUI-Odyssey两个公开基准,结合自建任务集,评估数据合成质量和奖励机制效果。对比传统模型和基于规则的奖励,验证GSAR在轨迹验证和强化学习中的优越性。通过离线指标(准确率、F1)和在线训练表现(任务成功率、收敛速度)进行全面评估。消融实验验证锚点和动作历史的贡献,分析不同组件对性能的影响。

结果分析

在AndroidControl和GUI-Odyssey中,GSAR实现轨迹验证准确率超过90%,优于模型评估方法。训练中,代理任务成功率提升8-23%,收敛速度明显加快。消融实验显示,结合锚点和动作历史的奖励设计,误判率最低,奖励信噪比最高。在自建基准中,训练任务的成功率也有显著提升,验证了方法的实用性和鲁棒性。

应用场景

该技术适用于移动端自动化测试、界面交互学习、智能助手等场景。只需提供初始环境和任务描述,系统即可自动生成多样任务和环境,训练高效、稳定。未来可扩展到多模态交互、复杂多步骤任务,推动自主交互系统的商业化应用。

局限与展望

目前方法在极端复杂任务中,目标状态识别仍存在误差,影响奖励准确性。环境探索依赖探索策略,可能导致多样性不足。大规模环境中,状态锚点自动标注的计算成本较高,需优化算法效率。未来需结合多模态信息和迁移学习,提升鲁棒性和适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜。每次做菜都需要准备不同的食材、调料和步骤。以前,厨师会写详细的食谱,告诉你每一步怎么做,但每次都要手工准备,费时又不灵活。现在,有个智能厨师,它能自己试验不同的食谱,学习哪些组合最好,还能自动识别做完的菜是否成功。它会观察每次做菜的最后状态,记住哪些步骤成功了,然后用这些经验指导下一次做菜。它还会根据之前的成功经验,调整食谱,变得越来越聪明。这就像论文里的方法:它自己探索不同的环境,识别成功的关键点,用这些点作为奖励的依据,逐步学会在不同厨房里做出美味菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你要完成各种任务,比如找到宝藏或打败敌人。以前,游戏设计师会告诉你每个任务怎么做,但每次都要手工设计关卡,太麻烦了。现在,有个聪明的机器人,它可以自己试着完成任务,然后记住成功的关键步骤,比如哪个按钮按了,哪个位置的宝藏被找到。它会观察自己完成任务后,最后的画面和操作,把重要的细节记下来,作为以后判断自己是否完成任务的标准。这样,它就可以自己不断练习,变得越来越厉害,不用每次都有人指导。这个方法就像论文里的GSAR,通过让机器人自己探索、识别成功的关键UI元素,自动生成任务和奖励,帮助它更快学会操作各种不同的手机界面。

原文摘要

Vision-Language Models (VLMs) based GUI agents stand to benefit significantly from online reinforcement learning (RL). However, their training is bottlenecked by two fundamental issues: current data synthesis methods for GUI Agents rely on specific environments and struggle to generate diverse data, while existing evaluators either suffer from limited scalability or provide inaccurate and unreliable reward signals. To overcome these challenges, we introduce GSAR (Goal-State-Anchor Reward), a RL reward framework that supports scalable task generation and delivers reliable reward signals for stable and efficient policy optimization. Our approach features self-evolving data synthesis, which produces multiple environments through task execution and generates diverse tasks and goal states. Complementing this, a state-anchor mechanism automatically annotates task-relevant UI elements in successful goal states as reference anchors. During RL training, these reference anchors provide accurate, scalable reward signals that substantially enhance efficiency. Extensive evaluations demonstrate that our framework achieves over 90% accuracy on offline trajectory verification and performs closest to rule-based methods. Furthermore, agents trained using our reward framework exhibit strong performance on both AndroidWorld and our constructed benchmark, establishing a scalable approach for GUI agent training.

cs.AI