UI-Voyager: A Self-Evolving GUI Agent Learning via Failed Experience

TL;DR

UI-Voyager采用RFT和GRSD,提升4B模型在AndroidWorld的成功率至81%,超越人类水平。

cs.LG 🔴 高级 2026-03-26 45 次浏览
Zichuan Lin Feiyu Liu Yijun Yang Jiafei Lyu Yiming Gao Yicheng Liu Zhicong Lu Yangbin Yu Mingyu Yang Junyou Li Deheng Ye Jie Jiang
人工智能 强化学习 GUI自动化 自我进化 长程任务

核心发现

方法论

UI-Voyager引入两阶段自我进化策略:第一阶段采用拒绝微调(RFT),通过自动筛选成功轨迹持续优化模型和数据;第二阶段利用组相对自我蒸馏(GRSD),识别关键分叉点,从成功轨迹中提取密集的逐步监督,修正失败轨迹。具体机制包括轨迹生成、基于规则的筛选、叉点检测和基于SSIM的匹配,形成闭环优化流程。模型基于Qwen3-VL-4B-Instruct,结合多轮筛选和自我蒸馏,有效缓解长程任务中的信用分配难题。

关键结果

  • 4B模型在AndroidWorld上实现81.0%的Pass@1成功率,显著优于现有基线(如UI-Tars-7B的49.1%和Qwen3-VL-8B的47.6%),超越人类水平(80.0%),验证了自我进化策略的有效性。
  • 通过消融实验,验证GRSD在识别叉点和修正错误中的关键作用,提升模型稳定性和任务完成率。
  • 多轮筛选和自我蒸馏机制显著提高数据利用效率,模型在多次迭代中成功率从37%提升至81%,展现出强大的自我优化能力。

研究意义

该研究突破了长程GUI任务中学习效率低和信用分配模糊的瓶颈,为移动端智能自动化提供了高效、无需大量人工标注的解决方案。模型的自我进化机制实现了从失败中学习的能力,推动了自主智能体在复杂环境中的应用前景。其技术创新不仅丰富了强化学习和模态融合的理论体系,也为实际场景中的自动化操作提供了可行路径,有望在智能手机、自动测试和人机交互等领域产生深远影响。

技术贡献

论文提出的RFT和GRSD机制是核心创新。RFT实现模型与数据的闭环自我优化,自动筛选高质量轨迹;GRSD通过识别组内叉点,将成功轨迹的密集逐步监督引入失败轨迹,有效缓解长序列中的信用稀疏问题。模型基于多轮自我筛选与蒸馏,显著提升学习效率和任务成功率。该方法区别于传统强化学习和行为克隆,强调从失败中自我修正,突破了长序列任务的瓶颈,具有广泛的推广潜力。

新颖性

首次在移动GUI自动化中引入组相对自我蒸馏(GRSD),利用成功轨迹中的密集逐步监督修正失败轨迹,解决长序列中的信用稀疏问题。该方法结合多轮筛选与自我蒸馏,创新性地实现模型的自我演化,超越传统基于奖励的强化学习框架,展现出在复杂长程任务中的优越性能。

局限性

  • 当前方法依赖于规则验证器和SSIM匹配,可能在极端视觉变化或复杂交互中出现误判,影响叉点检测的准确性。
  • 模型训练仍需大量模拟轨迹生成,存在一定的计算成本,未来需优化采样效率。
  • 在极端复杂或未覆盖的任务场景下,模型仍可能面临泛化不足的问题,需结合多模态信息进一步提升鲁棒性。

未来方向

未来将探索引入多模态信息增强叉点检测,结合强化学习与模仿学习优化策略,提升模型在未见任务中的泛化能力。同时,计划扩展到多平台、多任务环境,推动自主GUI代理的普适性和实用性,促进人机交互的智能化升级。

AI 总览摘要

随着移动设备在日常生活中的普及,智能自动化GUI代理的研究变得尤为重要。传统方法在长序列任务中面临学习效率低和信用分配模糊的问题,难以实现高效自主操作。本文提出UI-Voyager,通过两阶段策略实现自我演化:第一阶段采用拒绝微调(RFT),自动筛选高质量轨迹,持续优化模型;第二阶段引入组相对自我蒸馏(GRSD),识别关键叉点,从成功轨迹中提取密集逐步监督,修正失败轨迹。该机制有效缓解长序列中的信用稀疏问题,提升模型稳定性。基于Qwen3-VL-4B-Instruct,模型在AndroidWorld任务中达到了81%的Pass@1成功率,超越多项基线和人类表现。实验验证了GRSD在识别叉点和自我修正中的关键作用,显著改善学习效率。该研究不仅推动了移动GUI自动化的技术边界,也为自主智能体在复杂环境中的应用提供了新思路。未来,结合多模态信息和多平台扩展,将进一步提升模型的泛化能力和实用性,开启智能自动化的新时代。

深度分析

研究背景

移动端界面操作的自动化研究经历了从规则匹配到深度学习的演变。早期方法多依赖手工设计的规则或模板,难以应对多样化场景。近年来,随着多模态大模型(如ChatGPT、Qwen)和强化学习的崛起,智能GUI代理逐渐成为研究热点。代表性工作包括Deng等的WebEnv、Xu等的MobileRL,以及基于大模型的UI操作方法。尽管取得一定进展,但长序列任务中的学习效率和信用分配仍是瓶颈,尤其在移动端多样化场景下,模型难以从失败中快速学习,限制了实际应用的推广。

核心问题

核心问题在于长序列GUI任务中,模型难以高效学习失败经验,且奖励信号稀疏,导致信用分配模糊。传统强化学习方法在长任务中表现不佳,难以识别具体失败步骤,限制了模型的稳定性和泛化能力。如何利用失败轨迹中的信息,提升学习效率,成为亟待解决的难题。此外,移动端界面复杂多变,环境噪声大,增加了模型训练的难度。

核心创新

本研究提出两项创新:第一,拒绝微调(RFT)实现模型与数据的闭环自我优化,通过自动筛选成功轨迹持续提升模型能力;第二,组相对自我蒸馏(GRSD)利用成功轨迹中的密集逐步监督,识别长序列中的叉点,有效缓解信用稀疏问题。区别于传统奖励驱动的强化学习,GRSD通过自我蒸馏实现精细化修正,提升模型在复杂任务中的表现。结合多轮筛选和自我修正机制,模型展现出强大的自我学习能力。

方法详解

  • �� 轨迹生成:利用自动化脚本在GUI环境中合成多样任务轨迹,结合扰动参数生成丰富样本。• 筛选机制:基于规则验证器筛除失败轨迹,保留高质量样本进行微调。• 多轮优化:模型在每轮中生成新轨迹,筛选后用于模型更新,形成闭环。• 叉点检测:采用SSIM匹配识别成功与失败轨迹中的共享状态,检测分叉点。• 逐步监督:在识别的叉点,将成功轨迹的动作迁移到失败轨迹,进行自我蒸馏。• 训练目标:最大化逐步预测的交叉熵损失,逐步修正模型行为。

实验设计

在AndroidWorld数据集上,采用多轮筛选和自我蒸馏策略,训练基于Qwen3-VL-4B-Instruct的模型。对比多项基线,包括UI-Tars、MAI-UI等,评估成功率和鲁棒性。通过消融实验验证GRSD的关键作用,分析不同轮次的性能变化。设置不同任务复杂度和轨迹数量,确保模型在多样环境中的适应性。采用平均成功率和标准差指标,验证模型的稳定性和优越性。

结果分析

模型在AndroidWorld上达到了81%的Pass@1成功率,明显优于基线(如UI-Tars-7B的49.1%和Qwen3-VL-8B的47.6%),超越人类表现(80%)。消融实验显示,GRSD在叉点识别和修正中起到决定性作用,提升成功率约20%。多轮筛选机制使得模型在迭代中成功率持续提升,从37%到81%,验证了自我演化的有效性。整体结果表明,该方法在复杂长序列任务中具有显著优势。

应用场景

该技术可应用于智能手机自动操作、自动测试、个性化界面交互等场景。无需大量手工标注,模型可在实际环境中自主学习和优化,提升用户体验和效率。未来可结合多模态信息,扩展到多平台、多任务环境,推动智能自动化的普及。

局限与展望

当前方法依赖视觉相似性匹配,可能在极端视觉变化或复杂交互中出现误判。训练过程仍需大量模拟轨迹,计算成本较高。模型在未覆盖场景中泛化能力有限,未来需结合多模态和迁移学习策略提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,遇到一道复杂菜谱。每次尝试都可能失败,但你会记住哪些步骤成功,哪些需要改进。UI-Voyager就像一个聪明的厨师,能自己观察、学习,逐步改进做菜的方法。它通过不断尝试,筛选出成功的做法,然后用这些经验指导下一次的尝试。这样,它变得越来越擅长做复杂菜肴,不断学习、修正错误,就像一个厨艺大师一样。这个过程不需要人手指点,只靠自己观察和总结,逐步变得更厉害。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,刚开始你不知道怎么过关。每次失败后,你会记住哪些动作是对的,哪些是错的。慢慢地,你学会了避开错误,找到正确的路线。UI-Voyager就像你的游戏伙伴,它会自己观察每次的操作,记住成功的步骤,然后用这些经验修正失败的尝试。它不断试错、学习,变得越来越厉害,甚至超过了人类玩家。这个方法不用别人告诉它怎么做,而是靠自己不断尝试和总结,最终变成了高手。就像你在游戏中变得更聪明一样。

原文摘要

Autonomous mobile GUI agents have attracted increasing attention along with the advancement of Multimodal Large Language Models (MLLMs). However, existing methods still suffer from inefficient learning from failed trajectories and ambiguous credit assignment under sparse rewards for long-horizon GUI tasks. To that end, we propose UI-Voyager, a novel two-stage self-evolving mobile GUI agent. In the first stage, we employ Rejection Fine-Tuning (RFT), which enables the continuous co-evolution of data and models in a fully autonomous loop. The second stage introduces Group Relative Self-Distillation (GRSD), which identifies critical fork points in group rollouts and constructs dense step-level supervision from successful trajectories to correct failed ones. Extensive experiments on AndroidWorld show that our 4B model achieves an 81.0% Pass@1 success rate, outperforming numerous recent baselines and exceeding human-level performance. Ablation and case studies further verify the effectiveness of GRSD. Our method represents a significant leap toward efficient, self-evolving, and high-performance mobile GUI automation without expensive manual data annotation.

cs.LG cs.AI cs.CV