MobileForge: Annotation-Free Adaptation for Mobile GUI Agents with Hierarchical Feedback-Guided Policy Optimization
MobileForge采用层级反馈引导策略优化,无需标注即可适应移动GUI,达成67.2% Pass@3。
核心发现
方法论
MobileForge结合MobileGym和HiFPO两大模块。MobileGym在真实移动应用中生成任务、评估rollout,利用深度优先搜索和UI状态图进行目标挖掘。HiFPO通过多次尝试、层级反馈(包括结果、过程和修正提示),将轨迹信息转化为hint-contextualized的梯度策略更新(GRPO),实现无标注迁移。具体算法包括基于轨迹的任务筛选、层级反馈过滤和Hint-guided多尝试rollout,利用改进的PPO变体进行策略优化。
关键结果
- 在AndroidWorld数据集上,基于自动生成的无标注数据,Qwen3-VL-8B模型通过MobileForge训练后,Pass@3达67.2%,仅比专用GUI模型GUI-Owl-1.5-8B(69.0%)略低。利用相同方法,ForgeOwl-8B在AndroidWorld达到77.6%的Pass@3,且在跨域MobileWorld数据集上成功率达41.0%,显著优于未适应模型。
- 通过逐步增加任务数量(200、400、900任务),模型性能持续提升,显示出迁移能力与数据规模正相关。对比传统孤立rollout和粗糙奖励,MobileForge的层级反馈机制显著改善了策略的样本效率和泛化能力。
- 消融实验表明,修正提示和层级反馈的引入,使得多尝试rollout的成功率从52%提升至77%,Pass@3从49%提升至72.5%。此外,基于Hint-guided GRPO的训练策略优于纯SFT和单一奖励优化,展现出优越的学习效果。
研究意义
该研究突破了移动GUI智能体迁移的瓶颈,提出无需人工标注的端到端适应框架。通过层级反馈机制,有效连接目标应用探索、任务挖掘和策略优化,极大降低迁移成本,推动移动自动化和智能交互的发展。其在实际应用中可实现无需手工任务定义的自我学习,提升智能助手的适应性和鲁棒性,为未来多模态、多任务的通用移动智能体奠定基础。
技术贡献
创新点在于提出MobileGym作为真实应用交互的探索平台,以及HiFPO的层级反馈引导策略优化。结合轨迹筛选、层级过滤和Hint引导多尝试机制,显著改善了无标注迁移的样本效率和策略稳定性。算法上引入了基于轨迹的任务筛选和Hint-contextualized的梯度更新,突破了传统强化学习对稀疏奖励的依赖。工程上实现了端到端的自动任务挖掘与多层次反馈融合,展现出强大的迁移能力。
新颖性
本研究首次将层级反馈机制引入移动GUI无标注迁移,结合轨迹筛选、任务变体生成和Hint引导的多尝试策略,系统性解决了现有方法中任务关联薄弱和反馈稀疏的问题。与传统基于奖励的强化学习或单一自我探索方法不同,提出的层级反馈策略实现了多层次信息的有效利用,显著提升迁移效果和泛化能力。
局限性
- 当前方法主要在Android系统环境中验证,跨平台迁移和多模态融合仍需探索。
- 模型在复杂多任务、多应用场景下的长远规划和跨应用记忆能力有限,长时序任务表现仍有待改进。
- 训练过程依赖大量自动生成的任务和反馈,计算成本较高,实时性和能效仍需优化。
未来方向
未来将扩展多平台、多模态环境中的迁移能力,结合视觉、语音等多模态信息增强任务理解。探索长时序、多应用场景下的跨任务记忆机制,提升模型的持续学习和自适应能力。同时,优化训练效率,减少计算资源消耗,推动实际落地应用。
AI 总览摘要
MobileForge提出了一种无需人工标注的移动GUI迁移方法,结合MobileGym和层级反馈引导的策略优化(HiFPO),实现了在真实应用环境中的任务生成、评估和策略更新。该系统通过在Android应用中挖掘任务、利用多层次反馈(包括结果、过程和修正提示)不断优化策略,显著提升了模型的迁移效果。实验显示,基于自动生成数据的Qwen3-VL-8B模型在AndroidWorld达到67.2%的Pass@3,接近专用GUI模型69.0%;而经过MobileForge适应的ForgeOwl-8B在AndroidWorld达77.6%,跨域MobileWorld成功率达41.0%。这种端到端的无标注迁移框架,突破了传统依赖人工任务和奖励的限制,为移动智能体的自主学习提供了新路径。其核心创新在于引入层级反馈机制和多尝试策略,有效利用轨迹信息,提升样本效率和泛化能力。未来,系统有望扩展到多平台、多模态场景,推动移动自动化和智能交互的广泛应用。
深度分析
研究背景
随着大规模多模态预训练模型(如GPT、CLIP)在UI理解中的应用,移动GUI智能体逐渐成为研究热点。早期工作如UI-Venus、ShowUI等,依赖大量标注数据,效果有限。近年来,无标注迁移方法如TongUI、MobileA3gent、GUI-explorer等,尝试利用自主探索和自我反馈减少人工干预,但仍面临任务关联薄弱和反馈稀疏的问题。传统方法多依赖孤立rollouts和粗糙奖励,难以实现高效迁移。MobileForge在此基础上,提出端到端的无标注迁移框架,结合真实应用交互和多层次反馈,推动了移动GUI智能体的自主学习能力。
核心问题
现有移动GUI迁移方法依赖大量人工标注和任务定义,成本高且易过时。应用场景复杂多变,模型难以在新应用中快速适应,尤其在多任务、多应用环境下,策略的泛化和长时序规划成为难点。孤立的rollouts和稀疏奖励机制限制了策略的样本效率和迁移能力,导致模型在实际应用中表现不佳。如何建立一个无需标注、能在真实环境中自主挖掘任务、利用多层次反馈持续优化的迁移体系,成为亟待解决的问题。
核心创新
MobileForge的创新在于:1)提出MobileGym作为真实应用交互的探索平台,实现任务挖掘和轨迹评估;2)引入层级反馈机制,将轨迹结果、过程信息和修正提示融合,构建多层次反馈体系;3)开发HiFPO策略,通过多尝试和反馈过滤,有效利用轨迹信息进行策略优化;4)结合Hint引导的多尝试rollout,提升样本利用率。与传统方法相比,显著改善了任务关联和奖励稀疏的问题,增强模型的迁移能力。
方法详解
- �� MobileGym在真实移动应用中探索状态空间,挖掘任务变体,通过深度优先搜索和UI状态图实现目标导向。• 任务生成基于轨迹的连贯性筛选,生成多样化变体,确保任务的多样性和实用性。• 轨迹评估由MobileGym-Critic完成,提供任务完成状态、步骤合理性和修正提示,形成多层次反馈。• HiFPO利用多次尝试的反馈信息,过滤已掌握任务,筛选困难步骤,结合Hint引导优化策略。• 采用Hint-guided多尝试rollout,重复利用反馈信息,逐步改进策略。• 训练过程中引入基于轨迹的过滤和局部梯度更新,结合PPO变体实现稳定优化。
实验设计
在AndroidWorld和MobileWorld两个数据集上验证,训练Qwen3-VL-8B和GUI-Owl-1.5-8B模型。采用200、400、900任务子集进行迁移训练,评估指标为Pass@1/2/3和成功率。对比传统孤立rollouts、奖励稀疏机制和不同反馈策略,进行消融分析。模型性能在不同任务难度和跨域场景中测试,验证迁移效果和泛化能力。实验还包括不同任务筛选策略、反馈过滤和评价器模型的影响。
结果分析
在AndroidWorld,Qwen3-VL-8B通过900任务训练后,Pass@3达67.2%,接近专用模型69.0%。ForgeOwl-8B在相同条件下达77.6%,跨域MobileWorld成功率达41.0%。消融实验显示,修正提示和层级反馈显著提升成功率和样本效率。多尝试策略和Hint引导训练优于传统SFT,验证了层级反馈机制的有效性。整体结果表明,无标注迁移在移动GUI任务中具有巨大潜力。
应用场景
该方法适用于自动化测试、智能助手和UI设计优化,无需手工标注即可实现模型快速适应新应用。可广泛应用于移动设备管理、个性化推荐和交互式教育等场景,降低开发成本,提高用户体验。未来还可结合多模态信息,扩展到跨平台、多任务和长时序场景,推动智能移动生态系统的发展。
局限与展望
目前主要在Android环境验证,跨平台迁移和多模态融合仍待突破。长时序、多应用场景下的跨任务记忆和规划能力有限,模型在复杂多任务环境中的表现仍不足。训练成本较高,依赖大量自动生成任务,实时性和能效需优化。未来需解决多模态融合、长远记忆和跨平台迁移的挑战。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,工厂里有很多不同的机器和流程。以前,你需要手动告诉每台机器该做什么,怎么操作,才能完成一项任务。现在,工厂引入了一台聪明的机器人,它可以自己观察机器的工作状态,学习不同的操作步骤,甚至在遇到问题时自己想办法修正。这个机器人不用提前告诉它所有细节,只需要通过观察和尝试,就能逐渐掌握工厂的全部流程。它会不断试错、总结经验,然后用这些经验去完成更复杂的任务。MobileForge就像这个聪明的机器人,它在真实的手机应用中学习如何操作,而不用依赖人工提前写好的任务或奖励。它通过不断尝试、观察和修正,逐步变得更聪明、更可靠,最终可以自主完成各种复杂的手机操作任务。这种方式大大降低了人工干预的成本,也让智能体变得更加灵活和适应性强。
简单解释 像给14岁少年讲一样
想象你在学校里学习做菜,你没有老师告诉你每一步怎么做,而是自己试一试,遇到问题再想办法修正。比如,你试着做一个三明治,发现面包不够新鲜,你就换个面包或者调整配料。每次尝试后,你会记住哪些步骤可以成功,哪些需要改进。慢慢地,你变得越来越擅长做各种菜。这就像MobileForge在手机应用中学习操作一样,它不依赖老师提前写好的步骤,而是通过自己尝试、观察和修正,不断学习。它会在真实的手机环境中试验不同的操作,得到反馈,然后用这些反馈改进自己的行为。这样,机器人可以自己学会很多复杂的任务,而不用每次都由人来告诉它怎么做。这种学习方式就像你自己在厨房里摸索,最终变成了大厨!
原文摘要
MLLM-based mobile GUI agents have made substantial progress in UI understanding and action execution, but adapting them to real target apps remains costly because mobile apps are numerous, frequently updated, and hard to cover with human-written tasks, demonstrations, or reward labels. Existing annotation-free GUI learning reduces manual supervision, yet lacks a unified substrate connecting target-app exploration, curriculum mining, rollout execution, and feedback, while policy optimization often relies on isolated rollouts and coarse rewards that are hard to convert into reliable improvement signals. We present MobileForge, an annotation-free adaptation system for mobile GUI agents. MobileForge consists of MobileGym, which grounds task generation and rollout evaluation in real mobile app interaction, and Hierarchical Feedback-Guided Policy Optimization (HiFPO), which turns trajectory outcomes, step-level process feedback, and corrective hints into hint-contextualized step-level GRPO updates. Using only automatically generated annotation-free adaptation data, MobileForge adapts Qwen3-VL-8B to 67.2% Pass@3 on AndroidWorld, close to the closed-data GUI-specialized GUI-Owl-1.5-8B base model at 69.0%. The MobileForge-adapted ForgeOwl-8B further reaches 77.6% Pass@3 on AndroidWorld and 41.0% success on the out-of-domain MobileWorld GUI-only split, establishing the strongest open-data mobile GUI agent in our evaluation. Code, data, and trained models will be released at https://mobile-forge.github.io/.