OpenMobile: Building Open Mobile Agents with Task and Trajectory Synthesis
OpenMobile通过环境探索与任务合成,利用策略切换提升移动代理的性能,达51.7%成功率。
核心发现
方法论
OpenMobile采用两大核心组件:一是基于环境探索构建全局环境记忆,通过视觉语言模型(VLM)生成多样且具基础的任务指令;二是引入策略切换机制,在轨迹回放中交替使用学习模型和专家模型,捕获错误恢复数据。环境探索采用随机游走,利用感知哈希聚类屏幕状态,提取功能集,构建结构化的全局记忆库。任务合成则结合短期邻近屏幕信息与长期语义相关功能,通过上下文引导VLM生成复杂指令。轨迹回放策略中,错误干预机制通过实时监控检测偏差,触发专家模型修正,增强错误恢复能力。最终,合成了2800条任务指令和34000个动作步骤,覆盖20个Android应用。模型在AndroidWorld、AndroidLab和MobileWorld三个基准上表现优异,显著超越开源数据集,接近闭源系统。
关键结果
- 在AndroidWorld上,Qwen2.5-VL和Qwen3-VL模型分别达到了51.7%和64.7%的任务成功率,远超现有开源方法(约30%),并逼近行业领先闭源模型(70%)。在MobileWorld上,性能由9.4%提升至17.4%,显示出良好的泛化能力。引入策略切换后,错误恢复能力显著增强,模型在复杂任务中表现更稳健。数据合成策略的多样性和 grounded instruction的质量,成为性能提升的关键因素。
- 在不同任务和环境中,模型展现出强大的适应性,验证了全局环境记忆和策略切换的有效性。
- 通过对合成指令与测试集的重叠分析,确认性能提升源于功能覆盖广泛和错误恢复能力,而非过拟合。
研究意义
该研究突破了移动代理训练数据的封闭性问题,提供了开源的高质量合成数据,推动了自主智能体在真实动态环境中的应用。通过环境探索与任务合成的解耦设计,显著提升了任务多样性和模型的泛化能力,为未来自主系统的研发提供了可复制、可扩展的框架。这不仅降低了行业门槛,也促进了学术界对移动代理学习机制的理解,推动了智能交互、自动化操作等多个应用场景的发展。
技术贡献
论文提出了环境探索与任务合成的解耦框架,利用全局环境记忆和多层次功能检索,增强了指令的多样性和 grounded 性。引入策略切换机制,结合错误干预,丰富了训练中的错误恢复数据,改善了模型的鲁棒性。采用感知哈希和语义检索,系统性地组织环境信息,提升了指令的复杂度和执行的可靠性。该方法在多个动态移动任务基准中表现优异,验证了其在大规模、开源数据生成方面的创新优势。
新颖性
首次提出环境探索与任务合成的解耦策略,突破了传统依赖单一轨迹的局限,实现了多样化、 grounded 的任务指令生成。引入基于策略切换的轨迹回放机制,有效捕获错误修正信息,提升模型的错误恢复能力。这些创新在移动代理领域尚属首例,为开源社区提供了可复制的高效数据合成方案,填补了行业在大规模、 grounded 指令生成方面的空白。
局限性
- 尽管策略切换增强了错误恢复能力,但在极端复杂环境或极长任务中仍可能面临信息遗漏或偏差累积的问题。
- 随机游走探索虽简便,但在某些应用场景下效率不足,未来需结合更智能的探索策略。
- 模型对环境变化的适应性仍有限,未来需引入持续学习机制以应对动态环境的变化。
未来方向
未来将结合强化学习和自我监督机制,提升模型在未知环境中的适应性和自主性。探索更高效的探索策略,结合多模态信息丰富环境记忆。同时,计划扩展到多平台、多任务场景,推动移动代理的实际应用落地,促进智能系统的自主学习和持续优化。
AI 总览摘要
OpenMobile提出了一种创新的环境探索与任务合成框架,旨在解决移动代理训练数据封闭、多样性不足的问题。通过构建全局环境记忆,系统性组织应用功能信息,结合短期邻近屏幕和长期语义相关功能,生成 grounded、复杂的任务指令。这一过程借助视觉语言模型(VLM)实现,确保指令的多样性和 grounded 性。
在轨迹生成方面,OpenMobile引入策略切换机制,结合专家模型与学习模型的优势,通过实时监控偏差触发专家干预,捕获错误修正信息,显著增强模型的错误恢复能力。该方法在20个Android应用中合成了2800条任务指令和34000个动作步骤,训练出的模型在AndroidWorld、AndroidLab和MobileWorld基准上均表现优异,成功率远超开源数据集,逼近行业领先的闭源系统。
这些创新不仅突破了传统依赖单一轨迹和封闭数据的限制,也为开源社区提供了可复制、可扩展的高质量数据合成方案。实验结果验证了全局环境记忆和策略切换的有效性,显示出在复杂、多任务环境中的强大适应性。未来,结合强化学习和持续学习,将推动移动代理在更广泛场景中的应用,助力智能自动化的普及。
深度分析
研究背景
移动代理技术经过多年发展,从早期依赖结构化界面表示,到近年来基于视觉语言模型的端到端系统(如Operator、UI-TARS、MAI-UI),极大提升了自主交互能力。行业内的代表性工作包括Step-GUI、Gao et al.的UI-Venus系列,以及Xu等人的MobileAgent-v3.5,均在AndroidWorld等基准上取得了接近70%的成功率。这些系统依赖大规模的高质量训练数据,特别是任务指令和轨迹,但其数据多为封闭,缺乏公开透明的合成策略,限制了学术界的研究和创新。
核心问题
当前行业领先的移动代理系统普遍采用封闭数据,缺乏公开的任务指令和轨迹生成流程,导致研究的可复现性和创新性受限。公开数据集如AndroidControl和AMEX虽然提供了基础,但存在标注噪声大、功能覆盖有限的问题,模型性能停滞在30%左右。如何在保证指令 grounded 和多样性的同时,提升错误恢复能力,成为亟需解决的核心难题。
核心创新
OpenMobile提出了环境探索与任务合成的解耦策略,利用全局环境记忆组织应用功能,生成 grounded、多样的任务指令。引入策略切换机制,通过实时偏差检测触发专家干预,丰富错误修正数据,提升模型鲁棒性。这些创新突破了传统单轨迹、封闭数据的局限,为开源社区提供了高效、可扩展的合成方案,推动了移动代理的研究进步。
方法详解
- �� 环境探索:采用随机游走收集应用状态转移数据,利用感知哈希聚类屏幕状态,提取功能集,构建全局记忆库。• 任务合成:结合短期邻近屏幕信息和长期语义相关功能,通过视觉语言模型(如Qwen-VL系列)在丰富上下文中生成 grounded 指令。• 轨迹回放:采用策略切换机制,结合专家模型和学习模型,实时监控偏差,触发专家干预,增强错误修正。• 数据合成:在20个Android应用中生成2800条指令、34000动作,确保多样性和 grounded 性。• 训练与评估:在AndroidWorld、AndroidLab、MobileWorld上验证模型性能,采用成功率和任务完成度作为指标。
实验设计
采用真实Android模拟环境,训练Qwen2.5-VL-7B和Qwen3-VL-8B模型,比较不同轨迹回放策略的效果。基准包括AndroidWorld、AndroidLab和MobileWorld,评估指标为Pass@1和Pass@3。通过 ablation 实验验证环境记忆和策略切换的贡献,分析合成指令的 grounded 性和多样性。模型参数设定为学习率1e-5,训练3轮,采用RL微调验证鲁棒性。
结果分析
模型在AndroidWorld达成51.7%和64.7%的成功率,显著优于开源数据集(约30%),接近闭源系统(70%)。在MobileWorld中,性能由9.4%提升至17.4%。引入策略切换后,错误修正能力增强,模型在复杂任务中表现更稳健。指令多样性和 grounded 性显著提升,验证了全局环境记忆和策略切换的有效性。
通俗解读 非专业人士也能看懂
想象你在厨房做饭。传统方法就像只记住一道菜的做法,遇到问题只能重做。OpenMobile像是你先把所有食材都整理好,记住每个食材的用途,然后根据需要灵活搭配,遇到难题还能请教厨师帮忙修正。它通过不断探索厨房的每个角落,建立一个完整的食材和工具的地图,之后用这个地图生成复杂的菜谱。做菜时,系统会监控你的操作,一旦偏离正确步骤,就请厨师帮忙纠正,确保菜肴最终成功。这种方法让厨房操作变得更智能、更可靠,也能做出更多不同的菜肴。
简单解释 像给14岁少年讲一样
想象你在学校学做手工艺品。以前老师只教你一条固定的步骤,你照着做遇到问题就得自己猜。现在,老师先带你探索整个工作室,告诉你所有工具和材料都能做什么,然后你可以用这些信息自己设计出复杂的作品。过程中,如果你偏离了正确的步骤,老师会及时帮你纠正,确保你能完成作品。这就像是你有了一个详细的地图和一个聪明的老师,既能学会多样的技巧,又能在遇到困难时得到帮助。这样,做手工就变得更有趣,也更容易成功。
术语表
视觉语言模型 (Vision-Language Model)
结合视觉信息和文本理解的模型,用于理解UI界面和生成指令。In this paper, it用于环境理解和指令生成。
用于构建环境记忆和生成 grounded 指令。
策略切换 (Policy Switching)
在轨迹回放中交替使用专家模型和学习模型,捕获错误修正信息。In this work, it增强模型的错误恢复能力。
提升轨迹的多样性和鲁棒性。
全局环境记忆 (Global Environment Memory)
通过探索收集的应用状态和功能信息的结构化存储,用于指令生成。
支撑 grounded、多样化任务指令的合成。
grounded 指令
基于环境状态和功能的具体任务描述,确保指令可执行。
提升指令的 grounded 性和任务成功率。
感知哈希 (Perceptual Hashing)
一种图像相似性检测方法,用于屏幕状态聚类。
组织和组织环境状态,构建全局记忆库。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升模型在极端复杂或长时间任务中的错误恢复能力,仍需探索更智能的策略和模型结构。
- 2 环境探索策略仍以随机游走为主,未来需结合主动探索和强化学习以提高效率。
- 3 模型对动态环境的适应性和持续学习能力有待增强,以应对真实世界的不断变化。
应用场景
近期应用
智能手机自动操作
基于OpenMobile的模型可以实现自动化操作,如自动设置、信息采集,减少用户手动干预,提升效率。
企业自动化测试
利用合成任务指令和轨迹,自动测试移动应用的功能,节省人力和时间,提升测试覆盖率。
远期愿景
自主智能助手
未来可发展为具备自主学习和适应能力的智能助手,能在多环境、多任务中自主完成复杂操作,推动智能家居和工业自动化。
原文摘要
Mobile agents powered by vision-language models have demonstrated impressive capabilities in automating mobile tasks, with recent leading models achieving a marked performance leap, e.g., nearly 70% success on AndroidWorld. However, these systems keep their training data closed and remain opaque about their task and trajectory synthesis recipes. We present OpenMobile, an open-source framework that synthesizes high-quality task instructions and agent trajectories, with two key components: (1) The first is a scalable task synthesis pipeline that constructs a global environment memory from exploration, then leverages it to generate diverse and grounded instructions. and (2) a policy-switching strategy for trajectory rollout. By alternating between learner and expert models, it captures essential error-recovery data often missing in standard imitation learning. Agents trained on our data achieve competitive results across three dynamic mobile agent benchmarks: notably, our fine-tuned Qwen2.5-VL and Qwen3-VL reach 51.7% and 64.7% on AndroidWorld, far surpassing existing open-data approaches. Furthermore, we conduct transparent analyses on the overlap between our synthetic instructions and benchmark test sets, and verify that performance gains stem from broad functionality coverage rather than benchmark overfitting. We release data and code at https://njucckevin.github.io/openmobile/ to bridge the data gap and facilitate broader mobile agent research.