Xiaomi-GUI-0 Technical Report
Xiaomi-GUI-0在真实设备上实现72.0%成功率,显著提高稳定性。
核心发现
方法论
Xiaomi-GUI-0采用真实设备为主的混合基础设施,结合沙盒支持,确保数据收集、训练和评估的执行分布与真实部署接近。模型通过三阶段管道训练:监督微调、步骤级强化学习和代理强化学习,逐步提升任务执行能力。
关键结果
- 在RealMobile上,Xiaomi-GUI-0达到了72.0%的成功率,而在AndroidWorld上达到了78.9%,显著提高了在真实任务中的执行稳定性和异常状态识别能力。
- 通过错误驱动的数据飞轮机制,模型能够将失败轨迹转化为纠正动作和恢复示范,提高了异常状态下的自我恢复能力。
- 在实验中,模型在多种应用场景下展示了较高的任务完成率和鲁棒性,尤其是在处理异常页面时表现突出。
研究意义
该研究通过在真实设备上训练和评估GUI代理,缩小了基准测试分数与真实可用性之间的差距。它解决了现有方法在界面布局、交互逻辑和异常状态分布方面的不足,为学术界和工业界提供了一个更贴近实际应用的解决方案。
技术贡献
技术贡献包括构建了一个以真实设备为主的混合基础设施,用于任务执行和轨迹收集,以及引入了错误驱动的数据飞轮机制,能够在真实执行中暴露的错误模式中提取监督信号,从而提高模型的稳定性和鲁棒性。
新颖性
Xiaomi-GUI-0首次在真实移动环境中实现了多模态GUI代理的端到端训练和评估,采用了真实设备为主的混合基础设施和错误驱动的数据飞轮机制,显著提升了异常状态下的执行稳定性。
局限性
- 模型在处理极端异常状态时仍可能出现失败,例如复杂的支付认证或多层次的权限对话框。
- 由于依赖真实设备,训练和评估的规模受到物理设备数量的限制。
未来方向
未来工作可以探索在更多设备类型和操作系统上扩展该方法,并进一步优化错误驱动的数据飞轮机制,以提高模型在更复杂任务中的表现。
AI 总览摘要
Xiaomi-GUI-0是一种针对真实移动环境的多模态GUI代理,旨在解决现有方法在界面布局、交互逻辑和异常状态分布方面的不足。通过在真实设备上进行训练和评估,该模型实现了更高的任务完成率和执行稳定性。
该模型采用了真实设备为主的混合基础设施,结合沙盒支持,确保数据收集、训练和评估的执行分布与真实部署接近。通过三阶段的训练管道,模型逐步提升了任务执行能力,尤其是在处理异常状态时表现出色。
实验结果表明,Xiaomi-GUI-0在RealMobile上达到了72.0%的成功率,在AndroidWorld上达到了78.9%。该研究为学术界和工业界提供了一个更贴近实际应用的解决方案,缩小了基准测试分数与真实可用性之间的差距。
深度分析
研究背景
随着移动设备的普及,图形用户界面(GUI)代理在自动化任务执行中的应用越来越广泛。然而,现有的GUI代理大多依赖于离线轨迹、模拟环境和标准化基准测试,这与真实应用场景存在显著差异。为了更好地适应真实应用环境,研究者们开始探索在真实设备上训练和评估GUI代理的方法。
核心问题
现有的GUI代理在界面布局、交互逻辑和异常状态分布方面与真实应用存在显著差距,导致高基准测试分数与真实可用性之间存在持久的差距。解决这一问题对于提高模型在真实任务中的执行稳定性和异常状态识别能力至关重要。
核心创新
Xiaomi-GUI-0通过构建以真实设备为主的混合基础设施,并引入错误驱动的数据飞轮机制,实现了在真实移动环境中的多模态GUI代理的端到端训练和评估。这一创新显著提升了模型在异常状态下的执行稳定性。
方法详解
- �� 采用真实设备为主的混合基础设施,结合沙盒支持。
- �� 构建多源训练数据,涵盖高频任务数据、高泛化数据和能力增强数据。
- �� 引入错误驱动的数据飞轮机制,将失败轨迹转化为纠正动作和恢复示范。
- �� 通过三阶段训练管道逐步提升模型的任务执行能力。
实验设计
实验在RealMobile和AndroidWorld上进行,分别评估模型在真实设备和模拟环境中的任务完成率。实验设计包括多种应用场景和异常状态,确保模型在不同条件下的鲁棒性和稳定性。
结果分析
实验结果表明,Xiaomi-GUI-0在RealMobile上达到了72.0%的成功率,在AndroidWorld上达到了78.9%。模型在多种应用场景下展示了较高的任务完成率和鲁棒性,尤其是在处理异常页面时表现突出。
应用场景
Xiaomi-GUI-0可直接应用于移动设备的自动化任务执行,特别是在需要处理复杂异常状态的场景中。其在真实设备上的高成功率和稳定性使其在工业界具有广泛的应用潜力。
局限与展望
尽管Xiaomi-GUI-0在真实设备上表现出色,但其依赖于物理设备的训练和评估方法限制了其规模。此外,模型在处理极端异常状态时仍可能出现失败。
通俗解读 非专业人士也能看懂
想象你在一个复杂的迷宫中,Xiaomi-GUI-0就像一个聪明的向导,能够帮助你找到出口。它不仅知道每个转角的方向,还能在遇到障碍时迅速调整路线。通过在真实环境中训练,它能够识别各种复杂的情况,比如突然出现的障碍物或错误的路线,并及时做出调整。这就像一个经验丰富的司机,能够在拥堵的交通中找到最快的路线,确保你准时到达目的地。
简单解释 像给14岁少年讲一样
想象你在玩一个手机游戏,需要完成各种任务,比如找到隐藏的宝藏或解决谜题。Xiaomi-GUI-0就像一个超级助手,能够帮你快速完成这些任务。它不仅能理解你的指令,还能在遇到困难时给出解决方案。比如,当你遇到一个需要密码的门,它能帮你找到正确的钥匙。这就像有一个聪明的朋友,总能在你需要的时候提供帮助,让你在游戏中无往不利!
术语表
GUI代理 (Graphical User Interface Agent)
一种能够在图形用户界面上执行任务的智能代理,通常通过视觉-语言模型进行训练。
Xiaomi-GUI-0作为一种多模态GUI代理,能够在真实设备上完成用户任务。
多模态 (Multimodal)
结合多种数据模式(如视觉和语言)的技术,以提高模型的理解和执行能力。
Xiaomi-GUI-0通过多模态技术实现了更高的任务完成率。
强化学习 (Reinforcement Learning)
一种通过奖励机制训练智能体以优化其决策的机器学习方法。
Xiaomi-GUI-0采用了强化学习来提高任务执行的稳定性。
异常状态 (Abnormal State)
在任务执行过程中出现的非预期状态,如权限对话框或支付认证。
模型通过识别和处理异常状态来提高任务完成率。
数据飞轮 (Data Flywheel)
一种通过不断优化数据质量和模型性能的反馈机制。
Xiaomi-GUI-0使用错误驱动的数据飞轮来提高异常状态下的执行稳定性。
开放问题 这项研究留下的未解疑问
- 1 如何在更广泛的设备和操作系统上扩展该方法?
- 2 如何进一步优化错误驱动的数据飞轮机制以提高模型在复杂任务中的表现?
应用场景
近期应用
移动设备自动化
Xiaomi-GUI-0可用于自动化执行移动设备上的复杂任务,特别是在需要处理异常状态的场景中。
远期愿景
智能助手
未来,Xiaomi-GUI-0可以发展为更智能的助手,帮助用户在各种设备上完成更复杂的任务。
原文摘要
Graphical user interface (GUI) agents build on vision-language models to complete user tasks end-to-end in real applications through interface actions such as tapping, swiping, text entry, and navigation. However, existing GUI agents are trained and evaluated largely on offline trajectories, simulated environments, and standardized benchmarks. These differ substantially from real applications in interface layout, interaction logic, and abnormal-state distribution, and cannot faithfully characterize execution stability in real-world use, where account states, permission dialogs, payment authentication, and risk control continually reshape the state distribution and open a persistent gap between benchmark scores and real usability. To close this gap, we propose Xiaomi-GUI-0, a native multimodal GUI agent for real mobile environments, trained and evaluated within a real-device closed loop. At its core is a real-device-dominant hybrid infrastructure, where physical devices are the primary execution environment and sandboxes provide auxiliary support, so that data collection, training, rollout, and evaluation share an execution distribution close to real deployment. We construct multi-source training data spanning high-frequency head tasks, high-generalization data for long-tail intents, and capability-enhancement data for reflection and memory, and introduce an error-driven data flywheel that turns failure trajectories into corrected actions, reflective explanations, and recovery demonstrations. The model is trained through a progressive three-stage pipeline of supervised fine-tuning, step-level reinforcement learning, and agentic reinforcement learning. Evaluated on public benchmarks and our in-house RealMobile, Xiaomi-GUI-0 achieves 72.0% success on RealMobile and 78.9% on AndroidWorld, while substantially improving execution stability and abnormal-state recognition in real-world tasks.