HyMobileAgent: Data-Environment Co-Scaling for Efficient GUI Agents

TL;DR

HyMobileAgent通过数据与环境共扩展实现高效GUI代理,AndroidWorld成功率82.6%。

cs.CV 🔴 高级 2026-07-16 3 次浏览
Hy Vision Team Huawen Shen Zhengyang Tang Shangpin Peng Liang Wu Anran Zhang Weinong Wang Yiduo Guo Chenxin Li Zhengyao Fang Yang Ding Junyi Li Fei Tang Zheng Ruan Yi Zhang Xingran Zhou Dingchen Yang Sunqi Fan Zhiyi Wan Han Hu Xin Lai Pengyuan Lyu Chengquan Zhang
多模态模型 GUI代理 数据扩展 环境模拟 强化学习

核心发现

方法论

HyMobileAgent采用Hy3.0-VL-A3B模型,结合数据与环境扩展框架。框架包括GUI感知飞轮、知识提取管道、百万级动作数据管道及PhoneWorld模拟环境,支持长时决策与死循环检测。

关键结果

  • 在AndroidWorld基准上,HyMobileAgent成功率达82.6%,超越Gemini 3.1等大规模模型。
  • 在HyMobileWorld基准上,成功率为42%,与Seed 2.0 Pro相当,远超其他同规模模型。
  • 在MMBench-GUI L2上得分89.3,ScreenSpot V2上得分96.2,表现优异。

研究意义

该研究展示了通过数据与环境共扩展来提升移动GUI代理的效率与可靠性的重要性。它解决了复杂界面感知、数据获取及长时决策的瓶颈,为学术界和工业界提供了新的思路。

技术贡献

HyMobileAgent在现有方法基础上,通过数据与环境的联合扩展,提供了新的技术路径。其创新在于结合了GUI感知飞轮与PhoneWorld模拟环境,提升了模型的泛化能力和执行效率。

新颖性

HyMobileAgent首次将数据与环境扩展结合用于移动GUI代理,突破了仅依赖模型扩展的局限,提供了新的研究视角。

局限性

  • 在真实设备上的成功率仍有提升空间,特别是在复杂任务场景中。
  • 对环境变化的适应性有待进一步验证。

未来方向

未来研究可探索更复杂的环境模拟和更高效的数据扩展方法,以进一步提升模型的泛化能力和执行效率。

AI 总览摘要

随着多模态系统从内容理解转向数字环境操作,移动GUI成为数字智能的重要试验场。现有方法在复杂界面感知、数据获取及长时决策上面临挑战。HyMobileAgent通过数据与环境共扩展框架,结合Hy3.0-VL-A3B模型,提供了一种新的解决方案。其核心技术包括GUI感知飞轮、知识提取管道及PhoneWorld模拟环境,支持长时决策与死循环检测。实验结果显示,HyMobileAgent在AndroidWorld和HyMobileWorld基准上表现优异,成功率分别为82.6%和42%。该研究不仅为学术界提供了新的研究方向,也为工业界的实际应用提供了参考。尽管如此,模型在真实设备上的表现仍有提升空间,未来研究可进一步优化数据与环境扩展方法。

深度分析

研究背景

随着多模态系统的发展,移动GUI成为数字智能的重要试验场。传统方法在复杂界面感知、数据获取及长时决策上面临挑战。近年来,基于大规模语言模型和视觉语言模型的方法取得了一定进展,但仍存在局限。

核心问题

移动GUI代理面临复杂界面感知、数据获取及长时决策的挑战。这些问题相互影响,单纯依赖模型扩展无法解决。

核心创新

HyMobileAgent通过数据与环境共扩展框架,结合Hy3.0-VL-A3B模型,提供了一种新的解决方案。其创新在于结合了GUI感知飞轮与PhoneWorld模拟环境,提升了模型的泛化能力和执行效率。

方法详解

  • �� 使用Hy3.0-VL-A3B模型进行感知与推理。
  • �� GUI感知飞轮通过合成界面生成、拒绝采样和图标增强提升感知能力。
  • �� 知识提取管道将教程视频转化为结构化交互数据。
  • �� PhoneWorld模拟环境提供可重置的训练环境,支持大规模交互轨迹收集。

实验设计

实验在AndroidWorld和HyMobileWorld基准上进行,评估模型在真实设备上的表现。使用MMBench-GUI L2和ScreenSpot V2等数据集进行感知能力测试。

结果分析

HyMobileAgent在AndroidWorld基准上成功率达82.6%,在HyMobileWorld基准上成功率为42%。在MMBench-GUI L2上得分89.3,ScreenSpot V2上得分96.2。

应用场景

HyMobileAgent可用于移动设备上的智能助手,支持复杂任务的自动化执行。其环境模拟能力可用于训练和评估其他智能代理。

局限与展望

模型在真实设备上的表现仍有提升空间,特别是在复杂任务场景中。对环境变化的适应性有待进一步验证。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,HyMobileAgent就像一个聪明的助手,能帮你识别食材、提供食谱,并在你需要时递给你工具。它不仅能理解你的指令,还能根据环境变化调整计划,就像你在做饭时根据食材的变化调整菜谱一样。通过不断学习新的食谱和技巧,它能越来越好地帮助你完成复杂的烹饪任务。

简单解释 像给14岁少年讲一样

想象你在玩一个复杂的手机游戏,HyMobileAgent就像一个超级助手,能帮你完成各种任务。它能识别游戏中的各种图标,就像你能认出游戏中的角色一样。它还能根据游戏进度调整策略,就像你在游戏中根据敌人的变化调整战术一样。通过不断学习新的游戏技巧,它能帮助你在游戏中取得更高的分数!

术语表

多模态模型 (Multimodal Model)

能够处理多种数据类型(如图像和文本)的模型。

用于理解和操作数字环境。

GUI代理 (GUI Agent)

在图形用户界面上执行任务的智能代理。

用于移动设备上的任务自动化。

数据扩展 (Data Scaling)

通过增加数据量和多样性来提高模型性能的方法。

用于提升模型的泛化能力。

环境模拟 (Environment Simulation)

创建虚拟环境以测试和训练智能代理的方法。

用于训练和评估HyMobileAgent。

强化学习 (Reinforcement Learning)

通过奖励机制训练智能体的方法。

用于优化模型的长时决策能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实设备上提高HyMobileAgent的成功率,特别是在复杂任务场景中?
  • 2 如何提高模型对环境变化的适应性?

应用场景

近期应用

智能助手

HyMobileAgent可用于移动设备上的智能助手,帮助用户完成复杂任务。

远期愿景

自动化工作流

通过环境模拟和数据扩展,HyMobileAgent可用于自动化复杂的工作流,提高生产效率。

原文摘要

As large multimodal models move from understanding content to operating on digital environments, mobile GUI has emerged as a challenging and consequential testbed for digital embodied intelligence. Mobile agents operate under three coupled constraints: precise perception of complex interfaces, scalable acquisition of high-quality interaction data, and robust long-horizon decision making under compounding execution errors. This report presents HyMobileAgent, a mobile GUI agent built on Hy3.0-VL-A3B, a vision-native foundation model featuring native any-resolution input, an A3B-scale deployment budget, and a 32K context window to model extended interaction histories. Rather than relying solely on model scaling, we develop a joint data and environment centric scaling framework to address the key bottlenecks of mobile interaction. Our framework integrates a GUI perception flywheel combining mock-interface synthesis, rejection sampling, and icon-specific augmentation; a knowledge pipeline that transforms tutorial videos into structured interaction data; a million-scale action data pipeline deployed across more than 2000 sandbox and real-device instances with automated failure attribution; the PhoneWorld Mock App Factory, providing a resettable training environment with 34 mock applications and over 34000 tasks; and a structured Planning-and-Reflection mechanism with explicit dead-loop detection for reliable long-horizon execution. We also introduce a progressive training recipe consisting of mid-training, supervised fine-tuning, and reinforcement learning with task-specific reward designs.

cs.CV