UI-Venus-1.5 Technical Report
UI-Venus-1.5通过模型合并和在线强化学习实现了77.6%的AndroidWorld导航成功率。
核心发现
方法论
UI-Venus-1.5采用了三个关键技术:中期训练阶段利用10亿个token建立GUI语义基础;在线强化学习通过完整轨迹回滚优化长时间导航;模型合并将领域特定模型合成一个统一的检查点。
关键结果
- 在ScreenSpot-Pro上取得69.6%的准确率,超过Seed1.8和Holo2等基线。
- 在VenusBench-GD上达到75.0%的准确率,显著优于MAI-UI。
- 在AndroidWorld上成功率为77.6%,超越Mobile-Agent-v3。
研究意义
UI-Venus-1.5在学术界和工业界具有重要影响,解决了长期以来在大规模环境中导航的痛点,提升了GUI代理的实用性。
技术贡献
UI-Venus-1.5通过模型合并和在线强化学习提供了新的理论保证和工程可能性,显著区别于现有SOTA方法。
新颖性
这是首次将中期训练与模型合并结合用于GUI代理,解决了训练数据与实际环境之间的域转移问题。
局限性
- 在某些复杂的移动应用中,导航性能可能下降,因为环境动态变化。
- 模型合并可能导致个别领域性能略微下降。
未来方向
未来工作包括扩展至更多语言环境和优化模型合并策略,以提高跨领域性能。
AI 总览摘要
UI-Venus-1.5是一个统一的GUI代理,旨在解决数字环境中的自动化交互问题。传统方法通常依赖于固定的API,而UI-Venus-1.5通过视觉感知直接与图形界面交互,模仿人类行为进行导航。该模型采用了中期训练阶段,利用10亿个token建立了坚实的GUI语义基础。通过在线强化学习和模型合并,UI-Venus-1.5在多个基准测试中取得了突破性的性能,特别是在AndroidWorld上达到了77.6%的成功率。尽管如此,该模型在某些动态环境中仍面临挑战,未来工作将致力于进一步优化模型合并策略。
深度分析
研究背景
随着多模态大语言模型的快速发展,GUI代理成为连接人类指令与数字执行的桥梁。传统自动化工具依赖于固定API,而GUI代理通过视觉感知直接与图形界面交互,模仿人类行为进行导航。
核心问题
创建能够自主操作数字设备的智能系统一直是人工智能的核心目标。现有方法在广泛的通用性和强大的任务性能之间难以取得平衡。
核心创新
UI-Venus-1.5引入了中期训练阶段、在线强化学习和模型合并。这些创新使得模型能够在大规模环境中进行长时间导航,并合成领域特定模型为一个统一的检查点。
方法详解
- �� 中期训练阶段:利用10亿个token建立GUI语义基础。
- �� 在线强化学习:通过完整轨迹回滚优化长时间导航。
- �� 模型合并:将领域特定模型合成一个统一的检查点。
实验设计
实验设计包括在ScreenSpot-Pro、VenusBench-GD和AndroidWorld等基准测试中评估模型性能。使用多种数据集和强化学习策略进行训练。
结果分析
UI-Venus-1.5在ScreenSpot-Pro上取得69.6%的准确率,在VenusBench-GD上达到75.0%的准确率,在AndroidWorld上成功率为77.6%。
应用场景
UI-Venus-1.5在中国移动应用中表现出色,能够有效执行用户指令,适用于票务预订、商品购买和自动化对话管理等场景。
局限与展望
尽管UI-Venus-1.5在多个基准测试中表现优异,但在某些动态环境中仍面临挑战。未来工作将致力于优化模型合并策略。
通俗解读 非专业人士也能看懂
想象你在一个大型超市购物。UI-Venus-1.5就像一个智能购物助手,它能理解你的购物清单,并帮助你找到所有需要的商品。它不仅能识别商品的种类,还能根据你的指令在超市中导航,找到最佳路线。这就像是一个能够理解你需求的智能导航系统,帮助你在复杂的环境中快速找到目标。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,你需要在一个巨大的地图上找到隐藏的宝藏。UI-Venus-1.5就像你的超级助手,它能理解你的指令,帮助你找到宝藏所在的位置。它不仅能识别地图上的标记,还能根据你的指令在游戏中导航,找到最佳路线。这就像是一个能够理解你需求的智能导航系统,帮助你在复杂的环境中快速找到目标。
术语表
GUI代理
图形用户界面代理,通过视觉感知与界面交互。
在UI-Venus-1.5中用于自动化交互。
强化学习
通过奖励机制优化策略。
用于优化UI-Venus-1.5的导航能力。
模型合并
将多个领域模型合成一个统一模型。
用于创建单一的GUI代理。
中期训练
在强化学习之前进行的训练阶段。
用于建立GUI语义基础。
轨迹回滚
完整的导航路径优化过程。
用于在线强化学习阶段。
开放问题 这项研究留下的未解疑问
- 1 如何在动态环境中进一步提高导航性能?
- 2 模型合并对个别领域性能的影响如何优化?
应用场景
近期应用
移动应用导航
UI-Venus-1.5可用于复杂的移动应用导航,帮助用户快速找到目标功能。
远期愿景
智能助手
UI-Venus-1.5有潜力成为日常生活中的智能助手,帮助用户在数字环境中高效完成任务。
原文摘要
GUI agents have emerged as a powerful paradigm for automating interactions in digital environments, yet achieving both broad generality and consistently strong task performance remains challenging. In this report, we present UI-Venus-1.5, a unified, end-to-end GUI Agent designed for robust real-world applications. The proposed model family comprises two dense variants (2B and 8B) and one mixture-of-experts variant (30B-A3B) to meet various downstream application scenarios. Compared to our previous version, UI-Venus-1.5 introduces three key technical advances: (1) a comprehensive Mid-Training stage leveraging 10 billion tokens across 30+ datasets to establish foundational GUI semantics; (2) Online Reinforcement Learning with full-trajectory rollouts, aligning training objectives with long-horizon, dynamic navigation in large-scale environments; and (3) a single unified GUI Agent constructed via Model Merging, which synthesizes domain-specific models (grounding, web, and mobile) into one cohesive checkpoint. Extensive evaluations demonstrate that UI-Venus-1.5 establishes new state-of-the-art performance on benchmarks such as ScreenSpot-Pro (69.6%), VenusBench-GD (75.0%), and AndroidWorld (77.6%), significantly outperforming previous strong baselines. In addition, UI-Venus-1.5 demonstrates robust navigation capabilities across a variety of Chinese mobile apps, effectively executing user instructions in real-world scenarios. Code: https://github.com/inclusionAI/UI-Venus; Model: https://huggingface.co/collections/inclusionAI/ui-venus