UI-Venus-1.5 Technical Report

TL;DR

UI-Venus-1.5通过模型合并和在线强化学习实现了77.6%的AndroidWorld导航成功率。

cs.CV 🔴 高级 2026-02-10 5 次浏览
Venus Team Changlong Gao Zhangxuan Gu Yulin Liu Xinyu Qiu Shuheng Shen Yue Wen Tianyu Xia Zhenyu Xu Zhengwen Zeng Beitong Zhou Xingran Zhou Weizhi Chen Sunhao Dai Jingya Dou Yichen Gong Yuan Guo Zhenlin Guo Feng Li Qian Li Jinzhen Lin Yuqi Zhou Linchao Zhu Liang Chen Zhenyu Guo Changhua Meng Weiqiang Wang
GUI代理 强化学习 模型合并 导航 移动应用

核心发现

方法论

UI-Venus-1.5采用了三个关键技术:中期训练阶段利用10亿个token建立GUI语义基础;在线强化学习通过完整轨迹回滚优化长时间导航;模型合并将领域特定模型合成一个统一的检查点。

关键结果

  • 在ScreenSpot-Pro上取得69.6%的准确率,超过Seed1.8和Holo2等基线。
  • 在VenusBench-GD上达到75.0%的准确率,显著优于MAI-UI。
  • 在AndroidWorld上成功率为77.6%,超越Mobile-Agent-v3。

研究意义

UI-Venus-1.5在学术界和工业界具有重要影响,解决了长期以来在大规模环境中导航的痛点,提升了GUI代理的实用性。

技术贡献

UI-Venus-1.5通过模型合并和在线强化学习提供了新的理论保证和工程可能性,显著区别于现有SOTA方法。

新颖性

这是首次将中期训练与模型合并结合用于GUI代理,解决了训练数据与实际环境之间的域转移问题。

局限性

  • 在某些复杂的移动应用中,导航性能可能下降,因为环境动态变化。
  • 模型合并可能导致个别领域性能略微下降。

未来方向

未来工作包括扩展至更多语言环境和优化模型合并策略,以提高跨领域性能。

AI 总览摘要

UI-Venus-1.5是一个统一的GUI代理,旨在解决数字环境中的自动化交互问题。传统方法通常依赖于固定的API,而UI-Venus-1.5通过视觉感知直接与图形界面交互,模仿人类行为进行导航。该模型采用了中期训练阶段,利用10亿个token建立了坚实的GUI语义基础。通过在线强化学习和模型合并,UI-Venus-1.5在多个基准测试中取得了突破性的性能,特别是在AndroidWorld上达到了77.6%的成功率。尽管如此,该模型在某些动态环境中仍面临挑战,未来工作将致力于进一步优化模型合并策略。

深度分析

研究背景

随着多模态大语言模型的快速发展,GUI代理成为连接人类指令与数字执行的桥梁。传统自动化工具依赖于固定API,而GUI代理通过视觉感知直接与图形界面交互,模仿人类行为进行导航。

核心问题

创建能够自主操作数字设备的智能系统一直是人工智能的核心目标。现有方法在广泛的通用性和强大的任务性能之间难以取得平衡。

核心创新

UI-Venus-1.5引入了中期训练阶段、在线强化学习和模型合并。这些创新使得模型能够在大规模环境中进行长时间导航,并合成领域特定模型为一个统一的检查点。

方法详解

  • �� 中期训练阶段:利用10亿个token建立GUI语义基础。
  • �� 在线强化学习:通过完整轨迹回滚优化长时间导航。
  • �� 模型合并:将领域特定模型合成一个统一的检查点。

实验设计

实验设计包括在ScreenSpot-Pro、VenusBench-GD和AndroidWorld等基准测试中评估模型性能。使用多种数据集和强化学习策略进行训练。

结果分析

UI-Venus-1.5在ScreenSpot-Pro上取得69.6%的准确率,在VenusBench-GD上达到75.0%的准确率,在AndroidWorld上成功率为77.6%。

应用场景

UI-Venus-1.5在中国移动应用中表现出色,能够有效执行用户指令,适用于票务预订、商品购买和自动化对话管理等场景。

局限与展望

尽管UI-Venus-1.5在多个基准测试中表现优异,但在某些动态环境中仍面临挑战。未来工作将致力于优化模型合并策略。

通俗解读 非专业人士也能看懂

想象你在一个大型超市购物。UI-Venus-1.5就像一个智能购物助手,它能理解你的购物清单,并帮助你找到所有需要的商品。它不仅能识别商品的种类,还能根据你的指令在超市中导航,找到最佳路线。这就像是一个能够理解你需求的智能导航系统,帮助你在复杂的环境中快速找到目标。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你需要在一个巨大的地图上找到隐藏的宝藏。UI-Venus-1.5就像你的超级助手,它能理解你的指令,帮助你找到宝藏所在的位置。它不仅能识别地图上的标记,还能根据你的指令在游戏中导航,找到最佳路线。这就像是一个能够理解你需求的智能导航系统,帮助你在复杂的环境中快速找到目标。

术语表

GUI代理

图形用户界面代理,通过视觉感知与界面交互。

在UI-Venus-1.5中用于自动化交互。

强化学习

通过奖励机制优化策略。

用于优化UI-Venus-1.5的导航能力。

模型合并

将多个领域模型合成一个统一模型。

用于创建单一的GUI代理。

中期训练

在强化学习之前进行的训练阶段。

用于建立GUI语义基础。

轨迹回滚

完整的导航路径优化过程。

用于在线强化学习阶段。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态环境中进一步提高导航性能?
  • 2 模型合并对个别领域性能的影响如何优化?

应用场景

近期应用

移动应用导航

UI-Venus-1.5可用于复杂的移动应用导航,帮助用户快速找到目标功能。

远期愿景

智能助手

UI-Venus-1.5有潜力成为日常生活中的智能助手,帮助用户在数字环境中高效完成任务。

原文摘要

GUI agents have emerged as a powerful paradigm for automating interactions in digital environments, yet achieving both broad generality and consistently strong task performance remains challenging. In this report, we present UI-Venus-1.5, a unified, end-to-end GUI Agent designed for robust real-world applications. The proposed model family comprises two dense variants (2B and 8B) and one mixture-of-experts variant (30B-A3B) to meet various downstream application scenarios. Compared to our previous version, UI-Venus-1.5 introduces three key technical advances: (1) a comprehensive Mid-Training stage leveraging 10 billion tokens across 30+ datasets to establish foundational GUI semantics; (2) Online Reinforcement Learning with full-trajectory rollouts, aligning training objectives with long-horizon, dynamic navigation in large-scale environments; and (3) a single unified GUI Agent constructed via Model Merging, which synthesizes domain-specific models (grounding, web, and mobile) into one cohesive checkpoint. Extensive evaluations demonstrate that UI-Venus-1.5 establishes new state-of-the-art performance on benchmarks such as ScreenSpot-Pro (69.6%), VenusBench-GD (75.0%), and AndroidWorld (77.6%), significantly outperforming previous strong baselines. In addition, UI-Venus-1.5 demonstrates robust navigation capabilities across a variety of Chinese mobile apps, effectively executing user instructions in real-world scenarios. Code: https://github.com/inclusionAI/UI-Venus; Model: https://huggingface.co/collections/inclusionAI/ui-venus

cs.CV cs.AI cs.CL cs.LG