VenusBench-Mobile: A Challenging and User-Centric Benchmark for Mobile GUI Agents with Capability Diagnostics

TL;DR

VenusBench-Mobile通过用户意图驱动的任务设计和能力导向的注释方案评估移动GUI代理,揭示当前代理在真实环境中的不足。

cs.HC 🔴 高级 2026-02-07 15 次浏览
Yichen Gong Zhuohan Cai Sunhao Dai Yuqi Zhou Zhangxuan Gu Changhua Meng Shuheng Shen
移动GUI 基准测试 用户意图 能力诊断 环境变化

核心发现

方法论

VenusBench-Mobile通过用户意图驱动的任务设计和能力导向的注释方案进行评估,涵盖10大用户意图类别和80种环境变化。该方法允许细粒度的行为分析,揭示代理在感知和记忆上的不足。

关键结果

  • 在VenusBench-Mobile上,当前最先进的代理成功率仅为36.9%,远低于传统基准测试,表明其任务难度显著提高。
  • 诊断分析显示,失败主要由感知和记忆能力的不足导致,这在粗粒度评估中往往被忽视。
  • 即使是最强的代理在环境变化下成功率接近零,暴露其在真实分布变化下的脆弱性。

研究意义

VenusBench-Mobile通过更具挑战性和现实性的任务,揭示了当前移动GUI代理在真实世界部署中的不足,提供了一个重要的评估基准,有助于推动更通用、稳健的代理的发展。

技术贡献

该研究提出了一种用户意图驱动的任务设计和能力导向的注释方案,能够进行细粒度的失败归因分析,区别于现有的粗粒度成功率评估方法。

新颖性

VenusBench-Mobile是首个从用户意图出发设计任务的移动GUI代理基准,突破了以往以应用功能为中心的评估范式。

局限性

  • 目前的基准测试主要在模拟环境中进行,可能无法完全反映真实世界的复杂性。
  • 环境变化的种类有限,可能无法涵盖所有可能的真实场景。

未来方向

未来研究可以扩展环境变化的种类和复杂性,并在真实设备上进行测试,以更好地评估代理的实际性能。

AI 总览摘要

VenusBench-Mobile提出了一种新的基准测试方法,通过用户意图驱动的任务设计和能力导向的注释方案,评估移动GUI代理在真实环境中的表现。现有的基准测试大多以应用为中心,任务同质化,无法反映真实世界的多样性和不稳定性。VenusBench-Mobile通过定义评估内容和方法,揭示了当前代理在感知和记忆能力上的不足,并指出即使是最先进的代理在环境变化下也表现不佳。

实验结果显示,当前代理在VenusBench-Mobile上的成功率显著低于传统基准测试,表明其任务难度更高,且更具现实性。诊断分析进一步揭示了代理在感知和记忆上的不足,这些问题在粗粒度评估中往往被忽视。

基于这些发现,VenusBench-Mobile为移动GUI代理的稳健部署提供了重要的评估基准,推动了更通用、稳健的代理的发展。未来研究可以扩展环境变化的种类,并在真实设备上进行测试,以更好地评估代理的实际性能。

深度分析

研究背景

近年来,视觉语言模型的快速发展使得移动GUI代理能够通过视觉感知和自然语言指令与图形用户界面交互。现有的基准测试大多以应用为中心,任务同质化,无法反映真实世界的多样性和不稳定性。这限制了代理在真实世界中的可靠性和部署。

核心问题

现有的基准测试无法充分评估移动GUI代理在真实环境中的表现,特别是在用户意图多样化和环境变化的情况下。代理在感知、记忆和决策能力上的不足往往被粗粒度的评估方法所掩盖。

核心创新

VenusBench-Mobile通过用户意图驱动的任务设计和能力导向的注释方案,提供了一个更具挑战性和现实性的评估框架。它涵盖了10大用户意图类别和80种环境变化,允许细粒度的行为分析。

方法详解

  • �� 用户意图驱动的任务设计,涵盖10大类别和149个任务。
  • �� 能力导向的注释方案,细粒度分析代理行为。
  • �� 系统性环境变化,测试代理在真实分布变化下的稳健性。

实验设计

实验在VenusBench-Mobile上进行,评估了多种最先进的移动GUI代理,包括UI-Venus-72B和Gemini-3-Pro。使用的指标包括任务成功率、能力维度准确率和稳定性评估。

结果分析

实验结果显示,当前代理在VenusBench-Mobile上的成功率显著低于传统基准测试,表明其任务难度更高。诊断分析揭示了代理在感知和记忆上的不足。

应用场景

VenusBench-Mobile可用于评估和改进移动GUI代理的性能,特别是在用户意图多样化和环境变化的情况下。它为代理的稳健部署提供了重要的评估基准。

局限与展望

目前的基准测试主要在模拟环境中进行,可能无法完全反映真实世界的复杂性。环境变化的种类有限,可能无法涵盖所有可能的真实场景。未来研究可以扩展环境变化的种类,并在真实设备上进行测试。

通俗解读 非专业人士也能看懂

想象你在用手机应用程序时,手机助手能理解你想做什么,并帮助你完成任务。VenusBench-Mobile就像一个严格的考试,测试这些助手在各种情况下的表现。它不仅考察助手能否完成任务,还分析它们在不同环境下的稳定性和能力。通过这种方式,我们可以找到助手的不足之处,并改进它们的性能。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,游戏中的助手能帮你完成各种任务。VenusBench-Mobile就像一个超级难的关卡,测试这些助手在不同情况下的表现。它不仅看助手能否完成任务,还分析它们在不同环境下的稳定性和能力。这样,我们可以找到助手的不足之处,并改进它们的性能。是不是很酷?

术语表

GUI代理

图形用户界面代理是能够与用户界面进行交互的自动化系统。

用于执行用户指令并完成任务。

用户意图驱动

基于用户的实际需求和意图设计任务。

用于设计更具现实性的评估任务。

能力导向注释

根据代理的能力进行细粒度的任务失败分析。

用于识别代理的具体能力不足。

环境变化

在不同语言、布局和界面条件下测试代理的稳健性。

用于评估代理在真实分布变化下的表现。

成功率

代理在基准测试中成功完成任务的比例。

用于评估代理的整体性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实设备上测试代理的性能,以更好地反映真实世界的复杂性。
  • 2 扩展环境变化的种类,以涵盖更多可能的真实场景。

应用场景

近期应用

移动应用测试

开发者可以使用VenusBench-Mobile评估其应用中的GUI代理性能,以确保其在用户多样化需求下的稳定性。

远期愿景

智能助手改进

通过识别和改进代理的不足,推动更通用、稳健的智能助手的发展。

原文摘要

Existing online benchmarks for mobile GUI agents remain largely app-centric and task-homogeneous, failing to reflect the diversity and instability of real-world mobile usage. To this end, we introduce VenusBench-Mobile, a challenging online benchmark for evaluating general-purpose mobile GUI agents under realistic, user-centric conditions. VenusBench-Mobile builds two core evaluation pillars: defining what to evaluate via user-intent-driven task design that reflects real mobile usage, and how to evaluate through a capability-oriented annotation scheme for fine-grained agent behavior analysis. Extensive evaluation of state-of-the-art mobile GUI agents reveals large performance gaps relative to prior benchmarks, indicating that VenusBench-Mobile poses substantially more challenging and realistic tasks and that current agents remain far from reliable real-world deployment. Diagnostic analysis further shows that failures are dominated by deficiencies in perception and memory, which are largely obscured by coarse-grained evaluations. Moreover, even the strongest agents exhibit near-zero success under environment variations, highlighting their brittleness in realistic settings. Based on these insights, we believe VenusBench-Mobile provides an important stepping stone toward robust real-world deployment of mobile GUI agents. Code and data are available at https://github.com/inclusionAI/UI-Venus/tree/VenusBench-Mobile.

cs.HC cs.AI