AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications

TL;DR

提出AndroidDaily基准和GRADE评估框架,有效验证闭源移动应用中的GUI代理能力。

cs.CV 🔴 高级 2026-05-27 41 次浏览
Yifan Sui Xin Huang Hongbing Li Fang Xu Jiahe Lv Haolong Yan Yeqing Shen Litao Liu Zhimin Fan Ziyang Meng Jia Wang Junbo Qi Kaijun Tan Zheng Ge Xiangyu Zhang Daxin Jiang Osamu Yoshie
移动AI GUI代理 闭源应用 自动评估 基准测试

核心发现

方法论

AndroidDaily基准由350个真实场景任务组成,涵盖94个高频闭源应用,任务设计基于用户日常行为。提出三层外部指南(操作义务、输出质量、负面约束)定义任务完成标准。GRADE利用视觉-语言模型(VLM)追踪代理轨迹,匹配指南,生成逐步诊断。通过大规模实验验证其87.37%的与人类评判一致性,揭示当前模型在多约束和跨应用任务中的性能不足。

关键结果

  • 最强模型在AndroidDaily上的成功率为62.0%,远低于理想水平,显示出实际应用中推理与执行的巨大差距。
  • GRADE评估的准确率达87.37%,验证其在闭源环境中的可靠性。
  • 分析发现模型主要受限于推理延迟、记忆管理不足和协议能力退化,提出未来优化方向。

研究意义

该研究突破了闭源应用中自动化评估的瓶颈,提供了面向实际场景的系统性解决方案。AndroidDaily的构建和GRADE的引入,推动了移动GUI代理的实用化,为未来智能助手在复杂环境中的部署奠定基础。研究强调了多任务、多约束、多应用协同的挑战,促进了智能系统的长远发展。

技术贡献

创新在于提出基于外部指南的逐步诊断机制,结合视觉-语言模型实现无内部状态访问的自动评估。设计了多层外部规范体系,提升了评估的可解释性和可靠性。引入大规模真实任务场景,丰富了GUI代理的应用场景,推动了多模态模型在动态交互中的应用研究。

新颖性

首次在闭源商业应用中实现基于外部指南的逐步诊断评估,突破了传统依赖内部状态的限制。结合视觉轨迹追踪与外部规则,提供了可验证的长时序任务评估框架,显著优于现有仅依赖代码断言或二元判定的方案。

局限性

  • 模型在多任务、多约束场景下表现仍有限,推理延迟和记忆管理不足导致误差累积。
  • 评估主要基于视觉信息,可能受界面变化和视觉噪声影响,存在鲁棒性挑战。
  • 当前实验未覆盖所有应用类别,未来需扩展多样化场景和用户意图。

未来方向

未来将结合强化学习优化推理速度,增强模型的跨应用协作能力。探索多模态信息融合,提升对复杂场景的理解。计划引入用户反馈机制,动态调整评估标准,推动智能助手的实际应用落地。

AI 总览摘要

随着移动设备普及,智能GUI代理在自动化日常任务中展现巨大潜力。然而,现有评估方法多依赖模拟环境或开源应用,难以反映真实商业场景中的复杂性。闭源应用的内部状态不可访问,传统自动验证难以实现,成为制约技术落地的关键瓶颈。为此,本文提出AndroidDaily基准,涵盖94个高频闭源应用中的350个实际任务,模拟用户日常行为场景,具有高度代表性。

在评估体系方面,作者设计了基于外部指南的逐步诊断框架GRADE。该框架通过定义操作义务、输出质量和负面约束三层外部规范,结合视觉-语言模型追踪代理轨迹,实现无需访问内部状态的自动验证。实验结果显示,GRADE在与人类评判的一致性达87.37%的同时,揭示了当前模型在多约束、多任务环境中的性能不足,成功率仅为62%。分析指出,推理延迟、记忆管理不足和协议退化是主要瓶颈。

该研究不仅提供了面向复杂实际场景的评估工具,也为未来智能助手的研发指明了方向。通过引入多模态、长时序的评估机制,推动了移动AI在商业应用中的落地。未来工作将集中在提升模型推理速度、增强跨应用协作能力,以及引入用户反馈机制,持续优化系统性能。整体而言,AndroidDaily与GRADE的结合,为移动GUI代理的实用化提供了坚实基础,开启了行业新篇章。

深度分析

研究背景

移动GUI代理技术近年来快速发展,代表性工作包括CogAgent、UI-TARS和Ferret-UI等。这些方法在静态感知、界面理解和自动操作方面取得一定突破,但在真实商业应用中仍面临巨大挑战。主要问题在于缺乏有效的动态评估体系,尤其是在闭源环境中,无法访问应用内部状态,限制了模型的验证和优化。现有评估多依赖模拟环境或代码断言,难以反映实际使用场景的复杂性。随着应用场景逐渐多样化,需求也从单一任务转向多任务、多约束、多应用的协同操作,推动了对更真实、全面评估体系的需求。

核心问题

核心问题在于如何在无法访问应用内部状态的情况下,客观、自动地评估移动GUI代理的性能。传统方法依赖代码断言或系统变量,难以适应商业闭源应用的限制。同时,实际任务具有多目标、多约束、多路径的特性,单一指标难以全面反映代理能力。长时序、多任务环境中的误差累积和状态偏差,进一步加剧了评估难度。解决这一问题对于推动移动智能助手的实用化具有重要意义,但目前尚无成熟方案。

核心创新

创新点包括:1)提出基于外部指南的多层次任务定义体系,将任务转化为可观察的操作义务、输出质量和负面约束,避免依赖内部状态;2)设计视觉-语言模型(VLM)作为评估器,结合轨迹追踪实现无状态验证;3)构建大规模真实场景任务集,模拟用户多样化行为,提升评估的实用性。这些创新突破了传统依赖代码断言的限制,为闭源应用中的自动评估提供了新思路。

方法详解

  • �� 任务构建:基于用户行为数据筛选94个高频应用,设计350个多场景任务,涵盖信息检索、内容生成和操作执行。
  • �� 指南定义:每个任务配备三层外部指南,包括操作义务(如完成特定操作)、输出质量(如内容准确性)和负面约束(如避免违规行为)。
  • �� 评估流程:利用视觉-语言模型(如CLIP、GPT-4)追踪代理轨迹,重放动作,提取关键视觉信息。
  • �� 轨迹分析:匹配指南,检测任务完成情况,生成逐步诊断报告。
  • �� 实验验证:在多个模型上测试,包括Auto-UI、Ferret-UI,比较与人类评判的一致性,分析失败原因。

实验设计

采用94个应用中350个任务作为评估集,使用不同规模的GUI代理模型(如Auto-UI、Ferret-UI)进行测试。指标包括成功率、与人类评判的一致性(87.37%),以及在多约束任务中的性能表现。通过消融实验验证指南体系的有效性,分析推理延迟、记忆管理和协议退化对性能的影响。设置不同的任务难度和约束密度,确保评估的全面性和代表性。

结果分析

结果显示,最强模型在AndroidDaily上的成功率为62.0%,远低于理想水平,反映出实际应用中的复杂性。GRADE的评估准确率达87.37%,验证其可靠性。分析发现,模型在多任务、多约束场景中表现不佳,主要受限于推理延迟(平均延迟超过1秒)、记忆管理不足导致的循环行为,以及协议能力退化。这些发现为未来模型优化提供了明确方向。

应用场景

该评估框架适用于开发更强大的移动GUI代理,推动智能助手在实际商业场景中的应用。可用于企业测试、模型调优和用户体验优化,特别是在多任务、多应用协同的复杂环境中。未来还可结合用户反馈,动态调整任务指南,提升系统的适应性和鲁棒性。

局限与展望

当前模型在多任务、多约束环境中仍表现有限,推理延迟和记忆不足导致误差累积。视觉信息的依赖使得界面变化和视觉噪声成为鲁棒性挑战。此外,实验范围主要集中在部分应用类别,未来需扩展到更多场景和多模态信息融合,以提升整体性能。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有许多不同的机器,每个机器都有自己的操作规程。有时候,你需要让不同的机器合作完成一项复杂的任务,比如制造一台新机器。你不知道每台机器的内部运作细节,只能通过观察它们的外部表现,比如声音、动作和显示屏上的信息。为了确保任务顺利完成,你制定了一套外部规则,比如必须先装配好零件,再进行测试,不能跳过步骤,也不能用错误的零件。这些规则帮助你判断每一步是否正确完成,而不用知道机器内部的详细流程。AndroidDaily和GRADE就像这样一套外部规则和观察系统,帮助我们评估手机上的智能助手在没有内部信息的情况下,是否完成了用户的任务。它们通过观察界面变化、操作轨迹,确保每一步都符合预设的规则,像工厂的检验员一样,确保每个环节都达标。这种方法让我们可以在真实、复杂的环境中,科学、客观地评估智能助手的表现,而不用依赖那些难以获取的内部数据。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个比赛,但你不能直接看老师的评分细节,只能通过观察老师的动作和你自己的表现来判断自己是不是做得好。比如,老师让你做一道数学题,你不知道老师心里在想什么,但你可以看他是否点头、是否写了评分纸、是否给了你提示。你要根据这些外部的线索,判断自己是不是完成得好。这就像AndroidDaily和GRADE一样,它们没有直接看到手机里的秘密数据,只能通过屏幕上的画面和操作轨迹,判断智能助手是否完成了任务。它们制定了一些规则,比如“必须点击这个按钮”、“不能跳过步骤”、“输出的内容要正确”。然后,系统会观察助手的每一步操作,看看是不是符合这些规则。这样,即使没有内部信息,也能公平、客观地评估助手的表现。就像老师用外部线索打分一样,这个方法让我们可以在真实的手机环境中,检测智能助手是不是帮我们完成了想做的事情。

原文摘要

The rapid development of GUI foundation models and mobile GUI agents has spurred numerous evaluation benchmarks, yet most rely on simulated environments or open-source applications, leaving real-world closed-source applications largely unevaluated. The core difficulty is that closed-source applications do not expose internal states, making traditional automatic verification inapplicable. To bridge this gap, we introduce AndroidDaily, a large-scale benchmark comprising 350 realistic daily-use tasks across 94 high-frequency Android applications spanning transportation, shopping, local services, entertainment, content creation, social media, and everyday utilities. To enable automatic and verifiable assessment in these opaque environments, we propose Guideline-grounded Reviewer for Automatic Diagnostic Evaluation (GRADE), a process-aware evaluator built on a three-tiered system of observable external guidelines: operational obligations, output quality, and negative constraints. GRADE tracks the agent's visual trajectory against these criteria and produces step-level diagnostic judgments, turning long-horizon, open-ended mobile interactions into verifiable evaluation without relying on hidden internal states. Experiments show that GRADE achieves 87.37\% agreement with human evaluators. The strongest model reaches a 62.0\% success rate on AndroidDaily, highlighting a substantial gap between current reasoning capabilities and practical execution in realistic mobile workflows.

cs.CV cs.SE