AndroidDaily: A Verifiable Benchmark for Mobile GUI Agents on Real-World Closed-Source Applications
提出AndroidDaily基准和GRADE评估框架,有效验证闭源移动应用中的GUI代理能力。
核心发现
方法论
AndroidDaily基准由350个真实场景任务组成,涵盖94个高频闭源应用,任务设计基于用户日常行为。提出三层外部指南(操作义务、输出质量、负面约束)定义任务完成标准。GRADE利用视觉-语言模型(VLM)追踪代理轨迹,匹配指南,生成逐步诊断。通过大规模实验验证其87.37%的与人类评判一致性,揭示当前模型在多约束和跨应用任务中的性能不足。
关键结果
- 最强模型在AndroidDaily上的成功率为62.0%,远低于理想水平,显示出实际应用中推理与执行的巨大差距。
- GRADE评估的准确率达87.37%,验证其在闭源环境中的可靠性。
- 分析发现模型主要受限于推理延迟、记忆管理不足和协议能力退化,提出未来优化方向。
研究意义
该研究突破了闭源应用中自动化评估的瓶颈,提供了面向实际场景的系统性解决方案。AndroidDaily的构建和GRADE的引入,推动了移动GUI代理的实用化,为未来智能助手在复杂环境中的部署奠定基础。研究强调了多任务、多约束、多应用协同的挑战,促进了智能系统的长远发展。
技术贡献
创新在于提出基于外部指南的逐步诊断机制,结合视觉-语言模型实现无内部状态访问的自动评估。设计了多层外部规范体系,提升了评估的可解释性和可靠性。引入大规模真实任务场景,丰富了GUI代理的应用场景,推动了多模态模型在动态交互中的应用研究。
新颖性
首次在闭源商业应用中实现基于外部指南的逐步诊断评估,突破了传统依赖内部状态的限制。结合视觉轨迹追踪与外部规则,提供了可验证的长时序任务评估框架,显著优于现有仅依赖代码断言或二元判定的方案。
局限性
- 模型在多任务、多约束场景下表现仍有限,推理延迟和记忆管理不足导致误差累积。
- 评估主要基于视觉信息,可能受界面变化和视觉噪声影响,存在鲁棒性挑战。
- 当前实验未覆盖所有应用类别,未来需扩展多样化场景和用户意图。
未来方向
未来将结合强化学习优化推理速度,增强模型的跨应用协作能力。探索多模态信息融合,提升对复杂场景的理解。计划引入用户反馈机制,动态调整评估标准,推动智能助手的实际应用落地。
AI 总览摘要
随着移动设备普及,智能GUI代理在自动化日常任务中展现巨大潜力。然而,现有评估方法多依赖模拟环境或开源应用,难以反映真实商业场景中的复杂性。闭源应用的内部状态不可访问,传统自动验证难以实现,成为制约技术落地的关键瓶颈。为此,本文提出AndroidDaily基准,涵盖94个高频闭源应用中的350个实际任务,模拟用户日常行为场景,具有高度代表性。
在评估体系方面,作者设计了基于外部指南的逐步诊断框架GRADE。该框架通过定义操作义务、输出质量和负面约束三层外部规范,结合视觉-语言模型追踪代理轨迹,实现无需访问内部状态的自动验证。实验结果显示,GRADE在与人类评判的一致性达87.37%的同时,揭示了当前模型在多约束、多任务环境中的性能不足,成功率仅为62%。分析指出,推理延迟、记忆管理不足和协议退化是主要瓶颈。
该研究不仅提供了面向复杂实际场景的评估工具,也为未来智能助手的研发指明了方向。通过引入多模态、长时序的评估机制,推动了移动AI在商业应用中的落地。未来工作将集中在提升模型推理速度、增强跨应用协作能力,以及引入用户反馈机制,持续优化系统性能。整体而言,AndroidDaily与GRADE的结合,为移动GUI代理的实用化提供了坚实基础,开启了行业新篇章。
深度分析
研究背景
移动GUI代理技术近年来快速发展,代表性工作包括CogAgent、UI-TARS和Ferret-UI等。这些方法在静态感知、界面理解和自动操作方面取得一定突破,但在真实商业应用中仍面临巨大挑战。主要问题在于缺乏有效的动态评估体系,尤其是在闭源环境中,无法访问应用内部状态,限制了模型的验证和优化。现有评估多依赖模拟环境或代码断言,难以反映实际使用场景的复杂性。随着应用场景逐渐多样化,需求也从单一任务转向多任务、多约束、多应用的协同操作,推动了对更真实、全面评估体系的需求。
核心问题
核心问题在于如何在无法访问应用内部状态的情况下,客观、自动地评估移动GUI代理的性能。传统方法依赖代码断言或系统变量,难以适应商业闭源应用的限制。同时,实际任务具有多目标、多约束、多路径的特性,单一指标难以全面反映代理能力。长时序、多任务环境中的误差累积和状态偏差,进一步加剧了评估难度。解决这一问题对于推动移动智能助手的实用化具有重要意义,但目前尚无成熟方案。
核心创新
创新点包括:1)提出基于外部指南的多层次任务定义体系,将任务转化为可观察的操作义务、输出质量和负面约束,避免依赖内部状态;2)设计视觉-语言模型(VLM)作为评估器,结合轨迹追踪实现无状态验证;3)构建大规模真实场景任务集,模拟用户多样化行为,提升评估的实用性。这些创新突破了传统依赖代码断言的限制,为闭源应用中的自动评估提供了新思路。
方法详解
- �� 任务构建:基于用户行为数据筛选94个高频应用,设计350个多场景任务,涵盖信息检索、内容生成和操作执行。
- �� 指南定义:每个任务配备三层外部指南,包括操作义务(如完成特定操作)、输出质量(如内容准确性)和负面约束(如避免违规行为)。
- �� 评估流程:利用视觉-语言模型(如CLIP、GPT-4)追踪代理轨迹,重放动作,提取关键视觉信息。
- �� 轨迹分析:匹配指南,检测任务完成情况,生成逐步诊断报告。
- �� 实验验证:在多个模型上测试,包括Auto-UI、Ferret-UI,比较与人类评判的一致性,分析失败原因。
实验设计
采用94个应用中350个任务作为评估集,使用不同规模的GUI代理模型(如Auto-UI、Ferret-UI)进行测试。指标包括成功率、与人类评判的一致性(87.37%),以及在多约束任务中的性能表现。通过消融实验验证指南体系的有效性,分析推理延迟、记忆管理和协议退化对性能的影响。设置不同的任务难度和约束密度,确保评估的全面性和代表性。
结果分析
结果显示,最强模型在AndroidDaily上的成功率为62.0%,远低于理想水平,反映出实际应用中的复杂性。GRADE的评估准确率达87.37%,验证其可靠性。分析发现,模型在多任务、多约束场景中表现不佳,主要受限于推理延迟(平均延迟超过1秒)、记忆管理不足导致的循环行为,以及协议能力退化。这些发现为未来模型优化提供了明确方向。
应用场景
该评估框架适用于开发更强大的移动GUI代理,推动智能助手在实际商业场景中的应用。可用于企业测试、模型调优和用户体验优化,特别是在多任务、多应用协同的复杂环境中。未来还可结合用户反馈,动态调整任务指南,提升系统的适应性和鲁棒性。
局限与展望
当前模型在多任务、多约束环境中仍表现有限,推理延迟和记忆不足导致误差累积。视觉信息的依赖使得界面变化和视觉噪声成为鲁棒性挑战。此外,实验范围主要集中在部分应用类别,未来需扩展到更多场景和多模态信息融合,以提升整体性能。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,工厂里有许多不同的机器,每个机器都有自己的操作规程。有时候,你需要让不同的机器合作完成一项复杂的任务,比如制造一台新机器。你不知道每台机器的内部运作细节,只能通过观察它们的外部表现,比如声音、动作和显示屏上的信息。为了确保任务顺利完成,你制定了一套外部规则,比如必须先装配好零件,再进行测试,不能跳过步骤,也不能用错误的零件。这些规则帮助你判断每一步是否正确完成,而不用知道机器内部的详细流程。AndroidDaily和GRADE就像这样一套外部规则和观察系统,帮助我们评估手机上的智能助手在没有内部信息的情况下,是否完成了用户的任务。它们通过观察界面变化、操作轨迹,确保每一步都符合预设的规则,像工厂的检验员一样,确保每个环节都达标。这种方法让我们可以在真实、复杂的环境中,科学、客观地评估智能助手的表现,而不用依赖那些难以获取的内部数据。
简单解释 像给14岁少年讲一样
想象你在学校里参加一个比赛,但你不能直接看老师的评分细节,只能通过观察老师的动作和你自己的表现来判断自己是不是做得好。比如,老师让你做一道数学题,你不知道老师心里在想什么,但你可以看他是否点头、是否写了评分纸、是否给了你提示。你要根据这些外部的线索,判断自己是不是完成得好。这就像AndroidDaily和GRADE一样,它们没有直接看到手机里的秘密数据,只能通过屏幕上的画面和操作轨迹,判断智能助手是否完成了任务。它们制定了一些规则,比如“必须点击这个按钮”、“不能跳过步骤”、“输出的内容要正确”。然后,系统会观察助手的每一步操作,看看是不是符合这些规则。这样,即使没有内部信息,也能公平、客观地评估助手的表现。就像老师用外部线索打分一样,这个方法让我们可以在真实的手机环境中,检测智能助手是不是帮我们完成了想做的事情。
原文摘要
The rapid development of GUI foundation models and mobile GUI agents has spurred numerous evaluation benchmarks, yet most rely on simulated environments or open-source applications, leaving real-world closed-source applications largely unevaluated. The core difficulty is that closed-source applications do not expose internal states, making traditional automatic verification inapplicable. To bridge this gap, we introduce AndroidDaily, a large-scale benchmark comprising 350 realistic daily-use tasks across 94 high-frequency Android applications spanning transportation, shopping, local services, entertainment, content creation, social media, and everyday utilities. To enable automatic and verifiable assessment in these opaque environments, we propose Guideline-grounded Reviewer for Automatic Diagnostic Evaluation (GRADE), a process-aware evaluator built on a three-tiered system of observable external guidelines: operational obligations, output quality, and negative constraints. GRADE tracks the agent's visual trajectory against these criteria and produces step-level diagnostic judgments, turning long-horizon, open-ended mobile interactions into verifiable evaluation without relying on hidden internal states. Experiments show that GRADE achieves 87.37\% agreement with human evaluators. The strongest model reaches a 62.0\% success rate on AndroidDaily, highlighting a substantial gap between current reasoning capabilities and practical execution in realistic mobile workflows.