核心发现
方法论
UI-KOBE通过自主探索构建应用知识图,节点代表UI状态,边代表可执行的转换。运行时,轻量级GUI代理利用图作为外部指导,识别当前节点并选择合适的动作。这种方法降低了轻量模型的推理负担,提高了任务执行的可靠性。
关键结果
- 在AndroidWorld上,使用Qwen3.5-4B模型,UI-KOBE的成功率达到70.7%,显著高于未使用图指导的58.6%。
- 在A3基准上,UI-KOBE使用Qwen3.5-Plus模型,ESAR达到84.8,Overall SR达到78,表现优于大多数单模型代理。
- 通过图指导,轻量模型在动态UI状态下的任务执行能力显著提升。
研究意义
UI-KOBE通过将应用知识图与轻量级模型结合,显著提升了移动GUI任务的执行效率和可靠性。这一方法不仅降低了计算成本,还在隐私保护方面提供了更好的解决方案,适用于需要本地化处理的应用场景。
技术贡献
UI-KOBE将应用知识图与轻量级GUI代理结合,提供了一种新的任务执行框架。与现有方法相比,它通过减少推理负担和增强决策指导,提高了轻量模型的任务执行能力。
新颖性
UI-KOBE首次将应用知识图用于轻量级GUI代理的任务指导,突破了传统端到端推理的限制,提供了一种新的任务执行范式。
局限性
- 在图指导不可用的情况下,系统需要回退到简单的规划器,可能导致性能下降。
- 图构建过程需要一定的时间和成本,尽管可以在多次任务执行中摊销。
未来方向
未来工作可以探索如何自动化图构建过程,进一步提高图的覆盖率和准确性,并研究如何在更多应用场景中推广这一方法。
AI 总览摘要
近年来,移动GUI代理在自动化任务执行方面展现出巨大潜力,但大多数系统依赖于大型视觉语言模型,限制了其在设备上的直接部署。UI-KOBE通过构建应用特定的知识图,指导轻量级GUI代理执行任务,克服了这一局限。
UI-KOBE首先自主探索应用,构建包含UI状态和可执行转换的知识图。运行时,轻量级代理利用该图识别当前状态并选择合适的动作,降低了推理负担,提高了任务执行的可靠性。
实验结果表明,UI-KOBE在多个基准上显著提升了任务成功率,尤其是在动态UI状态下表现突出。这一方法不仅降低了计算成本,还在隐私保护方面提供了更好的解决方案,为移动应用的自动化任务执行提供了新的思路。
深度分析
研究背景
随着移动设备的普及,自动化GUI任务执行成为一个重要的研究领域。传统方法依赖于大型视觉语言模型,尽管有效,但其高计算成本和隐私问题限制了在设备上的直接部署。轻量级模型虽然计算成本低,但在长远推理和规划方面表现不佳,难以胜任复杂任务。
核心问题
轻量级GUI代理在从截图中端到端规划和执行任务时表现不可靠,尤其是在动态UI状态下。这一问题的核心在于轻量模型的有限容量,难以处理复杂的任务推理和规划。
核心创新
UI-KOBE通过构建应用特定的知识图,指导轻量级GUI代理执行任务。其创新之处在于将知识获取与任务执行分离,通过图指导减少推理负担,提高任务执行的可靠性。
方法详解
- �� 自主探索应用,构建知识图,节点代表UI状态,边代表转换。
- �� 运行时利用图指导,识别当前节点,选择动作。
- �� 提供回退机制,确保在图指导不可用时的鲁棒性。
实验设计
在AndroidWorld和A3基准上进行实验,使用Qwen3.5-4B、Qwen3.5-9B和Qwen3.5-Plus模型。评估指标包括任务成功率、ESAR和Overall SR,结果显示UI-KOBE显著提升了任务执行性能。
结果分析
在AndroidWorld上,UI-KOBE使用Qwen3.5-4B模型的成功率达到70.7%,显著高于未使用图指导的58.6%。在A3基准上,使用Qwen3.5-Plus模型,ESAR达到84.8,Overall SR达到78。
应用场景
UI-KOBE适用于需要本地化处理的移动应用任务,尤其是在隐私保护和计算成本敏感的场景中。其图指导方法可以在多次任务执行中重复使用,提高效率。
局限与展望
尽管UI-KOBE显著提升了任务执行性能,但在图指导不可用的情况下,系统需要回退到简单的规划器,可能导致性能下降。此外,图构建过程需要一定的时间和成本。
通俗解读 非专业人士也能看懂
想象一个工厂,工人们需要根据不同的任务来组装产品。传统方法就像让工人们每次都从头开始思考如何组装,而UI-KOBE则像是给工人们提供了一张详细的流程图,告诉他们每一步该怎么做。这样一来,工人们就能更快更好地完成任务,因为他们不需要每次都重新思考整个过程。对于轻量级模型来说,这种方法大大减轻了它们的工作负担,让它们能更专注于具体的操作,而不是整个任务的规划。
简单解释 像给14岁少年讲一样
想象你在玩一个手机游戏,每次过关都要点击很多按钮。传统的方法就像你每次都要自己摸索怎么过关,而UI-KOBE就像是一个攻略,告诉你每一步该怎么做。这样你就能更快地过关,不用每次都从头开始想。这个方法特别适合那些手机内存小的设备,因为它不需要太多计算能力,也能保护你的隐私哦!
术语表
GUI代理
图形用户界面代理是一种软件,能够自动化执行用户界面上的任务。
在本文中,GUI代理用于自动化移动应用任务。
知识图谱
一种结构化的数据表示方式,节点代表实体,边代表实体间的关系。
UI-KOBE使用知识图谱来表示应用的UI状态和转换。
轻量模型
计算资源需求较低的机器学习模型,适合在资源受限的设备上运行。
UI-KOBE旨在提升轻量模型的任务执行能力。
端到端推理
从输入到输出的直接推理过程,不依赖中间步骤或外部指导。
传统GUI代理依赖端到端推理来执行任务。
ESAR
Essential-State Achievement Rate,衡量任务执行过程中关键状态的达成率。
在A3基准中用于评估任务执行进度。
开放问题 这项研究留下的未解疑问
- 1 如何自动化图构建过程以提高效率和准确性仍需进一步研究。
- 2 在更多应用场景中推广UI-KOBE的方法需要解决的技术挑战。
应用场景
近期应用
移动应用自动化
UI-KOBE可用于自动化执行移动应用中的常见任务,如设置调整和信息查询。
远期愿景
隐私保护的智能助手
通过本地化处理和图指导,UI-KOBE有望成为隐私保护的智能助手,广泛应用于个人设备。
原文摘要
Recent advances in mobile GUI agents have shown strong potential for automating mobile tasks, but most effective systems still depend on large vision-language models for screenshot understanding and long-horizon planning. Small GUI agents that can be deployed directly on mobile devices are more attractive for practical use, offering lower inference cost and better protection of sensitive on-device information. However, due to limited model capacity, such lightweight agents remain unreliable when planning and executing GUI tasks end-to-end from screenshots alone. We propose Knowledge-Oriented Behavior Exploration (\textbf{UI-KOBE}), a framework that improves lightweight mobile GUI agents with reusable app-specific graph knowledge. UI-KOBE first autonomously explores a mobile application and constructs an app knowledge graph, where nodes represent distinct UI states and edges represent executable transitions. At runtime, a lightweight GUI agent uses the graph as external guidance: given a user task and the current screenshot, it identifies the current graph node and selects among self-loop actions, neighboring transitions, task completion, or fallback free actions associated with that node. By supporting runtime decisions with app-specific graph guidance, UI-KOBE reduces the burden of end-to-end GUI planning and helps lightweight models perform mobile GUI tasks more effectively, offering a practical step toward efficient, interpretable, and privacy-conscious on-device GUI agents.