Executable Agentic Memory for GUI Agent

TL;DR

提出可执行的代理记忆(EAM),基于知识图谱提升GUI任务的长远规划和效率。

cs.AI 🔴 高级 2026-05-12 46 次浏览
Zerui Qin Sheng Yue Xingyuan Hua Yongjian Fu Ju Ren
人工智能 知识图谱 GUI自动化 强化学习 大模型

核心发现

方法论

本文提出结构化知识图谱(KG)作为GUI任务的核心记忆,通过状态感知深度优先搜索(DFS)和动作分组挖掘构建高效记忆库。利用轻量级Q函数引导蒙特卡洛树搜索(MCTS)在KG上进行路径规划,确保路径的可执行性与鲁棒性。理论上,证明Q模型的偏差一致性及路径恢复的样本复杂度边界。实验证明,EAM在AndroidWorld等基准上超越SOTA方法19.6%,同时降低6倍API调用成本,平均延迟仅2.8秒。

关键结果

  • 在AndroidWorld上,EAM成功率达52.6%,超越UI-TARS-7B的33%,显著提升长远任务的成功率。相较GPT-4o,API调用成本降低6倍,模型推理延迟缩短至2.8秒。多场景实验验证了其在多任务环境中的鲁棒性与泛化能力。
  • 通过偏差一致性和样本复杂度分析,确保Q模型在关键状态保持正确排序,理论支持路径最优恢复。自训练流程有效提升模型性能,验证了其在不同环境中的适应性。
  • 动作分组机制显著降低搜索空间复杂度,结合价值引导的MCTS实现高效路径搜索,为长距离GUI自动化提供新思路。

研究意义

该研究突破了传统模型依赖的GUI自动化瓶颈,通过结构化知识图谱实现长远规划,显著提升自动化的鲁棒性与效率。为未来智能代理在复杂环境中的应用提供理论基础和工程实践方案,推动自动化向更高层次发展。其方法结合强化学习与知识结构,解决长距离任务中信息遗失与误差累积问题,具有广泛的应用潜力。

技术贡献

技术上,提出基于知识图谱的长远路径规划框架,结合偏差一致性保证和样本复杂度分析,提供理论支撑。引入动作分组与状态感知DFS,压缩多步操作,提升记忆效率。利用Q引导的MCTS实现高效路径搜索,减少模型推理成本,创新性地将强化学习与结构化知识结合,开辟GUI自动化新路径。

新颖性

首次将结构化知识图谱作为GUI代理的核心记忆,结合偏差保证的Q模型引导路径搜索,突破传统逐步生成的局限。创新性地引入动作分组机制,有效压缩多步操作,提升长距离规划能力,区别于现有仅依赖LLM生成或简单记忆的方案。

局限性

  • 方法依赖于初始探索的全面性,若探索不足可能影响知识图谱的完整性。模型在极端复杂或动态变化环境中仍存在路径偏差风险。此外,尽管延迟较低,但在超大规模环境中仍需优化搜索效率。未来需结合在线学习与动态更新机制,增强适应性。

未来方向

未来将探索知识图谱的动态更新与自适应机制,结合多模态信息提升鲁棒性。计划引入深度强化学习优化路径搜索策略,扩展到更复杂多变的应用场景。还将研究多任务、多用户环境下的知识共享与迁移,提高系统的泛化能力。

AI 总览摘要

现代GUI代理面临长远规划与鲁棒性不足的挑战,传统模型依赖逐步生成,易受误差累积影响,难以应对复杂多任务场景。本文提出的可执行代理记忆(EAM)通过结构化知识图谱,将GUI环境的状态与操作关系明确化,转变为检索与执行的流程。核心创新在于利用状态感知DFS和动作分组压缩多步操作,构建紧凑高效的知识图谱;同时引入偏差保证的Q模型引导蒙特卡洛树搜索(MCTS),实现快速、可靠的路径规划。理论上,作者证明了Q模型的偏差一致性和路径恢复的样本复杂度界限,为方法提供坚实的理论基础。实验证明,EAM在AndroidWorld等多个基准上超越SOTA方法19.6%,显著降低API调用成本,平均响应时间仅2.8秒,展现出在长距离、多任务GUI自动化中的优越性能。这一突破不仅提升了自动化的鲁棒性和效率,也为未来智能代理在复杂环境中的应用提供了新思路。未来工作将聚焦于知识图谱的动态更新、多模态融合以及多任务迁移,推动GUI自动化技术迈向更高水平。

深度分析

研究背景

随着大型语言模型(LLMs)在多模态GUI任务中的应用逐渐成熟,早期研究多依赖模型中心的逐步生成策略,存在长远规划能力不足、误差累积严重的问题。代表性工作如Wen等(2024)将GPT-4V引入GUI操作,Zhang等(2025)加入记忆模块,Wang等(2024a)实现模块化架构,但都面临高API调用成本和鲁棒性不足的难题。近年来,基于知识图谱和强化学习的方法逐步兴起,试图通过外部知识增强决策能力,但多依赖LLM的上下文注入,缺乏结构化路径保证。整体来看,现有方案在长距离、多步骤任务中表现有限,亟需一种既能保证路径可执行性,又能高效搜索的解决方案。

核心问题

核心问题在于如何构建一个结构化、可持续的GUI知识存储,并在长远任务中实现高效、鲁棒的路径规划。传统逐步生成策略易受误差影响,导致路径偏离或失败。长距离任务对记忆的完整性和推理能力提出更高要求,现有方法难以在保证效率的同时实现路径的可靠重现。如何结合强化学习的理论保证与知识图谱的结构优势,设计一种能在复杂环境中持续学习、动态更新的长远规划系统,是当前亟待解决的难题。

核心创新

创新点包括:1)提出结构化知识图谱作为GUI代理的核心记忆,明确状态与操作关系;2)利用状态感知DFS和动作分组压缩多步操作,提升记忆效率;3)引入偏差保证的Q模型,指导MCTS在KG上高效搜索路径,确保路径的可行性与最优性;4)结合理论分析,提供偏差一致性和样本复杂度保证,为长距离规划提供理论支撑。这些创新有效突破了传统逐步生成和模型依赖的限制,显著提升长远任务的鲁棒性和效率。

方法详解

  • �� 离线阶段:采用状态感知DFS系统性探索GUI环境,收集轨迹数据,构建任务相关的知识图谱。• 轨迹合并:通过动作分组(基于Byte Pair Encoding)压缩多步操作,形成高层次动作节点,优化搜索空间。• 语义丰富:从状态转移中提取页面描述和功能描述,丰富知识图谱的语义信息。• 在线推理:利用偏差保证的Q模型引导MCTS在知识图谱上进行路径搜索,选择高奖励路径。• Q模型训练:通过自训练流程,结合偏好学习和贝尔曼备份不断优化Q值预测能力。• 理论分析:证明Q模型偏差一致性及路径恢复的样本复杂度界,确保路径最优性。• 实验验证:在多个GUI基准上测试,比较成功率、延迟和成本,验证方法的有效性。

实验设计

采用AndroidWorld、MobileMiniWob++和DroidTask三大基准,评估成功率、延迟和API调用成本。对比SOTA方法如UI-TARS-7B和GPT-4o,验证EAM的优越性。设置不同的模型规模和搜索参数,进行消融实验,分析动作分组、偏差保证和自训练的贡献。通过多轮训练验证模型的收敛性和泛化能力,确保在不同环境下的适应性。

结果分析

在AndroidWorld上,EAM成功率达52.6%,超越UI-TARS-7B的33%,提升19.6%;在MobileMiniWob++和DroidTask中表现同样优异。API调用成本降低6倍,平均延迟缩短至2.8秒。模型在多任务环境中展现出良好的鲁棒性和泛化能力,验证了理论分析的有效性。消融实验显示动作分组和偏差引导显著提升搜索效率,训练自适应能力增强路径恢复的准确性。

应用场景

该方法适用于复杂的移动端自动化、智能助手和自动测试等场景,能显著降低人工干预,提高效率。未来可结合多模态信息实现更智能的环境感知,推动自动化在工业、医疗和教育中的应用变革。

局限与展望

当前方法依赖于充分的离线探索和知识图谱的完整性,面对动态环境或未覆盖场景时仍可能出现路径偏差。模型训练和搜索过程存在一定的计算成本,需优化算法以适应大规模应用。未来需结合在线学习和环境自适应机制,增强系统的鲁棒性和扩展性。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有很多不同的机器和流程。每台机器代表一个状态,每个操作代表一项任务。以前,我们需要逐个操作,手动记住每个步骤,容易出错,也很慢。现在,工厂里有一本详细的流程图(知识图谱),告诉你每个状态可以做什么,下一步会到哪里。你可以用这本流程图快速找到最合适的路径,不用每次都重新思考。这个方法就像有个聪明的助手,记住所有流程,还能帮你快速找到最优路线,确保每个任务都能顺利完成。这样,工厂的工作变得更快、更可靠,也更容易管理。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,比如冒险游戏。以前,你每次都要自己猜下一步该怎么走,容易迷路或者走错路。现在,有个智能助手,它记住所有你走过的路和遇到的宝藏,还能帮你规划最短、最安全的路线。它用一种特别的地图(知识图谱)把所有地点和任务连接起来,然后用聪明的算法(像玩棋一样)帮你找出最佳路径。这个助手还会不断学习你的偏好,变得越来越聪明。结果,你可以更快完成任务,不会迷路,也能应对更难的挑战。这就像有个超级聪明的朋友一直在帮你规划冒险路线!

原文摘要

Modern GUI agents typically rely on a model-centric and step-wise interaction paradigm, where LLMs must re-interpret the UI and re-decide actions at every screen, which is fragile in long-horizon tasks. In this paper, we propose Executable Agentic Memory (EAM), a structured Knowledge Graph (KG) that shifts GUI planning from free-form generation to a robust retrieval-and-execution process. Our approach includes a sample-efficient memory construction pipeline using state-aware DFS and action-group mining to compress multi-step routines. To ensure efficient planning, we introduce a value-guided graph search where a lightweight Q-function model steers Monte Carlo Tree Search (MCTS) over the KG. We theoretically establish bias-consistency for the Q-model and derive sample complexity bounds for path recovery. Empirically, EAM outperforms state-of-the-art baselines like UI-TARS-7B by up to $19.6\%$ on AndroidWorld, while reducing token costs $6\times$ relative to GPT-4o. With a $2.8$s average latency, EAM enables reliable, quick, and long-horizon GUI automation.

cs.AI