SE-GA: Memory-Augmented Self-Evolution for GUI Agents

TL;DR

SE-GA结合层次记忆与自我演化机制,提升GUI代理多步任务成功率至89.0%。

cs.LG 🔴 高级 2026-05-16 44 次浏览
Shilong Jin Lanjun Wang Zhuosheng Zhang
人工智能 强化学习 记忆机制 自我演化 GUI代理

核心发现

方法论

SE-GA采用层次化记忆结构( episodic、semantic、experiential)结合测试时记忆扩展(TTME)实现长远规划。TTME动态检索 episodic、semantic 和 experiential 记忆,增强推理能力。引入MASE训练流程,利用TTME采集数据稳定优化基础策略。通过离线和在线评估,成功率达89.0%(ScreenSpot)和75.8%(AndroidControl-High),展现优越的泛化能力。

关键结果

  • 在ScreenSpot数据集上,SE-GA成功率达89.0%,显著优于现有方法,验证了其在复杂多步任务中的优势。
  • 在AndroidControl-High上,成功率达75.8%,表现出良好的环境适应性和长远规划能力。
  • 在AndroidWorld基准测试中,SE-GA实现了显著提升,表明其在动态环境中的泛化能力优于传统静态策略,验证了层次记忆和自我演化机制的有效性。

研究意义

该研究突破了GUI代理在多步任务中的信息保持与持续学习瓶颈,提出的层次记忆与自我演化机制极大提升了代理的鲁棒性和适应性,为自动化人机交互提供了新范式,具有重要的理论和应用价值。

技术贡献

创新点在于引入层次化记忆体系(episodic、semantic、experiential)结合TTME实现长远规划,提出MASE训练框架实现持续自我优化,突破了传统静态策略的局限。该方法融合了动态记忆检索与模型自我演化,提供了稳定高效的学习路径,为GUI代理的持续学习和泛化提供了技术基础。

新颖性

首次将层次记忆结构与测试时记忆扩展结合,提出自我演化训练流程,突破了多步任务中信息遗忘和静态策略的限制,显著提升了复杂环境下的任务成功率和泛化能力。

局限性

  • 模型在极端动态变化环境中仍可能出现记忆溢出或信息遗漏,需进一步优化记忆管理策略。
  • 训练过程依赖大量交互数据,存在计算成本高和数据采集难题。
  • 在超大规模或多模态场景下的适应性和扩展性仍待验证。

未来方向

未来将探索更高效的记忆管理机制,结合多模态信息增强记忆检索能力,提升模型在极端复杂环境中的表现。同时,计划引入元学习策略,实现更快速的自我演化和迁移能力,推动GUI代理向更广泛应用场景扩展。

AI 总览摘要

随着人机交互场景的复杂化,自动化GUI代理面临多步任务中的信息遗忘和环境适应性不足的挑战。传统方法多依赖静态策略和有限上下文窗口,难以应对动态变化和长远规划需求。本文提出SE-GA框架,融合层次化记忆结构与自我演化机制,显著提升多步任务成功率。

核心创新在于引入Test-Time Memory Extension(TTME),动态检索episodic、semantic和experiential记忆,增强长远规划能力;同时,设计Memory-Augmented Self-Evolution(MASE)训练流程,利用TTME采集的交互数据实现持续自我优化。实验结果显示,SE-GA在ScreenSpot和AndroidControl-High数据集上成功率分别达89.0%和75.8%,优于现有方法,验证了其在复杂环境中的优越性能。

该研究突破了GUI代理在信息保持和持续学习方面的瓶颈,为自动化人机交互提供了新思路。未来,计划优化记忆管理策略,结合多模态信息,进一步提升模型的泛化能力和适应性,推动智能代理在更广泛场景中的应用。整体而言,SE-GA为实现自主、持续学习的GUI代理奠定了坚实基础,具有重要的理论价值和实际应用潜力。

深度分析

研究背景

近年来,GUI代理技术快速发展,结合视觉语言模型(VLMs)实现了部分自动化操作(如Chen et al., 2024b),但多步任务中的信息遗忘和环境变化仍是难点。早期方法多采用行为克隆(Sun et al., 2025)或静态策略(Wang et al., 2025b),难以应对动态布局和长远规划。层次化记忆机制(Wang & Liu, 2024)虽提升了短期记忆能力,但缺乏对长远信息的系统管理。近年来,强化学习(Guo et al., 2025)和自我演化(Fang et al., 2025)成为研究热点,但在复杂、多变环境中仍存在稳定性不足的问题。

核心问题

现有GUI代理多依赖有限的上下文窗口,难以保持完整的交互历史,导致错误累积和任务失败。同时,缺乏有效的机制重用过去成功经验,限制了在动态环境中的泛化能力。这些问题严重制约了GUI代理在实际场景中的应用效果,亟需引入更丰富的记忆结构和持续学习机制。

核心创新

本研究提出层次化记忆体系(episodic、semantic、experiential)结合TTME实现长远规划,突破了传统静态策略的局限。引入MASE训练流程,利用交互数据实现模型自我演化,增强模型的持续学习能力。创新点还在于动态检索机制和多模态记忆融合,提升了记忆的准确性和泛化能力。这些创新为GUI代理在复杂环境中的表现提供了新路径。

方法详解

  • �� 构建层次化记忆库:episodic存储近期交互,semantic存储抽象规则,experiential存储成功轨迹。
  • �� TTME实现:在任务执行中动态检索记忆,增强长远推理能力。
  • �� MASE训练:分为基础微调(SFT)和自我演化两个阶段,利用交互数据不断优化模型。
  • �� 记忆检索:采用相似度匹配(余弦、融合)实现多模态信息的高效检索。
  • �� 训练策略:引入重要性比率、动态剪裁和分层奖励设计,确保训练稳定性和任务导向性。

实验设计

采用ScreenSpot、AndroidControl-High、GUIOdyssey和AndroidWorld等数据集,比较多种基线模型(如UI-TARS、Qwen2.5-VL等)。指标包括成功率、动作类型准确率和空间定位精度。训练中使用4A800 GPU,采用分阶段学习率和批次调节,进行消融实验验证各组件贡献。结果显示,SE-GA在复杂多步任务中表现优异,成功率提升显著。

结果分析

在ScreenSpot上,成功率达89.0%,比传统方法提升超过10%;在AndroidControl-High上,成功率达75.8%,表现出良好的环境适应性。消融实验表明,层次记忆和自我演化机制对性能提升起到关键作用。跨场景测试验证了模型的泛化能力,显示其在多样化环境中的优越表现。

应用场景

可广泛应用于自动化测试、智能助理、自动化办公等场景,尤其适合需要长远规划和环境适应的复杂任务。未来可结合多模态信息,推动智能代理在工业自动化、智能家居等领域的落地。

局限与展望

当前模型在极端动态环境中仍存在记忆溢出和信息遗漏问题,训练成本较高,数据采集量大,模型在超大规模场景中的扩展性待验证。未来需优化记忆管理和模型效率,以适应更复杂的实际应用。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。每次你做菜时,会记住之前用过的调料、菜谱和做饭的经验。有时候,你会用不同的调料组合,尝试新菜。这个过程就像给厨房装上了不同的“记忆库”:一个记住你最近用过的调料(episodic),一个存放菜谱和做饭技巧(semantic),还有一个总结你做菜经验的“经验库”。当你再次做饭时,你会从这些记忆中快速找到合适的调料和方法,做出更好吃的菜。SE-GA就是让电脑像你一样,不断记忆、学习、改进,变得越来越聪明,能应对各种复杂的“厨房任务”。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,比如冒险游戏。每次你遇到新任务或难题时,你会记住之前的经验,比如怎么打败某个怪物或找到隐藏的宝藏。你还会记住一些通用的规则,比如“不要轻易相信陌生人”或“多探索周围的环境”。每次遇到新挑战,你会从你的“记忆库”里找出相关的经验和规则,帮你做出更聪明的决定。这个“记忆库”就像你的脑袋,帮你记住过去的经验,学会更好地应对未来的挑战。SE-GA就像让电脑变得像你一样聪明,能不断学习、记忆和改进,变得越来越厉害,能应付各种复杂的任务,就像你在游戏中变得更强一样。

原文摘要

Autonomous Graphical User Interface (GUI) agents often struggle with multi-step tasks due to constrained context windows and static policies that fail to adapt to dynamic environments. To address these limitations, this work proposes the Self-Evolving GUI Agent (SE-GA), a novel framework that integrates hierarchical memory structures with an iterative self-improvement mechanism. At the core of our approach is Test-Time Memory Extension (TTME), which facilitates long-term planning by dynamically retrieving episodic, semantic, and experiential memories to provide salient contexts during inference. To ensure continuous learning, we introduce Memory-Augmented Self-Evolution (MASE), which is a training pipeline that adopts the data collected by TTME to stabilize and enhance the agent's foundational policy. Extensive evaluations across both offline and online benchmarks demonstrate SE-GA achieves state-of-the-art performance, reaching success rates of 89.0\% on ScreenSpot and 75.8\% on the challenging AndroidControl-High dataset. Furthermore, significant improvements on the AndroidWorld benchmark highlight the superior generalization to dynamic environments. Open source code: https://github.com/jinshilong-dev/SE-GA

cs.LG