MementoGUI: Learning Agentic Multimodal Memory Control for Long-Horizon GUI Agents

TL;DR

MementoGUI通过学习多模态记忆控制器提升长时序GUI代理性能,显著改善任务成功率。

cs.CV 🔴 高级 2026-05-19 30 次浏览
Ziyun Zeng Hang Hua Bocheng Zou Mu Cai Rogerio Feris Jiebo Luo
多模态学习 长时序决策 GUI代理 记忆控制 深度学习

核心发现

方法论

本文提出MementoGUI框架,结合预训练的GUI骨架与MementoCore记忆控制器,通过在线选择、压缩和检索多模态记忆,实现长时序GUI任务的自主决策。MementoCore模块化设计,包含步骤处理、记忆压缩、 episodic写入与检索操作,利用大规模自动化数据采集训练。实验在GUI-Odyssey、MM-Mind2Web及MementoGUI-Bench上验证,显著优于无历史、纯文本记忆和历史重放基线,尤其在长轨迹任务中提升动作匹配率和任务成功率。

关键结果

  • 在GUI-Odyssey上,使用UI-Venus-1.5-8B模型,加入工作记忆后动作匹配率从54.58提升至67.69,轨迹成功率从1.29提升至2.69,加入episodic记忆后进一步提升至68.32和3.57,表现优于所有对比基线。
  • 在MM-Mind2Web中,记忆增强模型在Step SR指标上提升显著,说明长时序任务中的记忆控制有效性。
  • 在MementoGUI-Bench中,基于VLM的语义动作匹配和任务进展指标均显示记忆控制带来稳定提升,验证了方法的普适性和鲁棒性。

研究意义

该研究突破了长时序GUI代理的记忆瓶颈,提出主动记忆管理机制,解决传统方法中信息冗余或遗失的问题,为复杂软件界面自动化、智能助手等应用提供理论基础与技术支撑,推动AI在复杂交互环境中的自主能力提升。

技术贡献

创新点在于引入多模态记忆控制器,结合结构化的工作记忆与 episodic记忆,通过学习 relevance 进行动态筛选,避免无效信息干扰。无需微调基础GUI模型,提升了系统的扩展性和适应性。提出自动化数据采集与偏好学习机制,有效缩短训练周期,增强模型泛化能力。

新颖性

首次将多模态记忆控制引入长时序GUI任务,突破传统纯粹基于历史重放或文本记忆的限制,提出结构化、多尺度、多模态的记忆管理策略,实现对复杂界面交互的高效记忆与检索,具有重要创新意义。

局限性

  • 当前方法依赖大量自动采集的训练数据,可能在新环境或未覆盖场景下表现不足,需进一步提升迁移能力。
  • 记忆管理策略在极长轨迹或高频界面变化中仍存在信息压缩与选择的权衡,可能导致关键细节丢失。
  • 模型在极端复杂界面或多任务同时进行时,记忆控制的效率和准确性仍需优化。

未来方向

未来将探索多模态记忆的自适应调节机制,结合强化学习优化记忆筛选策略,提升模型在多任务、多环境中的泛化能力。同时,结合元学习实现快速适应新任务,推动自主GUI代理的智能化发展。

AI 总览摘要

长时序GUI任务中的信息遗失与冗余问题严重制约自动化智能的发展。传统方法多依赖纯历史重放或文本记忆,难以兼顾信息的相关性与紧凑性。本文提出的MementoGUI框架,通过引入结构化、多模态的记忆控制器,有效管理任务相关的界面事件与视觉证据,实现对长轨迹的高效记忆与检索。核心创新在于设计了基于学习的多操作记忆管理机制,包括步骤处理、记忆压缩、episodic写入与筛选,避免无关信息干扰,提升决策质量。实验结果显示,在多个公开基准上,加入记忆控制后,代理的动作匹配率和任务成功率显著提升,验证了方法的有效性。该研究不仅推动了GUI自动化的技术边界,也为未来多模态自主系统提供了理论基础。未来工作将聚焦于增强记忆的自适应调节与迁移能力,推动智能代理在复杂环境中的应用落地。

深度分析

研究背景

随着深度学习和多模态模型的发展,GUI自动化已成为研究热点。早期方法多依赖规则或模板,后续引入视觉理解与语言模型,显著提升了交互能力。代表性工作包括UI-Venus、GUI-Owl和MAI-UI等,解决了单步理解与动作预测问题。然而,长时序任务中的信息遗失、重复与决策困难仍未根本解决。近年来,记忆机制如知识库、技能库和强化学习记忆被引入,但多模态、结构化、长时序管理仍是挑战。

核心问题

长轨迹GUI任务中,关键界面事件和视觉证据容易被遗忘或被冗余信息淹没,导致代理在复杂场景下表现不稳定。传统方法多依赖固定历史或文本记忆,难以动态筛选有用信息,限制了长时序任务的完成能力。如何主动管理多模态记忆,提升信息的相关性和紧凑性,成为核心难题。

核心创新

提出MementoGUI框架,结合结构化多模态记忆管理,创新点包括:

  • �� 引入学习的记忆控制器,动态筛选界面事件与视觉证据;
  • �� 设计多操作模块(步骤处理、压缩、episodic写入与筛选),实现无缝集成;
  • �� 利用自动化数据采集训练记忆策略,无需微调基础模型;
  • �� 结合偏好学习优化检索与筛选效果,提升记忆的相关性与效率。

方法详解

  • �� 采用预训练的GUI骨架(如UI-Venus、GUI-Owl)作为基础模型,冻结参数。
  • �� 构建多模态记忆控制器(MementoCore),包括:
  • 步骤处理:识别界面事件的重要性,生成事件摘要和ROI。
  • 记忆压缩:对旧记忆进行总结,控制记忆体积。
  • episodic写入:将完成的轨迹转存为可重用的记忆单元。
  • episodic筛选:利用学习的相关性模型筛选最有用的过去经验。
  • �� 训练过程:通过自动采集的交互轨迹,构建监督数据,采用结构化微调(SFT)和偏好偏差优化(DPO)进行训练。
  • �� 在多个公开基准(GUI-Odyssey、MM-Mind2Web、MementoGUI-Bench)上评估,指标包括动作匹配、任务成功率及记忆一致性。

实验设计

  • �� 使用GUI-Odyssey、MM-Mind2Web和自建的MementoGUI-Bench,涵盖移动端和Web环境。
  • �� 评估指标包括:动作匹配(AMS)、轨迹成功率(Traj. SR)、步骤成功率(Step SR)、语义动作匹配(VAM)、任务进展(TPS)和记忆一致性(MCS)。
  • �� 比较基线包括无历史、纯文本记忆和纯历史重放。
  • �� 采用不同规模的记忆控制器(如8B、32B)验证模型容量影响。
  • �� 进行消融实验,验证ROI级别的视觉信息和相关性筛选的重要性。

结果分析

  • �� 在GUI-Odyssey中,UI-Venus-1.5-8B模型加入记忆后,动作匹配率从54.58提升至68.32,轨迹成功率从1.29提升至3.57,优于无记忆和纯文本记忆基线。
  • �� 在MM-Mind2Web中,记忆增强模型在Step SR上提升显著,表现出长时序任务中的优势。
  • �� 在MementoGUI-Bench上,VAM、TPS和MCS指标均显示加入记忆后,模型在语义一致性和任务推进方面表现更优,验证了记忆控制的有效性。

应用场景

  • �� 立即应用:可部署于智能助理、自动化测试、软件操作自动化等场景,提升复杂界面交互的自主性与效率。
  • �� 长远愿景:推动自主系统在教育、医疗、工业自动化等领域实现更高层次的智能交互,减少人工干预,提升生产力。

局限与展望

  • �� 依赖大量自动采集的训练数据,迁移到新环境或未覆盖场景时效果有限。
  • �� 长轨迹中,信息压缩与筛选存在关键细节丢失风险。
  • �� 在极端复杂界面或多任务场景中,记忆管理的效率和准确性仍需优化。

通俗解读 非专业人士也能看懂

想象你在一个复杂的厨房里做饭。每次你做菜时,都会遇到不同的食材、工具和步骤。有些事情你会记在脑子里,比如你刚切完菜,有些细节可能会被遗忘,比如调料放在哪了。为了做出好菜,你需要记住哪些步骤重要,哪些可以省略,还要记得之前用过的调料。MementoGUI就像一个聪明的厨房助手,它会帮你记住重要的步骤和细节,甚至会把一些过去的经验整理成小卡片,随时帮你回忆。这样,你就不用担心忘记关键步骤,也能更快完成复杂的菜谱。它通过学习,知道什么时候该记忆,什么时候该忘记,确保你每次都能顺利做出美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,每次你要完成任务,比如找到宝藏或打败大Boss。游戏里有很多线索和提示,有时候你会忘记之前看到的线索,或者被一些无关的东西分心。MementoGUI就像你的智能助手,它会帮你记住重要的线索和关键的提示,把它们整理成小卡片,随时提醒你。它还能根据你之前的经验,告诉你哪些线索最有用,帮你更快找到宝藏。这样,你就不用担心忘记重要信息,也能更聪明地完成任务。它学习你的游戏习惯,知道什么时候该记忆,什么时候可以不用管,帮你变得更厉害!

原文摘要

Recent GUI agents have made substantial progress in visual grounding and action prediction, yet they remain brittle in long-horizon tasks that require maintaining task state across many interface transitions. Existing agents typically rely on raw history replay or text-only memory, which either overwhelms the model with redundant screenshots or discards localized visual evidence needed for future decisions. To address these limitations, we introduce \textbf{MementoGUI}, a plug-in agentic memory framework that equips MLLM-based GUI agents with \textbf{MementoCore}, a learned controller for online memory selection, compression, and retrieval. Rather than treating interaction history as a fixed context, MementoGUI formulates long-horizon GUI control as an online memory-control problem: working memory selectively preserves task-relevant interface events with textual summaries and ROI-level visual evidence, while episodic memory retrieves reusable past trajectories through learned relevance selection. MementoCore modularizes memory control into specialized operators for step processing, memory compression, episodic writing, and episodic selection, enabling plug-in memory augmentation without finetuning the GUI agent backbone. We further develop a scalable data curation pipeline that converts computer-use trajectories into memory-controller training data, introduce \textbf{MementoGUI-Bench} for evaluating long-horizon decision-making in GUI agents, and design MLLM-based metrics for semantic action matching, task progress, and memory consistency. Experiments on GUI-Odyssey, MM-Mind2Web, and MementoGUI-Bench show that MementoGUI consistently improves GUI agents over no-history, history-replay, and text-only memory baselines, with larger MementoCore backbones further strengthening memory-augmented GUI control.

cs.CV