Agent Workflow Memory

TL;DR

提出Agent Workflow Memory(AWM),通过诱导和存储可重用的任务流程,显著提升网页导航任务成功率,Mind2Web和WebArena上分别提升24.6%和51.1%。

cs.CL 🔴 高级 2024-09-12 247 引用 85 次浏览
Zora Zhiruo Wang Jiayuan Mao Daniel Fried Graham Neubig
人工智能 强化学习 大规模语言模型 任务规划 迁移学习

核心发现

方法论

本文提出的AWM方法基于大规模语言模型(如GPT-4)构建,核心机制包括从任务体验中诱导出可重用的任务流程(workflows),并将其存入记忆系统中以指导未来任务。具体流程包括:• 通过经验抽取潜在的子任务和操作序列,形成抽象的流程描述;• 利用特定的提示模板(prompt engineering)引导模型识别和抽取共通子流程;• 在离线场景中,利用预先标注的示例进行流程诱导,并在推理时加载到记忆中;• 在在线场景中,模型通过自我生成和评估不断诱导流程,并动态更新记忆。该方法支持多任务、多域迁移,结合环境状态、动作轨迹和自然语言描述,形成可解释的流程模型。实验中,AWM在WebArena和Mind2Web两个网页导航基准上,分别实现了24.6%和51.1%的成功率提升,且在跨任务、跨网站和跨域测试中表现出优异的泛化能力。

关键结果

  • 在WebArena数据集上,AWM将成功率从14.9%提升至35.5%,相对提升超过50%,超越了现有最优方法(如BrowserGym和SteP),并显著减少了平均操作步骤数(减少约2步)以完成任务。
  • 在Mind2Web数据集上,AWM在跨任务和跨网站测试中,成功率提升了24.6%,在元素选择和动作准确率方面均优于对比方法,尤其在跨域迁移中表现出强大的适应能力,成功率提升达14个百分点。
  • 在线诱导流程的能力使得模型在没有大量标注示例的情况下,仍能快速学习新任务,经过约40个查询后,成功率迅速达到峰值,展示了极强的样本效率和适应性。

研究意义

该研究突破了传统基于静态示例的任务学习方式,提出的AWM机制模仿人类从经验中抽象出任务流程的能力,有助于提升AI在复杂长远任务中的表现。其在网页导航、信息检索等实际应用中,显著增强了模型的泛化能力和鲁棒性,为未来自主智能体的构建提供了新的思路。尤其是在多任务、多域环境下,AWM展现出优异的迁移学习潜力,推动了智能系统在复杂环境中的实用化进程。

技术贡献

本文的主要技术创新在于:• 提出基于大规模语言模型的流程诱导机制,利用提示工程抽取任务子流程;• 构建动态记忆系统,将诱导的流程存入模型记忆中,实现持续学习和迁移;• 设计离线和在线两种场景下的流程诱导与应用框架,有效结合环境信息与任务需求,提升任务成功率。该方法突破了传统仅依赖静态示例的限制,赋予模型更强的自主学习和适应能力。通过引入抽象化的流程描述,减少了对具体示例的依赖,增强了模型的泛化能力。

新颖性

本研究首次系统性提出利用大规模语言模型诱导和存储可重用的任务流程(workflows),实现跨任务和跨域迁移。与以往仅依赖硬编码或手工设计流程的方案不同,AWM通过自动抽取潜在的子任务流程,显著提升了模型的自主学习能力和泛化性能。这一机制在网页导航等复杂任务中表现出优越的适应性和效率,为未来自主智能体的研究提供了新范式。

局限性

  • 当前方法在流程诱导的准确性依赖于模型的理解能力,面对极端复杂或模糊任务时,流程抽取可能不够精确,影响整体性能。
  • 流程的抽象化虽然提升了泛化能力,但在某些特定环境下,过于抽象的流程可能导致偏离实际场景,影响任务完成的效率和准确性。
  • 在极大规模或高复杂度任务中,流程存储和检索的计算成本可能较高,未来需要优化存储结构和检索机制以提升效率。

未来方向

未来的研究方向包括:• 结合强化学习技术,优化流程诱导的策略学习,提高流程的鲁棒性和适应性;• 探索多模态信息(如视觉、声音)在流程诱导中的作用,丰富流程的表达能力;• 设计更高效的流程存储和检索机制,适应大规模、多任务环境;• 结合人类专家知识,增强流程的可解释性和可信度,推动实际应用落地。

AI 总览摘要

在当今人工智能快速发展的背景下,基于大规模语言模型的智能代理在网页导航、应用操作等任务中展现出巨大潜力。然而,现有方法多依赖静态示例或有限的上下文,难以应对复杂长远的任务场景。人类通过学习和抽象任务流程,能够灵活应对多变环境,提升效率。受此启发,本文提出了Agent Workflow Memory(AWM)机制,旨在模拟人类的经验抽象能力,增强AI的任务规划和迁移能力。

AWM的核心思想是:利用语言模型从任务体验中自动诱导出可重用的子任务流程(workflows),并将其存入记忆系统中,以指导未来任务的执行。具体实现包括:在离线场景中,利用预先标注的示例抽取流程;在在线场景中,模型通过自我生成和评估不断诱导新流程,动态更新记忆。该机制支持多任务、多域迁移,显著提升了任务成功率和效率。

在两个网页导航基准——WebArena和Mind2Web上,AWM展现了优越的性能。WebArena中,成功率从14.9%提升至35.5%,相对提升超过50%,且平均操作步骤减少约2步;Mind2Web中,跨任务成功率提升24.6%,跨域迁移中成功率提升达14个百分点。这些结果验证了AWM在复杂环境中的强大适应性和迁移能力。

此外,AWM在没有大量标注示例的情况下,依然能通过少量查询快速学习新任务,表现出极高的样本效率。其在跨任务、跨网站、跨域测试中均优于现有最先进方法,显示出广泛的应用潜力。未来,结合强化学习、多模态信息和优化存储机制,AWM有望推动自主智能体在更复杂、更真实的场景中实现更高的自主性和鲁棒性。

深度分析

研究背景

近年来,随着大规模预训练语言模型(如GPT系列)在自然语言理解和生成方面取得突破,智能代理在网页导航、应用操作等任务中逐渐崭露头角。早期方法多依赖于模仿学习、硬编码规则或有限的上下文信息,难以应对复杂、多变的任务环境。近年来,研究者开始探索利用模型的推理和抽象能力,提升任务迁移和泛化能力。例如,SteP、BrowserGym等方法引入了环境建模和策略优化,但仍受限于静态示例和任务特定的设计。与此同时,如何让模型自主学习、抽取潜在的子任务流程,成为提升复杂任务表现的关键。

核心问题

现有方法在处理长远、多步骤、跨域的网页导航任务时,表现出明显的局限。主要问题包括:• 缺乏有效的机制抽取和存储可重用的任务流程,导致模型在面对新任务时重复学习,效率低下;• 任务迁移能力不足,难以在不同网站或环境中泛化;• 依赖大量标注示例,缺乏样本效率;• 不能充分利用过去经验中的潜在结构信息,限制了模型的自主学习和适应能力。这些问题严重制约了AI在实际复杂场景中的应用。

核心创新

本研究的核心创新在于:• 提出基于大规模语言模型的流程诱导机制,通过提示工程自动抽取潜在的子任务流程,减少对人工设计的依赖;• 构建动态记忆系统,将诱导的流程存入模型内部,支持多任务迁移和持续学习;• 设计离线和在线两种场景下的流程诱导与应用框架,增强模型的适应性和效率;• 引入抽象化的流程描述,提升流程的泛化能力,减少对具体示例的依赖。这些创新共同推动了智能代理在复杂任务中的自主性和鲁棒性。

方法详解

  • �� 经验采集:收集任务体验,包括自然语言指令和对应的动作轨迹。• 流程诱导:利用预训练的GPT-4模型,通过特定提示模板,自动抽取任务中的潜在子流程,形成抽象描述。• 流程存储:将抽取的流程存入记忆系统,支持后续调用。• 离线应用:在训练阶段,利用标注示例诱导流程,存入模型记忆;在推理阶段,加载流程指导任务执行。• 在线应用:在没有标注示例时,模型通过自我生成和评估不断诱导新流程,动态更新记忆。• 任务执行:在任务执行中,模型根据记忆中的流程,规划和执行动作,提升成功率。• 迁移和泛化:流程的抽象描述支持跨任务、跨网站迁移,增强模型的适应能力。

实验设计

采用WebArena和Mind2Web两个公开网页导航基准,分别评估任务成功率和操作步骤数。WebArena涵盖812个任务,涉及五个不同网站,强调操作的正确性和效率;Mind2Web则关注跨任务和跨域的泛化能力。实验中,比较AWM与现有最优方法(如BrowserGym、SteP、AutoEval、MindAct、Synapse),在不同设置(离线、在线)下进行。超参数包括:模型使用GPT-4(温度0.0),流程诱导的提示模板,流程存储结构等。通过 ablation 研究验证流程诱导和存储机制的贡献,分析不同场景下的成功率变化和效率提升。

结果分析

AWM在WebArena中,将成功率从14.9%提升到35.5%,相对提升超过50%,且平均步骤减少约2步,显著优于对比方法。在Mind2Web中,跨任务成功率提升24.6%,跨域迁移中成功率提升14个百分点。在线诱导流程后,模型在少量样本(约40个查询)中快速学习,成功率在短时间内迅速达到峰值,表现出极强的样本效率。跨任务和跨网站测试中,AWM均优于基线,验证了其强大的迁移和泛化能力。这些结果显示,流程抽取和存储机制极大提升了复杂任务的完成效率和成功率。

应用场景

该方法适用于自动化网页导航、智能助理、信息检索等场景,尤其在多任务、多域环境中表现出优异的迁移能力。未来可结合实际应用中的用户偏好和环境信息,进一步优化流程抽取和应用策略,推动智能代理在商业、教育、服务等行业的落地。长远来看,结合强化学习和多模态信息,将使得智能体具备更强的自主学习和适应能力,推动智能系统向更高层次的自主性发展。

局限与展望

当前方法在流程抽取的准确性依赖模型理解能力,面对极端复杂或模糊任务时,抽取的流程可能不够精确,影响整体性能。流程的抽象化虽然增强了泛化,但在某些特定环境中可能导致偏离实际场景,影响效率。存储和检索流程的计算成本在大规模任务中较高,未来需要优化存储结构和检索机制。此外,模型在极端场景下的鲁棒性和解释性仍有待提升,未来需结合人类专家知识,增强流程的可信度和可解释性。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。每次做菜,你都会按照一定的步骤,比如先洗菜、切菜、炒菜、装盘。随着经验的积累,你会逐渐记住一些常用的步骤组合,比如炒菜的基本流程,甚至会根据不同的菜调整步骤。现在,假设你有一个聪明的机器人助手,它可以通过观察你做菜,学习到这些步骤,然后记在脑子里。下次你让它帮你做菜时,它会根据之前学到的流程,自动帮你安排好每个步骤,甚至可以在不同菜之间复用这些流程。这个机器人就像论文中的Agent Workflow Memory(AWM),它通过学习和存储“做菜流程”,帮助自己更快、更好地完成新菜。这样一来,无论是做新菜还是重复的菜,机器人都能更快地完成,效率也更高。这种学习和记忆流程的方法,类似于我们人类从经验中抽象出“做菜套路”,然后用它来应对各种不同的菜肴。

简单解释 像给14岁少年讲一样

想象你在学校的科学实验室里做实验。每次做实验,你会按照一定的步骤,比如准备材料、连接设备、进行操作、观察结果、记录数据。随着你做了很多次,你会逐渐记住一些常用的步骤组合,比如如何连接设备,或者如何观察结果。现在,假设你有一个聪明的助手——它可以观察你做实验,然后记住这些步骤。下次你让它帮你做实验时,它会根据之前学到的流程,帮你安排好每一步,甚至可以在不同的实验中重复使用这些流程。这个助手就像论文中的Agent Workflow Memory(AWM),它通过学习和存储“实验流程”,帮助自己更快、更好地完成新实验。这样一来,无论是做新实验还是重复的实验,它都能更快完成,效率也更高。这就像你在学校学会了很多做实验的套路,之后用它们来应对各种不同的实验任务。

术语表

Agent Workflow Memory (AWM)

一种通过学习和存储任务流程(workflows),帮助AI智能体在复杂任务中快速适应和迁移的方法。技术上结合大规模语言模型(如GPT-4)进行流程抽取和记忆管理。

论文中提出的核心机制,用于网页导航任务的流程诱导与存储。

Workflow (流程)

一系列有序的操作步骤,用于完成特定任务,具有抽象描述和具体执行两部分。技术上,流程由自然语言描述和动作序列组成,支持跨任务迁移。

用于表示和存储在模型记忆中的子任务结构。

Prompt Engineering (提示工程)

设计特定的输入提示,引导语言模型生成目标内容或抽取信息。技术上通过模板和示例优化模型输出的质量与相关性。

用于流程诱导和抽取的关键技术手段。

离线场景 (Offline Scenario)

在任务执行前,利用预先收集的标注示例或数据,诱导出流程并存入记忆,供推理时调用。

适用于有大量标注数据的训练环境。

在线场景 (Online Scenario)

在没有大量标注示例的情况下,模型通过自我生成和评估不断诱导流程,动态更新记忆以适应新任务。

适用于实时或少量数据的任务环境。

迁移学习 (Transfer Learning)

将从一个任务中学到的知识应用到另一个相关任务中,提升模型在新任务上的表现。

AWM在跨任务和跨域中的核心优势。

抽象化流程 (Abstracted Workflow)

将具体任务中的流程元素泛化为更通用的描述,减少对特定示例的依赖,增强迁移能力。

提升模型在不同任务中的泛化性能。

网页导航 (Web Navigation)

在网页环境中,智能体根据指令自动浏览网页、提取信息或完成操作的任务。

论文中的主要应用场景。

成功率 (Success Rate)

模型在任务中正确完成目标的比例,是衡量任务性能的重要指标。

用于评估AWM在不同数据集上的表现。

操作步骤 (Action Steps)

在任务执行中,模型采取的具体操作指令,如点击、填写、滚动等。

衡量任务完成效率的关键指标。

跨任务迁移 (Cross-task Transfer)

将从一个任务中学到的流程或策略应用到不同任务中,以提升泛化能力。

AWM的核心优势之一。

多模态信息 (Multimodal Information)

结合多种信息类型(如视觉、声音、文本)以增强模型理解和决策能力。

未来可能的扩展方向。

流程诱导 (Workflow Induction)

利用模型从经验中自动抽取潜在的子任务流程的过程。

实现AWM的核心技术。

记忆系统 (Memory System)

存储诱导出的流程和经验,用于指导未来任务执行的机制。

模型自主学习和迁移的基础。

提示模板 (Prompt Template)

设计特定格式的输入,用于引导模型生成目标内容或抽取信息。

流程诱导的关键技术手段。

任务抽象 (Task Abstraction)

将具体任务中的操作和目标泛化为更高层次的描述,便于迁移和重用。

增强模型泛化能力的重要手段。

开放问题 这项研究留下的未解疑问

  • 1 尽管AWM在网页导航任务中表现优异,但其在极端复杂或模糊任务中的流程抽取准确性仍有待提升。未来需要研究更鲁棒的流程抽取技术,尤其是在环境信息模糊或任务定义不明确时的表现。
  • 2 流程的抽象化虽然增强了迁移能力,但在某些特定环境中可能导致偏离实际场景,影响任务效率。如何平衡抽象与具体的关系,是未来研究的重点。
  • 3 在大规模、多任务环境中,流程存储和检索的计算成本较高,尤其是在高频更新和多域迁移场景下,存储结构和检索机制亟需优化。
  • 4 模型在极端场景下的鲁棒性和解释性仍有不足,未来应结合人类专家知识,增强流程的可信度和可解释性。
  • 5 如何结合多模态信息(如视觉、声音)丰富流程描述,提升模型对复杂环境的理解能力,是未来的重要方向。

应用场景

近期应用

智能网页助手

利用AWM实现自动化网页导航和信息提取,帮助用户快速完成复杂任务,提升效率,适用于企业客服、数据采集等场景。

企业流程自动化

将企业中的重复操作流程抽象化存储,自动指导机器人完成日常任务,减少人工干预,提高生产效率。

个性化智能助理

结合用户历史操作流程,动态学习和存储个性化流程,为用户提供定制化的操作建议和自动化服务。

远期愿景

自主智能体系统

构建具备自主学习和迁移能力的多任务智能体,广泛应用于自动驾驶、智能制造、智慧城市等领域,推动AI全面自主化。

跨模态多任务系统

结合视觉、声音等多模态信息,构建更智能、更适应复杂环境的自主系统,实现人类级别的认知和操作能力。

原文摘要

Despite the potential of language model-based agents to solve real-world tasks such as web navigation, current methods still struggle with long-horizon tasks with complex action trajectories. In contrast, humans can flexibly solve complex tasks by learning reusable task workflows from past experiences and using them to guide future actions. To build agents that can similarly benefit from this process, we introduce Agent Workflow Memory (AWM), a method for inducing commonly reused routines, i.e., workflows, and selectively providing workflows to the agent to guide subsequent generations. AWM flexibly applies to both offline and online scenarios, where agents induce workflows from training examples beforehand or from test queries on the fly. We experiment on two major web navigation benchmarks -- Mind2Web and WebArena -- that collectively cover 1000+ tasks from 200+ domains across travel, shopping, and social media, among others. AWM substantially improves the baseline results by 24.6% and 51.1% relative success rate on Mind2Web and WebArena while reducing the number of steps taken to solve WebArena tasks successfully. Furthermore, online AWM robustly generalizes in cross-task, website, and domain evaluations, surpassing baselines from 8.9 to 14.0 absolute points as train-test task distribution gaps widen.

cs.CL

参考文献 (20)

Autonomous Evaluation and Refinement of Digital Agents

Jiayi Pan, Yichi Zhang, Nicholas Tomlin 等

2024 142 引用 ⭐ 高影响力 查看解读 →

HeaP: Hierarchical Policies for Web Actions using LLMs

Paloma Sodhi, S. Branavan, Ryan Mcdonald

2023 12 引用 ⭐ 高影响力

WorkArena: How Capable Are Web Agents at Solving Common Knowledge Work Tasks?

Alexandre Drouin, Maxime Gasse, Massimo Caccia 等

2024 329 引用 ⭐ 高影响力 查看解读 →

Mind2Web: Towards a Generalist Agent for the Web

Xiang Deng, Yu Gu, Boyuan Zheng 等

2023 1384 引用 ⭐ 高影响力 查看解读 →

Synapse: Trajectory-as-Exemplar Prompting with Memory for Computer Control

Longtao Zheng, R. Wang, Bo An

2023 189 引用 ⭐ 高影响力 查看解读 →

WebArena: A Realistic Web Environment for Building Autonomous Agents

Shuyan Zhou, Frank F. Xu, Hao Zhu 等

2023 1891 引用 ⭐ 高影响力 查看解读 →

World of Bits: An Open-Domain Platform for Web-Based Agents

Tianlin Shi, A. Karpathy, Linxi (Jim) Fan 等

2017 355 引用

Code as Policies: Language Model Programs for Embodied Control

Jacky Liang, Wenlong Huang, F. Xia 等

2022 1795 引用 查看解读 →

Language Models Can Teach Themselves to Program Better

Patrick M. Haluptzok, Matthew Bowers, A. Kalai

2022 104 引用 查看解读 →

WebShop: Towards Scalable Real-World Web Interaction with Grounded Language Agents

Shunyu Yao, Howard Chen, John Yang 等

2022 1320 引用 查看解读 →

DreamCoder: growing generalizable, interpretable knowledge with wake–sleep Bayesian program learning

Kevin Ellis, Catherine Wong, Maxwell Nye 等

2020 269 引用 查看解读 →

Reinforcement Learning on Web Interfaces Using Workflow-Guided Exploration

E. Liu, Kelvin Guu, Panupong Pasupat 等

2018 362 引用 查看解读 →

Large Language Models as Tool Makers

Tianle Cai, Xuezhi Wang, Tengyu Ma 等

2023 332 引用 查看解读 →

Zero-Shot Task Generalization with Multi-Task Deep Reinforcement Learning

Junhyuk Oh, Satinder Singh, Honglak Lee 等

2017 288 引用 查看解读 →

On the Nature of Expertise.

S. Kay

1992 1156 引用

Categorization and Representation of Physics Problems by Experts and Novices

M. Chi, P. Feltovich, R. Glaser

1981 5538 引用

VisualWebArena: Evaluating Multimodal Agents on Realistic Visual Web Tasks

Jing Yu Koh, Robert Lo, L. Jang 等

2024 693 引用

AutoGuide: Automated Generation and Selection of State-Aware Guidelines for Large Language Model Agents

Yao Fu, Dong-Ki Kim, Jaekyeom Kim 等

27 引用

Top-Down Synthesis for Library Learning

Matthew Bowers, Theo X. Olausson, Catherine Wong 等

2022 89 引用 查看解读 →

Voyager: An Open-Ended Embodied Agent with Large Language Models

Guanzhi Wang, Yuqi Xie, Yunfan Jiang 等

2023 2195 引用 查看解读 →

被引用 (20)

Automata from Agent Traces: Failure and Next-Step Prediction

2026 ⭐ 高影响力 查看解读 →

Dual-Grained Agent Memory and Shapley Context Attribution for Multimodal Agentic Learner

2026 ⭐ 高影响力 查看解读 →

Progressive Agent Skill Generation via Reinforcement Learning

2026 ⭐ 高影响力 查看解读 →

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

2026 ⭐ 高影响力 查看解读 →

On the Fragility of Self-Improving Agents: Variance, Task Order, and Underspecification

2026 ⭐ 高影响力 查看解读 →

Mechanistic Attention Guidance for Agent Memory Refinement

2026 ⭐ 高影响力 查看解读 →

MCPEvol-Bench: Benchmarking LLM Agent Performance Across Dynamic Evolutions of MCP Servers

2026 ⭐ 高影响力 查看解读 →

The Compliance Trap: Diagnosing How AI Agents Consume Conflicting Memory

2026 ⭐ 高影响力 查看解读 →

Knowledge-Centric Self-Improvement

AgRefactor: Self-Evolving Agentic Workflow for HLS Compatibility and Performance

2026 1 引用 查看解读 →

RESOURCE2SKILL: Distilling Executable Agent Skills from Human-Created Multimodal Resources

Speak Your Network: Automated Network Emulation Construction with Cost-Efficient Multi-Agent Orchestration

2026

Joint Learning of Experiential Rules and Policies for Large Language Model Agents

Memory as a Controlled Process: Learned Adaptive Memory Management for LLM Agents

2026 1 引用 查看解读 →

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

2026 1 引用 查看解读 →

Learning on the Job: Continual Learning from Deployment Feedback for Frozen-Weights Agents

From Cognitive Architectures to Language Agents: A Mechanism-Level Review of Lineage, Convergence, and Migration Gaps

Bridging Inference-Time Scaling and Episodic Memory with Action-Centric Graphs

Rethinking Self-Evolution: A Constrained Exploration-Exploitation Process for Mitigating Skill Overfitting

2026 1 引用 查看解读 →

Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents