A Real-World WebAgent with Planning, Long Context Understanding, and Program Synthesis

TL;DR

WebAgent结合HTML-T5规划摘要与Flan-U-PaLM编程,在真实网站成功率提升超50%。

cs.LG 🔴 高级 2023-07-24 26 次浏览
Izzeddin Gur Hiroki Furuta Austin Huang Mustafa Safdari Yutaka Matsuo Douglas Eck Aleksandra Faust
WebAgent HTML-T5 程序合成 长上下文 网页自动化

核心发现

方法论

WebAgent采用模块化闭环架构:HTML-T5根据用户指令、历史步骤和原始HTML预测下一条规范化子指令,并抽取相关HTML片段;540B参数的Flan-U-PaLM再依据子指令和片段生成可执行Python/Selenium程序。HTML-T5使用LongT5式局部—全局注意力,并在CommonCrawl HTML上执行长跨度去噪预训练,随后通过自经验监督适配真实网站。

关键结果

  • 在真实房地产、社交媒体和地图网站上,WebAgent成功率分别为65%、70%和80%,对应属性覆盖分数为87.6%、85.8%和93.8%,明显超过单一Flan-U-PaLM及仅规划或仅摘要的变体。
  • 在MiniWoB++ 12K、56项任务上,HTML-T5的架构和预训练设计带来显著提升;论文报告其相较先前语言模型代理成功率高18.7%,并在Mind2Web离线规划评测中达到超越GPT-4基线的SoTA。
  • 消融显示局部加全局注意力在4096长度下达到53.6%,而密集注意力仅35.3%;长跨度μ={8,64}在房地产任务上得分82.46%,优于包含μ=3的组合。

研究意义

论文回应了真实网页代理长期存在的三重瓶颈:开放式动作空间、7K—14K的冗长HTML,以及通用语言模型缺乏HTML结构归纳偏置。它证明了规划、相关内容压缩和开放式代码执行可以形成互补系统,使代理不再局限于模拟器中的预定义点击或选择动作。对工业界而言,该方案展示了从“网页元素分类”转向“生成可执行程序”的路径;对学术界而言,它强调领域预训练与闭环自经验数据对真实环境泛化的重要性。

技术贡献

核心技术包括HTML-T5、局部—全局注意力、长跨度HTML去噪和自经验监督。编码器以局部窗口捕获标签及属性的邻近关系,以瞬时全局表示压缩更高层HTML结构;训练时输入长度为4096、输出长度为910,随机遮盖15% token,跨度均值重点采用8和64。规则脚本产生规划与检索监督,Flan-U-PaLM生成程序,再用环境反馈过滤执行错误,最终微调HTML-T5。

新颖性

相比MindAct使用DeBERTa/Flan-T5摘要和离散动作选择,WebAgent把HTML专用模型、闭环规划与开放式Python程序合并到真实在线环境。新意不只是更长上下文,而是把HTML结构偏置、任务分解和代码执行组织成可自我积累经验的模块化代理。

局限性

  • 训练与评测覆盖房地产、社交媒体和地图三类网站,数据规模为260、230和410条训练 episode,网站分布仍有限,难以证明对复杂商业网页和未见领域的普适性。
  • 程序由大型Flan-U-PaLM生成并通过人工监督环境运行,计算成本、执行安全性、页面动态变化和错误恢复能力尚未系统量化。

未来方向

后续可扩大真实网站与任务分布,学习更稳健的自适应规划器和自动成功判定器;同时研究程序验证、沙箱执行、视觉与HTML联合感知,以及更高效的小模型替代540B Flan-U-PaLM,从而降低部署成本并提高安全性。

AI 总览摘要

真实网页自动化远比模拟器困难。模拟器通常提供约0.5K token的简化HTML和预定义动作,而真实网站的HTML常达7K—14K token,页面结构复杂、动作开放,通用大模型容易遗漏关键控件。论文提出WebAgent,目标是让代理依据自然语言在真实网站完成多步任务。

WebAgent将任务拆成三个闭环环节:HTML-T5预测下一条子指令并从长HTML中提取相关片段;Flan-U-PaLM根据这些信息生成Python/Selenium程序;程序执行后的页面再次进入规划流程。HTML-T5采用LongT5式局部—全局注意力,并在CommonCrawl抽取的3.41M个HTML样本上进行长跨度去噪预训练,重点使用μ=8和64的遮盖跨度。

结果显示,真实房地产、社交媒体和地图任务成功率分别达到65%、70%和80%,属性覆盖分数为87.6%、85.8%和93.8%,较模块缺失的基线提升超过50%。在MiniWoB++上,HTML-T5相较先前代理高18.7%;在Mind2Web上达到SoTA。消融实验表明,局部—全局注意力在4096长度下为53.6%,远高于密集注意力的35.3%。研究的重要启示是:真实网页代理需要领域结构偏置、长上下文压缩和开放式程序合成的协同,而不是依赖单一提示词驱动的通用模型。

深度分析

研究背景

LLM已能执行推理和模拟网页导航。Gur等人、Furuta等人和MindAct证明了微调或提示式代理的潜力,但主要依赖简化网页、短HTML和预定义动作。真实页面平均比模拟器长约15倍,且包含大量无关脚本、属性和动态结构,因此通用T5、Flan-T5或GPT式模型难以稳定定位控件。

核心问题

任务同时要求理解复杂自然语言、跨页面保持状态、处理7K—14K token HTML,并执行无法预先枚举的动作。直接输入长文档会超出上下文或增加成本;只做正则检索会丢失语义;离散动作分类又无法覆盖真实网页中的开放操作。

核心创新

第一,提出WebAgent,将规划、HTML摘要和程序执行组成闭环。第二,提出HTML-T5,以局部—全局注意力编码HTML树结构。第三,使用μ=8、64为主的长跨度去噪,避免μ=3只遮盖</、id=等低信息片段。第四,通过规则规划、模型编程和环境过滤构造自经验监督,降低人工标注成本。

方法详解

  • �� 输入:用户指令、历史子指令、当前HTML。
  • �� 规划:HTML-T5预测下一条规范化子指令,如“输入7500到最高租金”。
  • �� 摘要:HTML-T5输出相关data-ref或元素ID,保留任务片段。
  • �� 编程:Flan-U-PaLM将子指令和片段转为Python Selenium代码,如click、send_keys或滚动。
  • �� 执行:浏览器运行程序并返回新HTML。
  • �� 训练:3.41M CommonCrawl样本预训练;260/230/410条真实网站episode用于自经验微调;过滤程序、检索和URL错误。

实验设计

真实评测覆盖房地产、社交媒体和地图网站,分别包含约20、10及更短步骤;使用20条自然语言指令,指标为任务成功率和属性覆盖分数。HTML-T5还在MiniWoB++ 12K的56项任务及Mind2Web离线规划集上测试,与Flan-T5、Long-T5、Gur等人的代理、MindAct和Synapse比较。消融改变注意力类型、序列长度和去噪跨度。

结果分析

WebAgent真实成功率为65%/70%/80%,显著优于单一Flan-U-PaLM的10%/20%/10%或仅规划、仅摘要变体。属性分数达到87.6%/85.8%/93.8%。MiniWoB++中密集注意力为35.3%,局部—全局注意力为53.6%;长跨度μ={8,64}在房地产任务得分82.46%,高于无HTML去噪的78.07%。这些结果支持结构偏置与闭环规划的必要性。

应用场景

可用于房产筛选、社交平台检索、路线规划、表单填写、企业后台操作和信息采集。部署前需提供浏览器沙箱、权限控制、页面变化监测和任务成功判定。其最大价值在于处理无法预先设计动作集合的网站,而非只完成固定按钮序列。

局限与展望

评测网站和训练episode仍较少,主要依赖模板指令与人工监督执行;540B Flan-U-PaLM带来高推理成本。论文没有充分报告延迟、安全、视觉元素、登录验证、反爬机制和严重程序错误。未来应扩大跨域测试,加入视觉感知、程序验证、自动反馈和更小的代码模型,并研究长期记忆与可靠恢复。

通俗解读 非专业人士也能看懂

把WebAgent想成一个会操作任何柜台的旅行助理。你说“帮我找纽约两居室、两卫、租金不超过7500美元”,它不会一次把整栋商场的所有信息都塞进脑子,而是先把目标拆成“打开房产网站、输入城市、设置房间数、设置价格”等小步骤。

接着,它像一名会快速浏览目录的助理,从很长的网页中只找出真正相关的输入框和按钮。然后,另一名更擅长写指令的助理,把“点击价格按钮”翻译成浏览器能执行的具体动作。动作完成后,网页变化,第一名助理再看新的页面,决定下一步。

它的训练也很像实习生培养:先看大量网页样本,故意遮住一段,让模型猜回去;再用脚本生成练习任务,让模型从网页中找正确位置;如果程序运行失败,就把坏例子删掉。这样,WebAgent不只是背按钮位置,而是学会网页结构和任务顺序。

实验表明,这种分工在真实房产、社交媒体和地图网站上成功率达到65%、70%和80%。关键不是让一个“超级助手”独自完成所有工作,而是让规划、找信息和执行动作彼此配合。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的网页游戏:任务是“在地图网站上找出从San Jose到Mountain View的第二条骑行路线”。普通机器人可能只会按固定按钮,因为它提前不知道网页会长什么样;如果页面突然多了广告、菜单或新按钮,它就迷路了。

WebAgent像一个小队。HTML-T5是队长,先读懂任务,再说“输入起点”“输入终点”“选择骑行”“点击第二条路线”。它不会把整页乱七八糟的代码都记住,而是从长网页中找出和当前步骤有关的输入框或按钮。

Flan-U-PaLM像程序员,把队长的话写成浏览器能执行的Python指令,比如找到某个输入框、输入文字、点击按钮或向下滚动。完成一步后,网页会改变,小队重新观察并计划下一步。这个过程像游戏里的连续任务,而不是一次性猜答案。

研究者还让模型阅读了CommonCrawl中的大量HTML,并故意遮住较长片段,让它学习网页标签和结构。结果很惊人:在三个真实网站上的成功率分别是65%、70%和80%;在MiniWoB++上比以前的方法高18.7%。不过它仍然很昂贵,也可能因网页变化或奇怪按钮而失败。

术语表

WebAgent(网页代理)

依据自然语言指令自主操作真实网站的模块化智能体。它结合规划、HTML摘要和Python程序合成。

论文提出的总体系统。

HTML-T5(HTML专用T5)

针对长HTML文档预训练和微调的编码器—解码器模型。它负责子指令规划与相关片段摘要。

WebAgent的领域专家模块。

Local-Global Attention(局部—全局注意力)

局部注意力处理邻近token,全局表示压缩跨窗口信息。该机制适合HTML的层级结构并降低长序列成本。

HTML-T5编码器架构。

Long-span Denoising(长跨度去噪)

随机遮盖连续token跨度,再根据上下文恢复它们的预训练目标。HTML-T5重点使用均值为8和64的跨度。

CommonCrawl HTML预训练。

Self-experience Supervision(自经验监督)

用脚本生成规划和检索步骤,再由模型生成程序,并利用环境反馈过滤失败样本。它减少逐步人工标注需求。

真实网站适配与微调方法。

Grounded Program Synthesis(基于网页落地的程序合成)

模型根据自然语言子任务和实际HTML元素生成可执行代码。论文使用Flan-U-PaLM生成Python Selenium程序。

解决开放式网页动作空间。

开放问题 这项研究留下的未解疑问

  • 1 模型能否在登录、验证码、弹窗、反爬和频繁变化的商业网页上稳定工作,论文尚未充分回答;需要跨网站长期在线测试。
  • 2 540B模型的成本与延迟限制部署。未来需要验证更小代码模型、缓存机制和程序复用能否保持成功率。
  • 3 现有反馈主要过滤明显失败,尚缺细粒度自动奖励、程序安全验证和长期任务恢复机制。

应用场景

近期应用

智能房产检索

用户用自然语言描述城市、户型、预算和用途,WebAgent自动填写筛选表单并整理结果。需要浏览器沙箱、账户权限和页面变化监控,可减少客服或运营人员的重复点击。

企业网页流程自动化

适合后台查询、表单录入、社区内容筛选和路线规划。企业可提供少量示例、允许的URL和操作权限,再由HTML-T5定位元素、Flan-U-PaLM生成执行代码。

远期愿景

通用网页操作助手

未来代理可跨网站完成采购、预约、报销和研究资料搜集,但前提是解决安全授权、隐私保护、验证码、错误恢复和可审计程序执行问题。

原文摘要

Pre-trained large language models (LLMs) have recently achieved better generalization and sample efficiency in autonomous web automation. However, the performance on real-world websites has still suffered from (1) open domainness, (2) limited context length, and (3) lack of inductive bias on HTML. We introduce WebAgent, an LLM-driven agent that learns from self-experience to complete tasks on real websites following natural language instructions. WebAgent plans ahead by decomposing instructions into canonical sub-instructions, summarizes long HTML documents into task-relevant snippets, and acts on websites via Python programs generated from those. We design WebAgent with Flan-U-PaLM, for grounded code generation, and HTML-T5, new pre-trained LLMs for long HTML documents using local and global attention mechanisms and a mixture of long-span denoising objectives, for planning and summarization. We empirically demonstrate that our modular recipe improves the success on real websites by over 50%, and that HTML-T5 is the best model to solve various HTML understanding tasks; achieving 18.7% higher success rate than the prior method on MiniWoB web automation benchmark, and SoTA performance on Mind2Web, an offline task planning evaluation.

cs.LG cs.AI cs.CL