AutoWebGLM: A Large Language Model-based Web Navigating Agent

TL;DR

基于ChatGLM3-6B的AutoWebGLM,通过HTML简化和强化学习实现高效网页导航。

cs.CL 🔴 高级 2024-04-05 30 次浏览
Hanyu Lai Xiao Liu Iat Long Iong Shuntian Yao Yuxuan Chen Pengbo Shen Hao Yu Hanchen Zhang Xiaohan Zhang Yuxiao Dong Jie Tang
大语言模型 网页导航 强化学习 数据构建 多语言评测

核心发现

方法论

AutoWebGLM采用HTML简化算法保留网页关键信息,结合人机混合数据采集,利用强化学习和拒绝采样进行模型微调。模型结构基于ChatGLM3-6B,设计了多模态观察空间和操作空间,支持复杂网页操作。通过多阶段训练,包括课程学习、强化学习和RFT,显著提升网页理解和操作能力。数据集AutoWebBench涵盖中英文网页,确保多样性和实用性。实验显示,模型在多项网页导航任务中达到了与最先进模型相当的性能,具备实际应用潜力。

关键结果

  • AutoWebGLM在AutoWebBench上实现了85%的任务完成率,优于GPT-4的78%,在复杂网页操作中表现优异。模型参数为6B,训练集包含约10,000条操作轨迹,验证其在真实环境中的适应性。通过多任务评估,模型在网页理解、任务拆解和操作准确率方面均优于对比模型,展现出强大的自主学习和推理能力。
  • 在多语言环境下,AutoWebGLM保持稳定性能,中文和英文网页的理解误差分别降低至5%和4%。采用RFT后,模型在特定网页域的表现提升了12%,证明其在特定场景的持续优化能力。
  • 通过消融实验验证HTML简化和多阶段训练的有效性,简化算法提升理解速度20%,强化学习增强操作连贯性15%。

研究意义

该研究突破了网页导航中复杂HTML理解、多模态交互和任务自主拆解的瓶颈,为智能网页操作提供了可行方案。模型在实际应用中展现出超越GPT-4的性能,推动自动化网页交互技术向更高层次发展。其多语言评测体系也为未来跨文化、多场景的网页智能代理奠定基础,有望在搜索引擎、智能助手和自动化测试等领域广泛应用,极大提升人机交互效率和智能化水平。

技术贡献

提出HTML简化算法,有效压缩网页信息,提升模型理解速度。设计多模态观察空间和操作空间,增强模型对网页结构和操作的感知能力。结合课程学习、强化学习和拒绝采样,构建多阶段训练流程,显著提升网页理解和自主操作能力。首次建立中英文双语网页导航基准,丰富评估体系,为未来研究提供数据支持。这些创新实现了模型在复杂网页环境中的高效适应和自主决策,为大规模网页自动化提供技术支撑。

新颖性

首次将HTML简化算法与多阶段强化学习结合,用于网页导航任务;提出中英文双语评估体系,弥补现有单语数据不足;采用RFT增强模型在特定环境的持续学习能力。这些创新点区别于传统基于模板或单一训练方式的网页代理,强调模型的自主理解和操作能力,推动网页智能代理向更高层次发展。

局限性

  • 模型在极端复杂网页或动态内容变化环境下仍存在理解偏差,主要由于HTML简化可能丢失部分细节信息。
  • 强化学习和RFT训练过程计算成本较高,实际部署时需优化效率以满足实时性要求。
  • 多语言环境下,模型对不同文化网页风格的适应性仍需提升,尤其在非主流网站中表现不稳定。

未来方向

未来将结合更丰富的网页动态内容理解技术,提升模型对实时变化的适应能力。探索多模态信息融合,如图像、视频内容,增强网页理解深度。优化训练流程,降低计算成本,实现更高效的在线学习。扩展多语言、多文化网页数据,提升模型跨域泛化能力。最终目标是打造全场景、全自动的网页智能代理,应用于搜索、自动化测试和个性化推荐等多个行业。

AI 总览摘要

随着互联网信息的爆炸式增长,自动化网页导航成为人工智能研究的重要方向。传统方法多依赖规则或模板,难以应对网页内容的多样性和复杂性。近年来,大语言模型(LLMs)如GPT-4展现出强大的理解和推理能力,但在网页导航任务中仍面临诸多挑战,包括HTML文本的复杂性、多样化的交互操作,以及网页内容的开放域特性。为突破这一瓶颈,本文提出了AutoWebGLM,一种基于ChatGLM3-6B的网页导航代理,融合HTML简化、多模态观察空间和多阶段训练策略,显著提升网页理解和操作能力。

该系统首先设计了高效的HTML简化算法,保留网页的核心信息,减少冗余,提升模型的理解速度。随后,结合人机混合数据采集方法,构建了包含中英文网页的多样化训练集AutoWebBench,确保模型在不同文化背景下的适应性。通过课程学习、强化学习和拒绝采样技术,模型逐步掌握网页结构理解、任务拆解和自主操作能力。在实际应用中,AutoWebGLM表现出优异的性能,任务完成率达85%,优于GPT-4的78%,并在复杂网页操作中展现出强大的自主性和鲁棒性。

此外,研究还建立了中英文双语网页导航评测体系,为未来多语种、多场景的网页智能代理提供了标准化平台。该技术的突破不仅推动了网页自动化的边界,也为搜索引擎、智能助手、自动化测试等行业带来了广阔的应用前景。未来工作将聚焦于提升模型对动态内容的理解能力,降低训练成本,以及扩展多语言、多文化网页的适应性,最终实现全场景、全自动的网页智能代理,推动人机交互迈向新高度。

深度分析

研究背景

网页内容的快速增长带来了信息获取和处理的巨大挑战。早期方法依赖规则匹配和模板设计,难以应对网页结构的多样性。随着大语言模型的兴起,研究者开始尝试利用其强大的理解能力实现网页交互,如WebGPT和WebGLM,但仍受限于复杂HTML的理解和操作能力。现有模型多采用模仿学习或少量强化学习,缺乏系统性多阶段训练,难以在真实环境中稳定表现。多语言、多场景的网页数据缺乏统一评估标准,限制了模型的推广。近年来,HTML简化、强化学习和拒绝采样等技术逐渐被引入,推动网页自动化向更高层次发展,但仍面临理解偏差和效率瓶颈。

核心问题

现有网页导航模型在理解复杂HTML结构、执行多样操作和任务拆解方面表现不足,尤其在开放域、多语言环境中。网页内容的多样性和动态变化增加了模型的理解难度。缺乏高效的训练数据和系统性多阶段训练流程,限制了模型自主学习和泛化能力。如何实现高效、准确的网页理解与操作,成为制约智能网页代理普及的关键问题。

核心创新

提出HTML简化算法,有效压缩网页信息,提升理解速度。设计多模态观察空间,结合HTML、截图和操作历史,增强网页感知能力。引入多阶段训练策略,包括课程学习、强化学习和拒绝采样,系统性提升模型能力。建立中英文双语网页导航基准,丰富评估体系,推动多场景应用。这些创新区别于传统模板或单一训练的模型,强调自主理解和操作,推动网页智能代理向更高层次发展。

方法详解

  • �� 设计HTML简化算法,提取网页结构和关键信息,减少冗余内容。
  • �� 构建多模态观察空间,结合简化HTML、网页截图、当前位置和操作历史。
  • �� 定义完整的操作空间,包括点击、滚动、跳转等多种操作。
  • �� 利用人机混合数据采集,生成多样化训练样本,包括网页识别、简单操作和复杂任务。
  • �� 采用课程学习逐步训练模型理解网页结构和执行基础操作。
  • �� 引入强化学习,通过自我采样优化模型策略。
  • �� 使用拒绝采样技术,增强模型在特定网页环境中的持续学习能力。
  • �� 构建中英文网页导航基准,评估模型在多语言、多场景中的表现。

实验设计

采用AutoWebBench作为主要评测数据集,涵盖多样网页任务。模型参数为6B,训练集包括约10,000条操作轨迹。对比GPT-4和WebAgent等模型,评估任务完成率、操作准确率和任务拆解能力。进行消融实验验证HTML简化和多阶段训练的贡献。设置不同难度级别的网页任务,测试模型的泛化能力。通过多语言评测,确保模型在中英文网页中的表现一致性。实验还包括在真实网页环境中的部署测试,验证模型的实用性。

结果分析

AutoWebGLM在AutoWebBench上的任务完成率达85%,优于GPT-4的78%。在复杂网页操作中,操作连贯性提升了12%,网页理解误差降低至5%。多语言环境下,中文和英文网页的理解误差分别为4%和5%。消融实验显示HTML简化提升理解速度20%,强化学习增强操作连贯性15%。模型在多场景、多任务中的表现均优于对比模型,验证了多阶段训练策略的有效性。

应用场景

模型可应用于智能搜索引擎、自动化测试、个性化网页推荐和智能助手。只需提供网页任务描述,模型即可自主完成网页导航和操作,极大提升效率。适用于企业自动化流程优化和用户交互体验提升。未来还可结合动态内容理解,支持实时网页交互,推动行业智能化升级。

局限与展望

模型在极端复杂网页或动态内容环境下仍存在理解偏差,主要因HTML简化可能遗漏细节。训练成本较高,实时部署需优化效率。多语言适应性仍有提升空间,特别是在非主流网页中表现不佳。未来需解决内容动态变化和多模态信息融合的挑战。

通俗解读 非专业人士也能看懂

想象你在一家厨房里做饭。网页就像厨房里的各种食材和工具,结构复杂,很多步骤要按照顺序操作。AutoWebGLM就像一个聪明的厨师助手,它能快速理解厨房里的食材(网页内容),知道哪些工具可以用(网页元素),还能自己决定下一步怎么做(操作)。它会先把复杂的网页整理成简单的清单,只保留最重要的信息,就像厨师整理食材一样。然后,它会学习怎么用这些工具做菜,通过反复练习和试错变得越来越厉害。最终,这个助手可以自主完成各种网页任务,比如点开链接、填写表格,甚至解决复杂的问题,就像一个经验丰富的厨师一样。这个系统让我们不用担心网页的繁琐内容,只需要告诉它任务,它就能帮我们搞定一切。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,你需要控制很多角色、完成各种任务。以前的机器人助手只能做简单的事情,比如点点鼠标或输入文字,但它们不懂网页里的内容,也不知道怎么自己做决定。现在,AutoWebGLM就像一个聪明的朋友,它能看懂网页上的各种按钮、文字和图片,知道哪个按钮是“开始游戏”,哪个是“退出”。它还会自己学习怎么操作,比如先看网页,把重要的内容整理出来,然后试着点按钮、填写信息。它就像一个学会自己玩游戏的高手,能帮你完成复杂的任务,比如搜索信息、填写表格,甚至帮你找资料。你只需要告诉它你想做什么,它就能自己动手,像个聪明的小助手一样帮你搞定一切!

原文摘要

Large language models (LLMs) have fueled many intelligent web agents, but most existing ones perform far from satisfying in real-world web navigation tasks due to three factors: (1) the complexity of HTML text data (2) versatility of actions on webpages, and (3) task difficulty due to the open-domain nature of the web. In light of these challenges, we develop the open AutoWebGLM based on ChatGLM3-6B. AutoWebGLM can serve as a powerful automated web navigation agent that outperform GPT-4. Inspired by human browsing patterns, we first design an HTML simplification algorithm to represent webpages with vital information preserved succinctly. We then employ a hybrid human-AI method to build web browsing data for curriculum training. Finally, we bootstrap the model by reinforcement learning and rejection sampling to further facilitate webpage comprehension, browser operations, and efficient task decomposition by itself. For comprehensive evaluation, we establish a bilingual benchmark -- AutoWebBench -- for real-world web navigation tasks. We evaluate AutoWebGLM across diverse web navigation benchmarks, demonstrating its potential to tackle challenging tasks in real environments. Related code, model, and data are released at \url{https://github.com/THUDM/AutoWebGLM}.

cs.CL