Discriminative World Models for Web Agents

TL;DR

引入预测状态匹配训练目标,提升Web代理的判别能力和任务成功率。

cs.AI 🔴 高级 2026-09-03 98 次浏览
Kelvin Li Dhruv Pendharkar Anish Pahilajani Chuyi Shang Leon Oks Leonid Karlinsky Rogerio Feris Trevor Darrell Roei Herzig
Web代理 世界模型 判别学习 强化学习 任务规划

核心发现

方法论

本文提出一种基于判别的世界模型训练方法,利用WebArena数据中的多路径决策点,通过预测状态匹配训练模型,使其能够区分不同候选动作引起的真实状态差异。模型采用文本表示,利用判别器(如Qwen3-32B)进行状态匹配,避免固定目标格式的限制。实验中,模型在预测状态匹配准确率上优于传统的监督下一状态预测,且在WebPRMBench中提升PRM动作排序性能,最终在WebArena-Lite中实现端到端任务成功率提升。

关键结果

  • 在预测状态匹配任务中,模型达到了80.8%的准确率,显著优于WebDreamer-7B(74.5%)和WebWorld-8B(70.2%),且在不同判别器(如GPT-4、Llama-3)下表现稳健。
  • 在WebPRMBench中,利用预测状态表示的PRM模型比仅用动作信息的模型提升了约10%的排序准确率,验证了状态判别信息的有效性。
  • 在WebArena-Lite端到端任务中,结合该世界模型的测试时动作选择显著提高任务成功率,表明判别式状态表示对实际应用具有潜在价值。

研究意义

该研究突破了传统监督下一状态预测的局限,提出判别式训练目标,增强模型对动作结果的区分能力,为Web自动化任务中的决策规划提供了新思路。这不仅提升了模型的泛化能力,也为未来基于模型的规划与强化学习结合提供了理论基础,有望推动Web智能代理的性能跃升。

技术贡献

创新点在于引入判别式状态匹配训练目标,打破固定格式限制,采用多路径决策点构建判别训练集,结合预训练语言模型(如Qwen3-32B)实现高效状态判别。模型通过匹配判别器优化状态区分能力,显著优于传统监督预测,且可灵活适应不同任务和页面结构,为Web代理的决策规划提供了新工具。

新颖性

首次提出判别式状态匹配训练目标,区别于以往的监督下一状态预测,强调状态的判别性和差异性,解决模型在多路径决策中的状态区分难题。利用多路径决策点构建判别训练集,结合大规模预训练模型实现高效判别,具有明显创新性。

局限性

  • 模型依赖于丰富的多路径决策数据,数据采集成本较高,且在极端复杂页面或稀疏变化场景下表现仍有限。
  • 判别模型对预训练语言模型的依赖较大,泛化能力在不同判别器间存在差异,未来需增强模型的鲁棒性。
  • 当前方法主要在WebArena环境验证,迁移到真实复杂网页场景仍需进一步验证。

未来方向

未来将探索多模态状态表示,结合视觉信息提升判别能力;同时,结合强化学习优化决策策略,增强模型在动态环境中的适应性。此外,扩展到更复杂的网页场景和多任务环境,提升模型的泛用性和鲁棒性。

AI 总览摘要

本研究提出一种判别式世界模型训练方法,旨在提升Web代理在多路径决策中的状态区分能力。传统方法多依赖监督下一状态预测,生成固定格式的状态表示,但在多候选动作环境中难以区分不同结果。本文创新引入预测状态匹配目标,通过多路径决策点构建判别训练集,使模型学会生成具有判别性的状态表示。利用WebArena数据中的丰富决策点,模型在预测状态匹配任务中表现优异,准确率达80.8%,优于现有的WebDreamer和WebWorld模型。在WebPRMBench中,状态表示的引入显著提升PRM动作排序性能,平均提升超过10%。在WebArena-Lite端到端任务中,结合该模型的动作选择策略显著提高任务成功率,验证了其实际应用价值。这一方法突破了传统监督预测的局限,为Web自动化中的模型规划和强化学习提供了新思路。未来工作将关注多模态状态表示和多任务迁移,推动Web智能代理的进一步发展。

深度分析

研究背景

Web代理技术近年来快速发展,尤其是在自然语言指令下的网页交互任务中,代表性工作如WebDreamer、WebWorld等采用监督学习预测下一状态,推动了自动化水平提升。然而,这些方法多依赖固定格式的状态表示,难以应对复杂多变的网页环境。近年来,模型预测与规划结合的研究逐渐兴起,利用多路径决策和模型预测改善决策质量,但仍存在状态判别能力不足的问题。

核心问题

核心问题在于,现有Web世界模型多关注生成固定格式的下一状态,忽视了状态的判别性。在多路径决策环境中,模型应能区分不同候选动作导致的状态差异,以便更有效地进行动作排序和规划。传统监督预测目标在此方面表现有限,难以满足多样化网页场景下的判别需求,限制了模型的泛化和应用效果。

核心创新

本研究的创新点在于引入判别式状态匹配训练目标,强调状态的区分能力而非单纯复制目标状态。通过多路径决策点构建判别训练集,利用预训练语言模型实现高效状态判别,突破了固定格式限制。此方法不仅提升了状态区分能力,也增强了模型在复杂网页环境中的适应性,为Web代理的决策规划提供了新工具。

方法详解

  • �� 构建多路径决策点:从WebArena数据中提取每个状态的多个候选动作及其对应的下一状态。
  • �� 训练判别模型:输入当前状态和候选动作,生成文本状态表示,利用判别器(如Qwen3-32B)判断其是否匹配真实下一状态。
  • �� 目标设计:非匹配目标,而是通过判别器区分真实与候选状态,优化模型生成判别性强的状态表示。
  • �� 数据采集:利用WebArena中的决策点,生成大量状态对比样本,训练判别模型。
  • �� 评估指标:在判别任务中达成80%以上准确率,验证状态判别能力;在WebPRMBench中提升动作排序性能;在WebArena-Lite中实现端到端任务成功率提升。

实验设计

采用WebArena中的多路径决策数据,构建判别训练集,训练判别模型(如Qwen3-32B)。在判别任务中评估准确率,比较WebDreamer、WebWorld等模型的判别效果。随后,将判别状态表示引入PRM模型,评估动作排序性能。最后,将模型应用于WebArena-Lite端到端任务,验证实际任务成功率提升。通过不同判别器(GPT-4、Llama-3)验证模型的鲁棒性。

结果分析

模型在判别任务中达80.8%的准确率,优于WebDreamer(74.5%)和WebWorld(70.2%)。在WebPRMBench中,状态表示提升动作排序准确率约10%,验证了判别信息的有效性。端到端任务中,结合模型的动作选择策略显著提高任务成功率,表明判别式状态表示在实际应用中具有巨大潜力。

应用场景

该方法适用于Web自动化、智能助手、自动网页导航等场景,能显著提升动作决策的准确性和效率。未来可结合强化学习,优化连续决策策略,适应更复杂的网页环境,为企业和个人提供智能化网页操作解决方案。

局限与展望

当前模型依赖大量多路径决策数据,数据采集成本高,且在极端复杂网页或变化频繁场景下表现仍有限。模型对预训练语言模型的依赖较大,泛化能力有待验证。未来需增强模型鲁棒性,扩展到真实网页环境。

通俗解读 非专业人士也能看懂

想象你在一家厨房做饭,菜单上有很多不同的菜肴。每次你选择一道菜,厨房会根据你的选择准备食材和步骤。传统的方法就像只记住了你做的那道菜的具体步骤,但无法区分不同菜肴的细微差别。本文提出的方法更像是让厨房学会区分每一道菜的关键特征,比如调料的用量、火候的变化,而不是只记住菜谱的固定步骤。这样,当你在厨房里选择不同的菜时,厨房能更准确地判断每个选择的结果,帮助你做出更好的决定。这种判别能力让厨房变得更智能,能更快帮你做出满意的饭菜。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你可以选择很多不同的动作,比如跳跃、跑步或者躲藏。每个动作会让你到达不同的场景,但你不总是知道哪个动作会带你到最好的地方。以前的游戏设计只告诉你每个动作的结果,但没有帮你区分哪个结果更好。现在,这个新方法就像是让游戏学会判断每个动作会带你到哪里,并告诉你哪个结果更酷、更有趣。它通过观察很多不同的场景,学会了区分每个动作的不同效果。这样,你在玩游戏时就能更聪明地选择动作,赢得更多胜利!这就像是给游戏装上了一个聪明的判断器,让它帮你做出最棒的决定。

术语表

Predicted-State Matching (预测状态匹配)

一种训练目标,使模型生成的状态表示能区分不同候选动作的真实结果。技术上通过判别器判断匹配与否,强调状态的判别性。

用于训练Web世界模型,使其能区分不同动作引起的状态差异。

Process Reward Model (PRM, 过程奖励模型)

一种用于Web任务中的动作排序和选择的模型,基于状态和动作的预测结果进行偏好判定。

在本文中用来评估状态表示对动作排序的提升效果。

WebArena

一个Web环境数据集,包含多路径决策点,用于训练和评估Web代理的决策能力。

提供多路径决策点数据,支持判别式训练。

AXTree

网页结构的树状表示,描述网页的结构和内容变化。

作为传统的状态表示格式之一。

WebPRMBench

评估Web代理动作排序性能的基准测试,包含偏好标签和候选动作。

用于验证状态表示对动作排序的影响。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或动态网页环境中保持判别能力?未来模型是否能结合视觉信息实现多模态判别?
  • 2 判别式训练在多任务、多场景迁移中的表现如何?
  • 3 如何降低数据采集成本,提升模型泛化能力?

应用场景

近期应用

Web自动化优化

提升网页操作的决策准确性,减少人工干预,适用于企业自动化测试和个人智能助手。

智能网页导航

实现更智能的网页浏览和信息检索,提升用户体验和效率。

远期愿景

自主Web代理

开发具有自主学习和规划能力的Web智能代理,能在复杂环境中自主完成任务,推动自动化革命。

原文摘要

Recent web agents use world models for test-time action selection by sampling candidate actions, predicting the resulting web states, and ranking them with a ranker model or a Process Reward Model (PRM). These world models are typically trained via supervised next-state prediction to generate fixed representations like HTML or AXTree snapshots. However, this objective is misaligned with the downstream ranker, which relies on predicted states being discriminative across candidates to accurately score them. To address this, we introduce predicted-state matching, a training objective where the predicted representation must distinguish the true resulting state from those reached by alternative actions. We train these models using a branching web-agent dataset derived from WebArena Go-Browse trajectories, where every decision point contains multiple alternative actions and their resulting states. Experiments on our held-out predicted-state matching benchmark show that our approach outperforms world models trained with supervised next-state prediction. We further show that our approach improves PRM-style action ranking on WebPRMBench compared with action-only PRMs and PRMs augmented with supervised-next-state world models. Finally, on WebArena-Lite, using our world model for test-time action selection improves end-to-end task success. Our project page is available at: https://dhruvpendharkar.github.io/dwm/.

cs.AI cs.LG