WebForge: Breaking the Realism-Reproducibility-Scalability Trilemma in Browser Agent Benchmark

TL;DR

WebForge通过四阶段自动化生成真实、可复现且可扩展的浏览器任务环境,解决了真实性、可复现性和规模化的三难困境。

cs.AI 🔴 高级 2026-04-13 35 次浏览
Peng Yuan Yuyang Yin Yuxuan Cai Zheng Wei
浏览器代理 自动化基准 多维评估 难度控制 能力剖析

核心发现

方法论

WebForge采用四阶段管道:计划(Plan)、生成(Generate)、优化(Refine)、验证(Validate),实现端到端自动化网页环境构建。计划阶段利用双阶段大模型(高温生成创意,低温验证逻辑)设计任务蓝图,定义七维难度向量;生成阶段结合真实数据和反作弊机制构建功能网页;优化阶段注入真实网络噪声(弹窗、延迟等)提升环境真实性;验证阶段在真实浏览器中执行路径验证任务可解性。通过多维难度控制框架,任务在导航深度、视觉复杂度、推理难度等方面实现细粒度调控。最终构建WebForge-Bench,包含934个跨7领域、3难度等级的任务,支持多模型能力剖析。

关键结果

  • 多模型实验显示,难度分层显著区分模型能力,准确率在L1到L3逐步下降,从75.9%到58.0%,验证了七维难度控制的有效性。
  • 跨领域分析揭示模型在信息检索和内容生成任务中的优势与偏差,单一指标难以反映模型在不同能力维度的表现差异。
  • 消融实验表明,任务生成、环境优化和验证环节缺一不可,整体管道的完整性保证了环境的真实性和任务的可行性。

研究意义

该研究突破了现有浏览器代理基准在真实性、可复现性与规模化间的矛盾,提供一种全自动、多维度、可调节难度的评估框架。解决内容漂移、环境“过于干净”与手工标注成本高的问题,为未来智能代理的能力评估提供了标准化、可扩展的工具。其多维能力剖析有助于理解模型在不同任务类型和环境复杂度下的表现差异,推动智能Web代理技术的深入发展。此框架不仅提升了评测的科学性,也为行业应用中的自动化测试提供了技术基础。

技术贡献

WebForge创新性地提出端到端自动化网页环境生成方案,结合双模型策略设计任务蓝图,利用环境噪声注入增强真实性,采用在真实浏览器中验证的多步骤路径检测,确保环境质量。引入七维难度控制框架,实现多层次、多角度的能力剖析,超越传统单一分数评价。该系统实现了无需人工干预的高效环境构建,显著降低成本,提升规模化能力,为未来自动化能力评估提供了新范式。

新颖性

本研究首次提出完整的四阶段自动化网页环境生成体系,结合多维难度调控与真实环境验证,突破了以往仅能生成静态或非交互式任务的限制。与现有方法如DyVal、TaskBench不同,WebForge实现了交互式、真实数据驱动的网页环境,兼顾真实性与可控性,填补了多维难度调节在网页任务中的空白。

局限性

  • 当前环境生成依赖预定义的网页模板和真实数据,可能在极端场景下难以覆盖所有复杂交互需求。
  • 多模型验证虽保证了任务的可行性,但在极高难度或特殊场景下仍存在漏检或误判的可能。
  • 环境噪声注入虽增强真实性,但可能引入不可控的随机性,影响评估的稳定性。

未来方向

未来将探索更丰富的环境多模态信息整合,提升环境多样性与复杂度;同时优化难度调控的自动化策略,增强模型在极端任务中的表现。还计划引入学习驱动的环境生成机制,实现动态难度调整与个性化评估,为智能代理的多场景适应提供更强支撑。

AI 总览摘要

WebForge创新性地解决了浏览器代理基准面临的真实性、可复现性与规模化三难困境。通过设计四阶段自动化流程——计划、生成、优化和验证,系统实现了端到端构建真实、交互性强的网页环境,无需人工干预。核心技术包括双模型策略设计任务蓝图,注入真实网络噪声以提升环境真实性,以及在真实浏览器中验证任务可解性,确保环境质量。引入七维难度控制框架,使任务在导航深度、视觉复杂度、推理难度等方面实现细粒度调控,支持多维能力剖析。基于此,作者构建了WebForge-Bench,涵盖7个领域、3个难度等级的934个任务,支持多模型能力差异分析。实验结果显示,难度分层显著区分模型能力,跨领域分析揭示偏差,单一指标难以全面反映模型性能。整体来看,WebForge为未来自动化能力评估提供了标准化、可扩展的解决方案,推动智能Web代理技术的深入发展。未来工作将聚焦于环境多样性增强与动态难度调控,进一步提升评估的全面性和适应性。

深度分析

研究背景

网页自动化代理技术近年来取得快速发展,代表性工作包括Mind2Web、WebVoyager和GAIA等,旨在提升模型在复杂网页任务中的表现。早期基准多依赖静态快照或有限交互,存在内容漂移、环境“过于干净”及标注成本高等问题。自动化环境生成逐渐兴起,但多集中于静态或单一维度难度控制,缺乏多维度、真实环境的系统支持。现有方法如DyVal、TaskBench虽实现部分自动化,但未能结合真实网页噪声和多维难度调节,限制了评估的真实性和多样性。

核心问题

现有浏览器代理基准在真实性、可复现性和规模化间存在矛盾。真实网站内容不断变化导致内容漂移,影响任务的持续有效性;控制环境过于“干净”无法反映真实网络噪声,降低环境真实性;手工标注成本高,限制了大规模评测的可行性。这些问题限制了模型能力的全面评估,难以满足行业和学术界对高质量、多维度评估的需求。

核心创新

WebForge的核心创新包括:1)端到端自动化网页环境生成,结合双模型策略设计任务蓝图,确保任务多样性与逻辑严密;2)引入七维难度控制框架,实现导航、视觉、推理等多方面的细粒度调节;3)在真实浏览器中验证任务可解性,确保环境真实性和任务的可行性;4)注入真实网络噪声,模拟真实网络环境,提升环境逼真度。这些创新突破了以往静态或单维调控的限制,为多维能力评估提供了新工具。

方法详解

  • �� 任务设计:利用双模型(高温生成创意,低温验证逻辑)生成任务蓝图,定义七维难度向量。• 环境构建:分析蓝图,采集真实网页数据,构建自包含网页,加入弹窗、延迟等噪声。• 优化环节:自动注入网络噪声,提升环境真实性,确保网页交互的复杂性。• 任务验证:在真实浏览器中执行路径,检测逻辑正确性和任务可解性,过滤不合格任务。• 多维调控:在导航深度、视觉复杂度、推理难度等方面调节任务难度,支持多角度能力分析。

实验设计

采用7个领域、3个难度等级共计1260个任务,经过验证筛选后,最终934个任务进入评测。评估模型包括14个不同配置的闭源和开源模型,指标为任务成功率。通过不同难度层级和跨领域测试,验证了多维难度调控的有效性。还进行了消融实验,分析各环节对环境质量的贡献,确保环境的真实性和任务的多样性。评估在真实浏览器中进行,确保结果的可靠性。

结果分析

多模型实验显示,随着难度提升,模型成功率逐步下降,从L1的75.9%到L3的58.0%,验证了七维调控的有效性。跨领域分析揭示模型在信息检索和内容生成任务中表现优异,而在消费者交易和内容审核方面表现较差,反映模型偏差。消融实验表明,环境噪声注入和路径验证环节对任务质量至关重要。整体结果证明,该框架能细粒度剖析模型能力,优于传统单一指标。

应用场景

该框架可用于行业中自动化测试Web代理能力,提升模型在复杂环境中的鲁棒性。教育和研究机构也能借助此平台进行模型能力评估和能力剖析,推动智能Web代理技术发展。未来,结合多模态信息和动态难度调节,将实现更真实、多样化的环境模拟,满足不同场景需求。

局限与展望

当前环境生成依赖预定义网页和真实数据,难以涵盖所有极端交互场景。多模型验证虽提升可靠性,但在高难度任务中仍存在漏检风险。环境噪声注入可能引入随机性,影响评估稳定性。未来需优化环境多样性和难度调控策略,降低成本,提升适应性。

通俗解读 非专业人士也能看懂

想象你在准备一个复杂的学校实验,老师希望你能设计一个既真实又容易重复的实验环境。传统的方法要么用真实的学校场景,但每次都不一样,难以重复,要么用模拟的场景,虽然可以控制,但缺少真实的细节。WebForge就像用一台特别的机器,自动帮你搭建一个真实的网页环境,里面有各种弹窗、延迟和真实数据,就像真实网络一样。它还可以调节难度,比如让网页变得更复杂或更简单,就像调节实验难度一样。最后,系统会在真实浏览器中测试你的操作是否能成功完成任务,确保环境真实、任务可行。这种方法让我们可以快速、准确地评估智能模型在复杂网页任务中的表现,就像用一台万能的实验机,帮你全面了解你的学习成果。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的游戏,但这个游戏每次都不一样,有的关卡很难,有的很简单。以前,我们要手动设计每个关卡,既费时间又不方便,还可能每次都不一样,难以比较。WebForge就像有一台神奇的机器,能自动帮你设计各种不同难度的游戏关卡,而且每个关卡都是真实的,比如里面会出现弹窗、网络延迟,就像真实的网络环境一样。它还会在真实的浏览器里测试你是否能顺利完成任务,确保关卡既有趣又合理。这样一来,大家就可以用这台机器,快速测试不同的游戏策略,看看哪个更厉害。这就像有个超级助手,帮你设计、测试各种游戏关卡,让你变得更厉害,也让游戏变得更公平、更有挑战性。

原文摘要

Existing browser agent benchmarks face a fundamental trilemma: real-website benchmarks lack reproducibility due to content drift, controlled environments sacrifice realism by omitting real-web noise, and both require costly manual curation that limits scalability. We present WebForge, the first fully automated framework that resolves this trilemma through a four-agent pipeline -- Plan, Generate, Refine, and Validate -- that produces interactive, self-contained web environments end-to-end without human annotation. A seven-dimensional difficulty control framework structures task design along navigation depth, visual complexity, reasoning difficulty, and more, enabling systematic capability profiling beyond single aggregate scores. Using WebForge, we construct WebForge-Bench, a benchmark of 934 tasks spanning 7 domains and 3 difficulty levels. Multi-model experiments show that difficulty stratification effectively differentiates model capabilities, while cross-domain analysis exposes capability biases invisible to aggregate metrics. Together, these results confirm that multi-dimensional evaluation reveals distinct capability profiles that a single aggregate score cannot capture. Code and benchmark are publicly available at https://github.com/yuandaxia2001/WebForge.

cs.AI cs.CV