WebTestBench: Evaluating Computer-Use Agents towards End-to-End Automated Web Testing

TL;DR

WebTestBench评估端到端自动化网页测试,模型F1均低于30%。

cs.SE 🔴 高级 2026-03-26 28 次浏览
Fanheng Kong Jingyuan Zhang Yang Yue Chenxi Sun Yang Tian Shi Feng Xiaocui Yang Daling Wang Yu Tian Jun Du Wenchong Zeng Han Li Kun Gai
自动网页测试 大语言模型 基准数据集 逻辑约束 AI驱动开发

核心发现

方法论

采用WebTestBench构建多类别网页应用,分解为Checklist生成与缺陷检测两步,设计WebTester框架。评估GPT-5.1、Claude等模型,指标包括覆盖率、F1、精确率、召回率。通过模拟人类交互,检测模型在完整性、检测瓶颈和长远交互中的表现。实验涵盖7个网页类别,100个样本,结合语义匹配与逻辑约束分析。

关键结果

  • 所有模型F1均低于30%,GPT-5.1最高为26.4%,召回率达33.3%。测试覆盖率不足70%,存在漏检问题。检测中误判率高,精确率约30%,导致误报严重。模型在长远交互和逻辑约束方面表现不稳定,显示当前能力与工业需求差距明显。
  • 模型在Checklist生成中,覆盖率平均仅达65%,关键测试项遗漏严重,影响缺陷检测完整性。缺陷检测阶段,误判率高,导致漏检和误报共存,反映模型在复杂网页环境中的不足。整体性能表明,端到端自动化网页测试仍处于探索阶段。
  • 实验还揭示模型在多类别网页中的适应性差异,内容丰富、交互复杂的网页更难检测。模型在逻辑约束方面表现尤为薄弱,未能有效识别潜在的逻辑错误。整体结果强调,提升模型的交互理解和逻辑推理能力是未来关键方向。

研究意义

本研究填补了自动网页测试在无手工预定义测试用例环境下的评估空白,为AI驱动网页开发提供了系统化的性能指标。通过引入WebTestBench,推动了从静态视觉比对到动态交互和逻辑约束的全面检测,解决了传统方法在开放环境中的局限。研究揭示了现有大模型在复杂网页环境中的不足,为工业级自动化测试的未来发展提供了重要参考。其长远意义在于推动AI在软件质量保障中的深度应用,加速软件工程自动化进程。

技术贡献

提出WebTestBench,涵盖多类别网页应用,设计Checklist生成与缺陷检测的双阶段框架WebTester。引入长远交互和潜在逻辑约束评估指标,结合语义匹配和逻辑推理机制,系统性评估大模型性能。实验验证了模型在复杂环境中的不足,明确了性能瓶颈,为后续模型优化提供了方向。实现了端到端自动化网页测试的基础平台,推动了自动化测试技术的理论与工程创新。

新颖性

首次系统性构建涵盖逻辑约束的端到端网页测试基准,突破以往静态视觉和预定义用例的限制。引入长远交互和潜在逻辑检测,强调模型在复杂场景中的表现差异。与现有Web2Code、DesignBench等不同,本研究关注模型在实际工业环境中的应用能力,强调逻辑推理与交互理解的结合,具有显著创新意义。

局限性

  • 模型在复杂网页中的交互理解能力不足,导致漏检和误判,尤其在逻辑约束方面表现欠佳。
  • 目前评估受限于模拟交互环境,未充分反映真实用户行为和多样性。
  • 模型训练成本高,推理速度慢,难以满足工业级实时需求。

未来方向

未来将结合强化学习和逻辑推理技术,提升模型在长远交互和逻辑约束中的表现。扩展样本库,丰富网页场景,增强模型泛化能力。同时,探索多模态信息融合,提升模型对复杂网页内容的理解能力,推动工业应用落地。

AI 总览摘要

WebTestBench的提出,标志着自动化网页测试进入了一个新的阶段。随着大语言模型(LLMs)在编程和网页生成中的崛起,用户可以用自然语言快速构建网页,但随之而来的质量验证问题变得尤为关键。传统的静态视觉比对和预定义用例在开放环境中表现有限,无法应对复杂交互和潜在逻辑约束的检测需求。为此,本文构建了WebTestBench,涵盖7个网页类别、100个样本,系统模拟了端到端的自动化测试流程。

在此基础上,提出了WebTester框架,结合Checklist生成和缺陷检测两个环节,利用语义匹配和逻辑推理机制进行性能评估。通过评估GPT-5.1、Claude等多款模型,结果显示所有模型F1值均低于30%,表现出明显的性能瓶颈。测试覆盖率不足70%,漏检和误判问题严重,特别是在复杂网页环境和潜在逻辑约束方面。

这些发现揭示了当前大模型在工业级网页自动化测试中的不足,强调了模型在交互理解和逻辑推理方面的提升空间。研究不仅为未来模型优化提供了具体指标,也为自动化测试技术的理论发展奠定了基础。长远来看,WebTestBench将推动AI在软件质量保障中的深度应用,加速软件工程自动化进程,具有重要的学术和工业价值。

深度分析

研究背景

随着大语言模型(如Codex、GPT系列)在代码生成和网页开发中的应用日益普及,自动化网页开发已成为研究热点。早期工作如Web2Code、DesignBench等,主要关注视觉相似性和静态内容检测,缺乏对复杂交互和逻辑约束的考虑。近年来,CUAs(Computer-Use Agents)被引入模拟用户行为,进行动态功能检测,但多依赖预定义用例,难以适应开放式环境。现有基准如GTArena、GUITestBench等,虽在操作成功率上取得一定进展,但在逻辑推理和长远交互方面仍存在不足。本文旨在弥补这些空白,提出涵盖逻辑约束的端到端评估体系。

核心问题

当前网页自动化测试多依赖静态视觉比对或手工设计的测试用例,难以应对复杂交互和潜在逻辑错误,尤其在AI生成网页的质量验证中表现不足。模型在Checklist生成的完整性、缺陷检测的准确性以及长远交互的稳定性方面存在明显瓶颈,严重限制了其工业应用潜力。如何设计一个全面、真实、具有逻辑约束的评估平台,成为亟待解决的问题。

核心创新

引入WebTestBench,系统覆盖多类别网页,结合长远交互和逻辑约束,创新点在于:

1)构建多样化样本库,模拟真实场景;

2)设计Checklist生成与缺陷检测的双阶段框架WebTester;

3)引入语义匹配和逻辑推理机制,提升检测能力;

4)系统评估模型在复杂环境中的表现,明确性能瓶颈。这些创新突破了传统静态检测的局限,为未来AI网页测试提供了新思路。

方法详解

  • �� 采集多样化网页开发指令,利用GPT-5.1标准化生成具体场景。• 利用Lovable.dev平台合成真实网页,确保内容丰富、交互复杂。• 人工标注测试Checklist,涵盖功能、约束、交互、内容四维,强调长远交互和逻辑约束。• 设计WebTester框架,包括Checklist生成(利用语义匹配)和缺陷检测(模拟人类交互,结合逻辑推理)。• 通过Playwright MCP实现自动化交互,采集模型输出,评估性能指标。• 采用F1、覆盖率、误判率等指标,系统分析模型在不同类别网页中的表现。

实验设计

在7个网页类别、100个样本上评估GPT-5.1、Claude等模型,指标包括Checklist覆盖率、F1、精确率、召回率。采用人工标注的Gold标准,比较模型生成的测试用例和检测结果。通过多轮交互优化,分析模型在逻辑约束和长远交互中的表现差异。还设置消融实验,验证语义匹配和逻辑推理机制的贡献。实验环境基于云端GPU,确保公平性和可复现性。

结果分析

所有模型F1值均低于30%,GPT-5.1最高26.4%,召回率33.3%。Checklist覆盖率平均65%,存在漏检。误判率高,精确率约30%,误报严重。模型在复杂网页和逻辑约束检测中表现不足,长远交互不稳定。结果显示,当前模型在自动化网页测试中的能力仍有限,需结合逻辑推理与交互理解技术提升性能。

应用场景

该平台可用于软件开发中的自动化测试验证,帮助开发者快速识别网页中的功能缺陷和逻辑错误。适用于AI辅助网页设计、质量保障和持续集成流程,降低人工测试成本,提升效率。未来可扩展到多模态内容检测和用户行为模拟,推动工业界智能化升级。

局限与展望

模型在复杂交互和逻辑推理方面表现仍不理想,存在漏检和误判。评估环境为模拟交互,未完全反映真实用户行为。模型推理速度较慢,难以满足工业级实时需求。未来需结合强化学习、多模态信息融合等技术,提升模型的适应性和效率。

通俗解读 非专业人士也能看懂

想象你在一家大型厨房里,厨师们要按照菜谱做菜。每个菜谱都写得很详细,但有时候菜谱里会漏掉一些步骤,比如什么时候放盐,或者什么时候需要搅拌。现在,厨房里有一个聪明的机器人厨师,它可以自己看菜谱,然后操作炉子、调料、搅拌,但它有点笨,容易漏掉步骤或搞错调料。WebTestBench就像这个厨房的评估系统,检测机器人厨师做菜是否完整、正确,确保每道菜都符合标准。它不仅看菜谱,还会检查菜的逻辑,比如不能同时放盐和糖,或者不能用错锅。这样一来,机器人厨师就能变得更聪明,做出更好吃的菜。这个系统帮助开发网页,就像厨房帮厨师检查菜肴一样,确保网页功能完整、逻辑合理、交互顺畅。

简单解释 像给14岁少年讲一样

想象你在学校的实验室里做科学实验。你有一本详细的实验手册,告诉你每一步该做什么,比如倒多少液体、打开哪个开关。但有时候,手册写得不够详细,你可能会忘记加某个步骤,或者做错顺序。现在,假设有一个聪明的助手,它可以帮你检查每一步是不是做对了,还能发现你漏掉的步骤。WebTestBench就像这个助手,它用来检查自动生成的网页是不是都能正常工作,功能是否完整,逻辑是否合理。它会模拟用户点击、输入,确保网页没有漏洞,就像老师检查你的实验步骤一样。虽然这个助手还不完美,但它让网页开发变得更可靠、更智能,就像有了这个助手,你的实验也会更成功!

原文摘要

The emergence of Large Language Models (LLMs) has catalyzed a paradigm shift in programming, giving rise to "vibe coding", where users can build complete projects and even control computers using natural language instructions. This paradigm has driven automated webpage development, but it introduces a new requirement about how to automatically verify whether the web functionalities are reliably implemented. Existing works struggle to adapt, relying on static visual similarity or predefined checklists that constrain their utility in open-ended environments. Furthermore, they overlook a vital aspect of software quality, namely latent logical constraints. To address these gaps, we introduce WebTestBench, a benchmark for evaluating end-to-end automated web testing. WebTestBench encompasses comprehensive dimensions across diverse web application categories. We decompose the testing process into two cascaded sub-tasks, checklist generation and defect detection, and propose WebTester, a baseline framework for this task. Evaluating popular LLMs with WebTester reveals severe challenges, including insufficient test completeness, detection bottlenecks, and long-horizon interaction unreliability. These findings expose a substantial gap between current computer-use agent capabilities and industrial-grade deployment demands. We hope that WebTestBench provides valuable insights and guidance for advancing end-to-end automated web testing. Our dataset and code are available at https://github.com/friedrichor/WebTestBench.

cs.SE cs.AI cs.CL cs.MA