Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge

TL;DR

引入Mind2Web 2基准,结合Agent-as-a-Judge评估130个长时域、真实场景任务,达50-70%人类水平。

cs.AI 🔴 高级 2025-06-27 40 次浏览
Boyu Gou Zanming Huang Yuting Ning Yu Gu Michael Lin Weijian Qi Andrei Kopanev Botao Yu Bernal Jiménez Gutiérrez Yiheng Shu Chan Hee Song Jiaman Wu Shijie Chen Hanane Nour Moussa Tianshu Zhang Jian Xie Yifei Li Tianci Xue Zeyi Liao Kai Zhang Boyuan Zheng Zhaowei Cai Viktor Rozgic Morteza Ziyadi Huan Sun Yu Su
人工智能 信息检索 评估方法 长时任务 自动化评估

核心发现

方法论

本文提出基于树状评分标准的Agent-as-a-Judge框架,构建任务特定的评判代理,自动评估答案的正确性与来源归属。通过设计多层次的评分树,结合大模型(如OpenAI GPT-4)实现信息提取与验证,确保对复杂、时变答案的高效、可靠评估。构建130个高质量任务,耗费超千小时专家劳动,涵盖多领域,任务复杂度高(平均50节点,最大603节点)。评估十个前沿系统与人类表现,发现OpenAI Deep Research达成50-70%的人类水平,且时间仅为人类一半。

关键结果

  • 最优系统OpenAI Deep Research在复杂长时任务中达成50-70%的准确率,平均耗时仅一半,显示出巨大潜力。
  • 系统在时间变化和来源归属方面表现优异,显著优于传统方法和较早系统。
  • 评估框架实现自动化、高可靠性,验证了树状评分和代理评判的有效性,为未来长时域评估提供新范式。

研究意义

本研究突破了现有短时、静态答案评估的局限,为长时域、动态信息检索提供了科学、客观的评估工具。推动智能系统在复杂任务中的应用,增强其可信度和实用性,具有深远的学术与产业价值。

技术贡献

提出基于树状结构的自动化评判框架,结合大模型实现多层次信息提取与验证,显著提升长时任务答案的评估效率与准确性。创新性在于自动生成评判标准和多源信息验证机制,突破了传统静态、单一答案评估的限制。

新颖性

首次系统性引入Agent-as-a-Judge框架,结合树状评分和自动化脚本生成,适应长时、动态、多源信息的复杂任务场景,填补了长时域自动评估的空白。

局限性

  • 评判代理依赖预定义的评分树,可能在极端复杂或模糊任务中表现不足。
  • 任务设计耗时较长,专家劳动成本高,难以快速扩展到更大规模。
  • 模型在极端时间变化或多源冲突信息中可能出现误判,需进一步优化鲁棒性。

未来方向

未来将探索自适应评分树自动生成,结合强化学习优化评判策略,提升系统的泛化能力。同时,扩展多模态信息验证,增强对多源、多格式数据的处理能力,以适应更复杂的实际应用场景。

AI 总览摘要

随着人工智能在信息检索与知识获取中的不断突破,传统的网页搜索逐渐难以满足复杂、长时域任务的需求。现有评估方法多局限于静态、短时任务,难以反映系统在动态、多源、多步骤环境中的表现。为应对这一挑战,本文提出了Mind2Web 2基准,涵盖130个高质量、真实场景、长时域任务,耗费超过千小时专家劳动,确保任务的复杂性与真实性。

在评估体系方面,作者创新性地引入了Agent-as-a-Judge框架,利用树状评分标准,自动评估答案的正确性与来源归属。该方法结合大模型(如GPT-4)实现信息提取、验证与多层次评分,极大提升了评估的自动化与可靠性。通过对十个前沿系统与人类表现的系统性比较,结果显示最优系统在复杂任务中达成50-70%的准确率,且耗时仅为人类一半,展现出巨大潜力。

这一研究不仅为长时域、动态信息检索提供了科学评估工具,也为未来智能系统的可信性与实用性奠定基础。尽管如此,评判代理仍依赖预定义评分树,未来需探索自适应生成与鲁棒性提升。整体而言,本文为推动智能信息检索向更复杂、更真实场景发展提供了重要技术支撑与理论基础。

深度分析

研究背景

近年来,网页搜索技术经历了从TF-IDF、PageRank到学习排序的演变,极大提升了信息检索效率。然而,用户仍需手动筛选和整合网页信息,面对复杂问题时负担沉重。大规模语言模型(如GPT系列)推动了代理式搜索的发展,系统能自主浏览网页、整合信息,显著提升效率。现有评估多集中于短时、静态任务,缺乏对长时、动态场景的系统性衡量,限制了技术的推广应用。

核心问题

当前评估体系难以应对长时、动态、多源信息交互的复杂任务。传统指标多依赖单一答案或静态网页,无法反映系统在真实环境中的表现。长时任务涉及多步骤、多网页、多信息源,答案变化频繁,评估难度大,亟需新的自动化、可靠的评估方法以推动技术发展。

核心创新

本文提出基于树状评分的Agent-as-a-Judge框架,自动生成任务特定的评分标准,结合大模型实现信息提取与验证,支持长时、动态任务的自动评估。创新点包括:1)多层次评分树设计,确保评判的细粒度和全面性;2)自动化脚本生成与自我优化,降低人工成本;3)多源信息验证机制,提升答案的可信度。这些创新突破了静态、单一答案评估的局限,适应复杂场景。

方法详解

  • �� 构建130个真实长时任务,涵盖多领域,专家劳动超过千小时。• 设计树状评分标准,定义每个节点的评判条件,确保评估的细粒度与层次性。• 利用大模型(如GPT-4)实现信息提取(Extractor)和验证(Verifier),自动执行评分。• 生成评判脚本,通过自我调试和专家验证,确保脚本的准确性和通用性。• 评估十个系统与人类表现,统计准确率、耗时等指标,分析系统优劣。• 采用Pass@3等指标,衡量多次尝试成功率,确保评估的稳健性。

实验设计

采用真实长时任务集,比较多种系统(如OpenAI Deep Research、Perplexity Search等)与人类表现。指标包括Partial Completion、Success Rate、耗时和答案长度。通过多轮评估,验证系统在时间变化、信息验证方面的能力。设置不同参数(如搜索深度、模型版本),进行消融分析,确保结果的可靠性。实验还包括对评判脚本的准确性验证,确保自动评估的可信度。

结果分析

OpenAI Deep Research在长时任务中达成50-70%的准确率,平均耗时为人类一半,显著优于其他系统。系统在时间变化和信息来源归属方面表现优异,验证了Agent-as-a-Judge的有效性。评估结果表明,长时、多源、多步骤任务中,系统仍有提升空间,但已有明显突破,为未来发展提供方向。

应用场景

该评估框架可用于开发更智能、更可信的长时域搜索系统,广泛应用于科研、商务、法律等领域的复杂信息检索。未来,结合多模态数据和强化学习,将推动系统在实时决策、知识更新等方面的能力提升,带来行业变革。

局限与展望

目前评判脚本依赖预定义评分树,难以应对极端复杂或模糊任务。专家劳动成本高,扩展性有限。模型在极端时间变化或多源信息冲突时可能误判,需优化鲁棒性。未来需开发自适应、可扩展的评估机制,以应对更复杂场景。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有许多不同的机器和流程,每天都在不断变化。你需要确保每个产品都符合标准,流程顺畅。传统方法就像用一只手工检查每个产品,费时又容易出错。而现在,有了智能机器人,它可以自动检测每个环节,快速判断产品是否合格,还能追溯每个部分的来源。这个机器人就像论文中的Agent-as-a-Judge,它用一套规则(评分树)来判断答案的正确性和来源,确保每个环节都符合要求。这样,工厂的效率大大提高,产品质量也更有保障。这个比喻帮助我们理解,复杂的任务需要智能系统像工厂里的机器人一样,自动、准确地完成评估工作。

简单解释 像给14岁少年讲一样

想象你在学校里参加一个超级难的寻宝游戏,你要找到很多线索,最后拼出答案。这个游戏很复杂,有很多步骤,要去不同的地方,找到不同的线索,还要确认每个线索是不是正确的。以前,我们只能自己一个一个去找,花很多时间,也容易搞错。现在,有个聪明的机器人助手,它可以帮你检查每个线索是不是正确,还能告诉你每个线索来自哪里。这个助手用了一套特别的规则,就像游戏里的评分标准,确保每个线索都是真的、可靠的。这样,你就能更快、更准确地完成任务,而且还不用担心出错了。这就像论文中的方法,用智能系统帮忙评估复杂的长时间任务,让工作变得更简单、更可靠。

术语表

Agent-as-a-Judge (代理评判)

一种利用大模型自动评估复杂答案正确性和来源归属的方法,基于树状评分标准实现多层次判断。

论文提出的自动评估框架核心技术。

树状评分标准 (Tree-structured Rubric)

一种将评判标准层级化、结构化的评分体系,每个节点代表一个评判条件,最终汇总得出整体评价。

用于自动化、多源、多步骤答案评估。

长时任务 (Long-horizon Tasks)

需要多步骤、多网页、多信息源交互,耗时较长的复杂任务,超出传统短时评估范围。

本文评估的主要对象。

信息提取 (Information Extraction)

利用大模型自动从答案文本中提取结构化信息,如网址、价格等。

评判脚本中的关键步骤。

验证机制 (Verification Mechanism)

通过模型和网页截图验证信息的真实性和来源归属,确保答案可靠。

保证答案正确性的重要环节。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升评判代理在极端复杂或模糊任务中的鲁棒性?
  • 2 多源、多模态信息的验证机制如何结合深度学习进行优化?
  • 3 未来能否实现端到端自动化的长时任务评估体系?

应用场景

近期应用

智能信息检索系统

可用于科研、法律、商务等领域的长时信息搜集与验证,提升效率与可信度。

自动化内容审核

在内容生成平台自动评估内容的真实性与来源,确保信息质量。

远期愿景

智能决策支持

结合长时任务评估,推动自动化决策系统在金融、医疗等行业的应用,实现自主决策。

原文摘要

Agentic search such as Deep Research systems-where agents autonomously browse the web, synthesize information, and return comprehensive citation-backed answers-represents a major shift in how users interact with web-scale information. While promising greater efficiency and cognitive offloading, the growing complexity and open-endedness of agentic search have outpaced existing evaluation benchmarks and methodologies, which largely assume short search horizons and static answers. In this paper, we introduce Mind2Web 2, a benchmark of 130 realistic, high-quality, and long-horizon tasks that require real-time web browsing and extensive information synthesis, constructed with over 1000 hours of human labor. To address the challenge of evaluating time-varying and complex answers, we propose a novel Agent-as-a-Judge framework. Our method constructs task-specific judge agents based on a tree-structured rubric design to automatically assess both answer correctness and source attribution. We conduct a comprehensive evaluation of ten frontier agentic search systems and human performance, along with a detailed error analysis to draw insights for future development. The best-performing system, OpenAI Deep Research, can already achieve 50-70% of human performance while spending half the time, highlighting its great potential. Altogether, Mind2Web 2 provides a rigorous foundation for developing and benchmarking the next generation of agentic search systems.

cs.AI cs.CL