Mind2Web 2: Evaluating Agentic Search with Agent-as-a-Judge
引入Mind2Web 2基准,结合Agent-as-a-Judge评估130个长时域、真实场景任务,达50-70%人类水平。
核心发现
方法论
本文提出基于树状评分标准的Agent-as-a-Judge框架,构建任务特定的评判代理,自动评估答案的正确性与来源归属。通过设计多层次的评分树,结合大模型(如OpenAI GPT-4)实现信息提取与验证,确保对复杂、时变答案的高效、可靠评估。构建130个高质量任务,耗费超千小时专家劳动,涵盖多领域,任务复杂度高(平均50节点,最大603节点)。评估十个前沿系统与人类表现,发现OpenAI Deep Research达成50-70%的人类水平,且时间仅为人类一半。
关键结果
- 最优系统OpenAI Deep Research在复杂长时任务中达成50-70%的准确率,平均耗时仅一半,显示出巨大潜力。
- 系统在时间变化和来源归属方面表现优异,显著优于传统方法和较早系统。
- 评估框架实现自动化、高可靠性,验证了树状评分和代理评判的有效性,为未来长时域评估提供新范式。
研究意义
本研究突破了现有短时、静态答案评估的局限,为长时域、动态信息检索提供了科学、客观的评估工具。推动智能系统在复杂任务中的应用,增强其可信度和实用性,具有深远的学术与产业价值。
技术贡献
提出基于树状结构的自动化评判框架,结合大模型实现多层次信息提取与验证,显著提升长时任务答案的评估效率与准确性。创新性在于自动生成评判标准和多源信息验证机制,突破了传统静态、单一答案评估的限制。
新颖性
首次系统性引入Agent-as-a-Judge框架,结合树状评分和自动化脚本生成,适应长时、动态、多源信息的复杂任务场景,填补了长时域自动评估的空白。
局限性
- 评判代理依赖预定义的评分树,可能在极端复杂或模糊任务中表现不足。
- 任务设计耗时较长,专家劳动成本高,难以快速扩展到更大规模。
- 模型在极端时间变化或多源冲突信息中可能出现误判,需进一步优化鲁棒性。
未来方向
未来将探索自适应评分树自动生成,结合强化学习优化评判策略,提升系统的泛化能力。同时,扩展多模态信息验证,增强对多源、多格式数据的处理能力,以适应更复杂的实际应用场景。
AI 总览摘要
随着人工智能在信息检索与知识获取中的不断突破,传统的网页搜索逐渐难以满足复杂、长时域任务的需求。现有评估方法多局限于静态、短时任务,难以反映系统在动态、多源、多步骤环境中的表现。为应对这一挑战,本文提出了Mind2Web 2基准,涵盖130个高质量、真实场景、长时域任务,耗费超过千小时专家劳动,确保任务的复杂性与真实性。
在评估体系方面,作者创新性地引入了Agent-as-a-Judge框架,利用树状评分标准,自动评估答案的正确性与来源归属。该方法结合大模型(如GPT-4)实现信息提取、验证与多层次评分,极大提升了评估的自动化与可靠性。通过对十个前沿系统与人类表现的系统性比较,结果显示最优系统在复杂任务中达成50-70%的准确率,且耗时仅为人类一半,展现出巨大潜力。
这一研究不仅为长时域、动态信息检索提供了科学评估工具,也为未来智能系统的可信性与实用性奠定基础。尽管如此,评判代理仍依赖预定义评分树,未来需探索自适应生成与鲁棒性提升。整体而言,本文为推动智能信息检索向更复杂、更真实场景发展提供了重要技术支撑与理论基础。
深度分析
研究背景
近年来,网页搜索技术经历了从TF-IDF、PageRank到学习排序的演变,极大提升了信息检索效率。然而,用户仍需手动筛选和整合网页信息,面对复杂问题时负担沉重。大规模语言模型(如GPT系列)推动了代理式搜索的发展,系统能自主浏览网页、整合信息,显著提升效率。现有评估多集中于短时、静态任务,缺乏对长时、动态场景的系统性衡量,限制了技术的推广应用。
核心问题
当前评估体系难以应对长时、动态、多源信息交互的复杂任务。传统指标多依赖单一答案或静态网页,无法反映系统在真实环境中的表现。长时任务涉及多步骤、多网页、多信息源,答案变化频繁,评估难度大,亟需新的自动化、可靠的评估方法以推动技术发展。
核心创新
本文提出基于树状评分的Agent-as-a-Judge框架,自动生成任务特定的评分标准,结合大模型实现信息提取与验证,支持长时、动态任务的自动评估。创新点包括:1)多层次评分树设计,确保评判的细粒度和全面性;2)自动化脚本生成与自我优化,降低人工成本;3)多源信息验证机制,提升答案的可信度。这些创新突破了静态、单一答案评估的局限,适应复杂场景。
方法详解
- �� 构建130个真实长时任务,涵盖多领域,专家劳动超过千小时。• 设计树状评分标准,定义每个节点的评判条件,确保评估的细粒度与层次性。• 利用大模型(如GPT-4)实现信息提取(Extractor)和验证(Verifier),自动执行评分。• 生成评判脚本,通过自我调试和专家验证,确保脚本的准确性和通用性。• 评估十个系统与人类表现,统计准确率、耗时等指标,分析系统优劣。• 采用Pass@3等指标,衡量多次尝试成功率,确保评估的稳健性。
实验设计
采用真实长时任务集,比较多种系统(如OpenAI Deep Research、Perplexity Search等)与人类表现。指标包括Partial Completion、Success Rate、耗时和答案长度。通过多轮评估,验证系统在时间变化、信息验证方面的能力。设置不同参数(如搜索深度、模型版本),进行消融分析,确保结果的可靠性。实验还包括对评判脚本的准确性验证,确保自动评估的可信度。
结果分析
OpenAI Deep Research在长时任务中达成50-70%的准确率,平均耗时为人类一半,显著优于其他系统。系统在时间变化和信息来源归属方面表现优异,验证了Agent-as-a-Judge的有效性。评估结果表明,长时、多源、多步骤任务中,系统仍有提升空间,但已有明显突破,为未来发展提供方向。
应用场景
该评估框架可用于开发更智能、更可信的长时域搜索系统,广泛应用于科研、商务、法律等领域的复杂信息检索。未来,结合多模态数据和强化学习,将推动系统在实时决策、知识更新等方面的能力提升,带来行业变革。
局限与展望
目前评判脚本依赖预定义评分树,难以应对极端复杂或模糊任务。专家劳动成本高,扩展性有限。模型在极端时间变化或多源信息冲突时可能误判,需优化鲁棒性。未来需开发自适应、可扩展的评估机制,以应对更复杂场景。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,工厂里有许多不同的机器和流程,每天都在不断变化。你需要确保每个产品都符合标准,流程顺畅。传统方法就像用一只手工检查每个产品,费时又容易出错。而现在,有了智能机器人,它可以自动检测每个环节,快速判断产品是否合格,还能追溯每个部分的来源。这个机器人就像论文中的Agent-as-a-Judge,它用一套规则(评分树)来判断答案的正确性和来源,确保每个环节都符合要求。这样,工厂的效率大大提高,产品质量也更有保障。这个比喻帮助我们理解,复杂的任务需要智能系统像工厂里的机器人一样,自动、准确地完成评估工作。
简单解释 像给14岁少年讲一样
想象你在学校里参加一个超级难的寻宝游戏,你要找到很多线索,最后拼出答案。这个游戏很复杂,有很多步骤,要去不同的地方,找到不同的线索,还要确认每个线索是不是正确的。以前,我们只能自己一个一个去找,花很多时间,也容易搞错。现在,有个聪明的机器人助手,它可以帮你检查每个线索是不是正确,还能告诉你每个线索来自哪里。这个助手用了一套特别的规则,就像游戏里的评分标准,确保每个线索都是真的、可靠的。这样,你就能更快、更准确地完成任务,而且还不用担心出错了。这就像论文中的方法,用智能系统帮忙评估复杂的长时间任务,让工作变得更简单、更可靠。
术语表
Agent-as-a-Judge (代理评判)
一种利用大模型自动评估复杂答案正确性和来源归属的方法,基于树状评分标准实现多层次判断。
论文提出的自动评估框架核心技术。
树状评分标准 (Tree-structured Rubric)
一种将评判标准层级化、结构化的评分体系,每个节点代表一个评判条件,最终汇总得出整体评价。
用于自动化、多源、多步骤答案评估。
长时任务 (Long-horizon Tasks)
需要多步骤、多网页、多信息源交互,耗时较长的复杂任务,超出传统短时评估范围。
本文评估的主要对象。
信息提取 (Information Extraction)
利用大模型自动从答案文本中提取结构化信息,如网址、价格等。
评判脚本中的关键步骤。
验证机制 (Verification Mechanism)
通过模型和网页截图验证信息的真实性和来源归属,确保答案可靠。
保证答案正确性的重要环节。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升评判代理在极端复杂或模糊任务中的鲁棒性?
- 2 多源、多模态信息的验证机制如何结合深度学习进行优化?
- 3 未来能否实现端到端自动化的长时任务评估体系?
应用场景
近期应用
智能信息检索系统
可用于科研、法律、商务等领域的长时信息搜集与验证,提升效率与可信度。
自动化内容审核
在内容生成平台自动评估内容的真实性与来源,确保信息质量。
远期愿景
智能决策支持
结合长时任务评估,推动自动化决策系统在金融、医疗等行业的应用,实现自主决策。
原文摘要
Agentic search such as Deep Research systems-where agents autonomously browse the web, synthesize information, and return comprehensive citation-backed answers-represents a major shift in how users interact with web-scale information. While promising greater efficiency and cognitive offloading, the growing complexity and open-endedness of agentic search have outpaced existing evaluation benchmarks and methodologies, which largely assume short search horizons and static answers. In this paper, we introduce Mind2Web 2, a benchmark of 130 realistic, high-quality, and long-horizon tasks that require real-time web browsing and extensive information synthesis, constructed with over 1000 hours of human labor. To address the challenge of evaluating time-varying and complex answers, we propose a novel Agent-as-a-Judge framework. Our method constructs task-specific judge agents based on a tree-structured rubric design to automatically assess both answer correctness and source attribution. We conduct a comprehensive evaluation of ten frontier agentic search systems and human performance, along with a detailed error analysis to draw insights for future development. The best-performing system, OpenAI Deep Research, can already achieve 50-70% of human performance while spending half the time, highlighting its great potential. Altogether, Mind2Web 2 provides a rigorous foundation for developing and benchmarking the next generation of agentic search systems.