DeepResearch Bench: A Comprehensive Benchmark for Deep Research Agents

TL;DR

DeepResearch Bench提供100个博士级任务,评估深度研究代理的报告生成和信息检索能力。

cs.CL 🔴 高级 2025-06-13 7 次浏览
Mingxuan Du Benfeng Xu Chiwei Zhu Xiaorui Wang Zhendong Mao
深度学习 大语言模型 信息检索 自动化研究 基准测试

核心发现

方法论

本文提出了DeepResearch Bench基准,包含100个博士级研究任务,使用RACE和FACT两种新方法评估深度研究代理。RACE通过动态权重和自适应标准评估报告质量,而FACT则通过评估有效引用数量和准确性来评估信息检索能力。

关键结果

  • RACE框架中,Gemini-2.5-Pro Deep Research在报告质量上表现最佳,得分为48.88。
  • FACT框架中,Gemini-2.5-Pro Deep Research在有效引用数量上显著领先,平均达到111.21。
  • Perplexity Deep Research在引用准确性上表现突出,得分为90.24。

研究意义

该研究为深度研究代理提供了首个系统化评估基准,填补了现有框架无法全面评估代理多方面能力的空白。通过公开基准和评估协议,促进了实际应用中基于LLM的代理的发展。

技术贡献

提出了RACE和FACT两个框架,分别用于评估报告生成质量和信息检索能力。RACE通过动态权重和自适应标准提供了更灵活的评估方法,而FACT则通过自动化步骤评估引用的准确性和丰富性。

新颖性

这是首次为深度研究代理提供全面评估基准,创新性地结合了动态权重和自适应标准,以更好地反映人类判断。

局限性

  • RACE框架在某些任务中可能无法完全捕捉报告质量的细微差异。
  • FACT框架依赖于Judge LLM的判断,可能会受到模型性能的限制。

未来方向

未来研究可以探索更复杂的任务和多语言支持,以进一步提高代理的评估精度和适用性。

AI 总览摘要

在当今信息爆炸的时代,深度研究代理通过自动化多步骤的网络探索和信息检索,大大提高了研究效率。然而,缺乏系统的评估基准限制了这些代理的进一步发展。DeepResearch Bench正是为了解决这一问题而提出的,它包含100个由领域专家精心设计的博士级研究任务,覆盖22个不同领域。

本文提出了两种新颖的方法来评估深度研究代理的能力。RACE框架通过动态权重和自适应标准评估报告生成质量,而FACT框架则通过评估有效引用数量和准确性来评估信息检索能力。实验结果表明,Gemini-2.5-Pro Deep Research在这两个框架中均表现优异,特别是在有效引用数量上显著领先。

通过公开DeepResearch Bench和关键评估组件,本文为基于LLM的代理的发展提供了重要支持。这一研究不仅填补了现有框架的空白,还为未来的研究提供了新的方向,特别是在更复杂任务和多语言支持方面。

深度分析

研究背景

随着大语言模型(LLM)能力的全面提升,基于LLM的代理系统被设计用于解决越来越复杂的任务。深度研究代理(DRA)是其中最广泛使用的代理之一,用户可以利用这些代理显著提高生产力。然而,全面评估这些DRA的能力面临着巨大的挑战,因为其内部推理和信息检索过程不透明,最终生成的报告成为评估其整体性能的主要接口。

核心问题

现有评估框架通常无法全面评估代理的多方面能力,往往仅关注于孤立的能力,如网页浏览和信息检索,或与实时信息获取无关的生成能力。这种评估缺口限制了深度研究代理的进一步发展。

核心创新

DeepResearch Bench通过引入RACE和FACT两个框架,首次为深度研究代理提供了全面评估基准。RACE通过动态权重和自适应标准提供了更灵活的评估方法,而FACT则通过自动化步骤评估引用的准确性和丰富性。

方法详解

  • �� RACE框架:通过动态权重和自适应标准评估报告质量。• FACT框架:通过评估有效引用数量和准确性来评估信息检索能力。• 数据集:包含100个博士级研究任务,覆盖22个不同领域。• 实验:评估四个早期发布的深度研究代理,比较其在RACE和FACT框架中的表现。

实验设计

实验设计包括使用RACE和FACT框架评估四个早期发布的深度研究代理:Gemini-2.5-Pro Deep Research、OpenAI Deep Research、Grok Deeper Search和Perplexity Deep Research。实验使用的评估指标包括报告质量、引用准确性和有效引用数量。

结果分析

实验结果表明,Gemini-2.5-Pro Deep Research在RACE和FACT框架中均表现优异,特别是在有效引用数量上显著领先,平均达到111.21。Perplexity Deep Research在引用准确性上表现突出,得分为90.24。

应用场景

该基准可用于评估和改进深度研究代理在多领域的应用,如学术研究、市场分析和技术报告生成。通过提高代理的评估精度和适用性,可以更好地满足实际应用中的需求。

局限与展望

RACE框架在某些任务中可能无法完全捕捉报告质量的细微差异,而FACT框架依赖于Judge LLM的判断,可能会受到模型性能的限制。未来研究可以探索更复杂的任务和多语言支持。

通俗解读 非专业人士也能看懂

想象一下你在一个巨大的图书馆里寻找信息。传统上,你需要自己去每个书架上找书,阅读并总结信息,这可能需要几个小时。而深度研究代理就像一个超级图书管理员,它可以在几分钟内自动找到相关书籍,提取关键信息,并为你生成一个详细的报告。DeepResearch Bench就是为了评估这些超级图书管理员的效率和准确性而设计的。通过一系列精心设计的任务和评估标准,我们可以判断这些代理在不同领域的表现,从而帮助它们更好地为我们服务。

简单解释 像给14岁少年讲一样

想象你在玩一个大型多人在线游戏,你需要快速找到游戏中的隐藏宝藏。传统方法是自己在地图上到处找,但这可能需要很长时间。深度研究代理就像游戏中的一个超级助手,它可以在几分钟内找到所有隐藏的宝藏,并告诉你如何获得它们。DeepResearch Bench就是用来评估这些超级助手的能力,看它们能多快、多准确地找到宝藏。通过这个基准,我们可以知道哪个助手表现最好,并帮助它们变得更强大!

术语表

深度研究代理 (Deep Research Agent)

基于大语言模型的代理,能够自动化多步骤的网络探索和信息检索。

用于生成分析级别的报告。

RACE框架

一种评估报告生成质量的方法,使用动态权重和自适应标准。

用于评估代理生成的研究报告。

FACT框架

一种评估信息检索能力的方法,通过评估有效引用数量和准确性。

用于评估代理的信息检索和引用能力。

有效引用 (Effective Citation)

在报告中被验证为准确支持声明的引用。

用于评估代理的信息检索能力。

动态权重 (Dynamic Weighting)

根据任务生成特定的权重,用于评估报告质量。

在RACE框架中用于评估报告生成质量。

开放问题 这项研究留下的未解疑问

  • 1 如何在多语言环境中提高深度研究代理的评估精度?
  • 2 现有框架在处理更复杂任务时的局限性是什么?

应用场景

近期应用

学术研究

研究人员可以使用深度研究代理快速生成文献综述和研究报告,提高研究效率。

远期愿景

自动化市场分析

企业可以利用深度研究代理进行市场趋势分析和竞争对手研究,优化商业决策。

原文摘要

Deep Research Agents are a prominent category of LLM-based agents. By autonomously orchestrating multistep web exploration, targeted retrieval, and higher-order synthesis, they transform vast amounts of online information into analyst-grade, citation-rich reports--compressing hours of manual desk research into minutes. However, a comprehensive benchmark for systematically evaluating the capabilities of these agents remains absent. To bridge this gap, we present DeepResearch Bench, a benchmark consisting of 100 PhD-level research tasks, each meticulously crafted by domain experts across 22 distinct fields. Evaluating DRAs is inherently complex and labor-intensive. We therefore propose two novel methodologies that achieve strong alignment with human judgment. The first is a reference-based method with adaptive criteria to assess the quality of generated research reports. The other framework is introduced to evaluate DRA's information retrieval and collection capabilities by assessing its effective citation count and overall citation accuracy. We have open-sourced DeepResearch Bench and key components of these frameworks at https://github.com/Ayanami0730/deep_research_bench to accelerate the development of practical LLM-based agents.

cs.CL cs.IR