Benchmarking Deep Search over Heterogeneous Enterprise Data

TL;DR

HERB基准测试揭示了RAG系统在异构企业数据上的检索瓶颈,平均得分32.96。

cs.CL 🔴 高级 2025-06-29 4 次浏览
Prafulla Kumar Choubey Xiangyu Peng Shilpa Bhagavath Kung-Hsiang Huang Caiming Xiong Chien-Sheng Wu
深度搜索 异构数据 企业应用 多跳推理 检索增强生成

核心发现

方法论

研究采用HERB基准测试,模拟企业工作流程,生成合成数据以评估RAG系统。该方法涉及多源、多跳推理,涵盖文档、会议记录、Slack消息等异构数据源。通过合成数据管道,生成了39,190个企业工件,支持细粒度评估。

关键结果

  • 即使是表现最好的RAG方法,在HERB基准上的平均得分仅为32.96,表明现有方法在深度搜索和检索所有必要证据方面存在困难。
  • ReAct代理在检索和推理结合上表现出色,得分提高12.35点,达到32.96。
  • Gemini-2.5-Flash在长上下文推理中表现最佳,得分76.55,但仍有改进空间。

研究意义

该研究为RAG系统提供了一个新的评估基准,填补了在异构企业数据上进行深度搜索的空白。通过模拟真实企业环境,HERB基准测试揭示了当前RAG方法在处理复杂企业查询时的局限性,尤其是在检索和多跳推理方面的瓶颈。

技术贡献

HERB基准测试通过生成合成企业数据和多跳问题,提供了一个独特的评估平台。它强调了RAG系统在异构数据源上的检索和推理能力,推动了对长上下文推理的研究。

新颖性

HERB是第一个支持跨异构数据格式隐式推理的RAG基准。与现有数据集不同,它集成了结构化和非结构化数据,支持更深层次的推理。

局限性

  • 现有RAG方法在检索所有必要证据方面存在困难,导致推理仅基于部分上下文。
  • 在识别不可回答查询时,系统表现不一致,存在较大改进空间。

未来方向

未来研究可以探索改进检索系统以支持深度搜索,并开发更有效的多跳推理方法。此外,进一步优化长上下文推理能力也是一个重要方向。

AI 总览摘要

在现代企业中,处理异构数据源的能力至关重要。然而,现有的RAG系统在处理复杂的企业查询时表现不佳。为此,研究人员开发了HERB基准测试,模拟企业工作流程,生成合成数据以评估RAG系统的性能。HERB基准测试揭示了现有方法在深度搜索和检索所有必要证据方面的局限性,尤其是在处理多跳推理时的瓶颈。

研究表明,即使是最先进的RAG方法,其在HERB基准上的平均得分仅为32.96,远低于预期。ReAct代理通过结合检索和推理,显著提高了性能,显示出在复杂企业查询中的潜力。长上下文推理的评估也显示出显著的挑战,尽管Gemini-2.5-Flash表现最佳,但仍有改进空间。

HERB基准测试的推出为RAG系统的评估提供了新的视角,强调了在异构数据源上进行深度搜索的必要性。未来的研究方向包括改进检索系统和多跳推理方法,以提高RAG系统在复杂企业环境中的性能。

深度分析

研究背景

近年来,RAG系统在企业应用中得到了广泛应用,尤其是在需要基于事实的响应任务中。然而,现有的多跳RAG基准通常仅限于文档集群,缺乏对异构数据源的深度搜索能力。HERB基准测试通过模拟企业工作流程,生成合成数据,填补了这一空白。

核心问题

现有RAG方法在处理异构企业数据时面临挑战,尤其是在检索所有必要证据以进行多跳推理时。检索瓶颈导致推理仅基于部分上下文,从而显著降低了性能。

核心创新

HERB基准测试通过生成合成企业数据和多跳问题,提供了一个独特的评估平台。它集成了结构化和非结构化数据,支持更深层次的推理,填补了现有RAG基准的空白。

方法详解

  • �� 使用合成数据管道模拟企业工作流程
  • �� 生成39,190个企业工件,涵盖文档、会议记录、Slack消息等
  • �� 设计多跳问题,支持细粒度评估
  • �� 评估RAG系统的检索和推理能力

实验设计

实验使用HERB基准测试评估多种RAG系统和LLM配置。数据集包括39,190个企业工件和815个可回答查询。评估指标包括平均性能得分和不可回答查询的识别能力。

结果分析

实验结果显示,即使是表现最好的RAG方法,其平均得分仅为32.96。ReAct代理通过结合检索和推理,显著提高了性能。长上下文推理的评估也显示出显著的挑战。

应用场景

HERB基准测试可用于评估RAG系统在复杂企业环境中的性能,帮助开发更有效的检索和推理方法,提高企业数据处理能力。

局限与展望

现有RAG方法在检索所有必要证据方面存在困难,导致推理仅基于部分上下文。此外,系统在识别不可回答查询时表现不一致,存在较大改进空间。

通俗解读 非专业人士也能看懂

想象一下你在一个大型企业工作,每天需要处理大量的文档、会议记录和聊天记录。HERB基准测试就像一个智能助手,帮助你在这些信息中找到你需要的答案。它通过模拟企业的工作流程,生成合成数据,评估RAG系统的性能。尽管现有的方法在处理这些复杂数据时表现不佳,但HERB基准测试为改进这些系统提供了新的视角。

简单解释 像给14岁少年讲一样

想象你在学校做一个大型项目,需要从不同的书籍、笔记和网上资料中找答案。HERB基准测试就像一个超级搜索引擎,帮助你找到所有相关的信息。虽然现有的方法在处理这些复杂数据时表现不佳,但HERB基准测试为改进这些系统提供了新的视角。未来,我们可以期待更聪明的系统来帮助我们处理这些复杂的信息!

术语表

RAG (检索增强生成)

一种结合检索和生成的技术,用于从大量数据中找到并生成答案。

在论文中用于评估系统在企业数据上的性能。

HERB (异构企业RAG基准)

一个新的基准测试,用于评估RAG系统在异构企业数据上的性能。

用于模拟企业工作流程,生成合成数据。

多跳推理

一种推理方法,需要跨多个信息源进行推理以得出结论。

在处理复杂企业查询时尤为重要。

合成数据管道

一种生成模拟数据的流程,用于创建评估基准。

用于生成HERB基准测试中的企业数据。

ReAct代理

一种结合检索和推理的代理方法,提升了RAG系统的性能。

在实验中表现出色,显著提高了性能。

开放问题 这项研究留下的未解疑问

  • 1 如何改进RAG系统的检索能力以支持更深度的搜索?现有方法在处理复杂企业查询时表现不佳。
  • 2 如何提高系统识别不可回答查询的能力?现有方法在这方面表现不一致。

应用场景

近期应用

企业数据处理

HERB基准测试可用于评估和改进企业数据处理系统,帮助企业更有效地处理复杂查询。

远期愿景

智能信息检索

未来,改进的RAG系统可以在更广泛的领域中实现更智能的信息检索,帮助各行业提高效率。

原文摘要

We present a new benchmark for evaluating Deep Search--a realistic and complex form of retrieval-augmented generation (RAG) that requires source-aware, multi-hop reasoning over diverse, sparsed, but related sources. These include documents, meeting transcripts, Slack messages, GitHub, and URLs, which vary in structure and often contain human-to-human interactions. We build it using a synthetic data pipeline that simulates business workflows across product planning, development, and support stages, generating interconnected content with realistic noise and multi-hop questions with guaranteed ground-truth answers. We release our benchmark with both answerable and unanswerable queries, and retrieval pool of 39,190 enterprise artifacts, enabling fine-grained evaluation of long-context LLM and RAG systems. Our experiments reveal that even the best-performing agentic RAG methods achieve an average performance score of 32.96 on our benchmark. With further analysis, we highlight retrieval as the main bottleneck: existing methods struggle to conduct deep searches and retrieve all necessary evidence. Consequently, they often reason over partial context, leading to significant performance degradation.

cs.CL cs.AI