Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

TL;DR

提出Q-CARE,基于查询覆盖率与声明可验证性实现无参考、细粒度RAG评估,超越现有指标。

cs.AI 🔴 高级 2026-07-31 41 次浏览
Jeonghwan Choi Taewon Yun Minjeong Ban Gyeonghun Sun Jae-Gil Lee Hwanjun Song
信息检索 自然语言处理 模型评估 知识验证 深度学习

核心发现

方法论

Q-CARE通过三阶段实现:第一阶段将查询与回答分解为子问句和原子声明;第二阶段利用对检索文档、子问句和声明的对齐检查,评估查询覆盖率与声明支持度;第三阶段整合这些信号,计算覆盖率相关的检索指标(C-Prec@k、C-nDCG@k)及声明层面生成指标(完整性、简洁性、可验证性)。该框架采用LLM(如Qwen-30B)自动执行分解与对齐,支持多样查询类型,完全无参考。实验证明Q-CARE在八个公开数据集上与人工评价的相关性优于RAGEval、RAGChecker等指标。

关键结果

  • Q-CARE在8个数据集上与人类评价的相关系数达0.69,明显优于现有指标(如RAGEval的0.29),验证其优越的评估一致性。覆盖率指标(C-Prec@k、C-nDCG@k)在不同查询类型中表现稳定,尤其在开放式问答中优于传统指标。声明级指标(完整性、简洁性、可验证性)有效捕捉生成质量,显著提升细粒度诊断能力。多模型实验显示,Qwen-30B作为基础模型能在保证效率的同时保持高评估相关性,模型规模越大,性能越优。

研究意义

该研究突破了现有RAG评估的局限,实现了跨任务、跨查询类型的无参考、细粒度评估,为大规模知识增强模型的性能监控提供了可靠工具。其基于查询覆盖与声明验证的统一原则,有助于推动自动化、标准化的模型评估体系,提升模型的事实性与可靠性,具有重要的理论与应用价值。未来可结合多模态信息,拓展到更复杂场景,助力智能问答、知识图谱等领域的发展。

技术贡献

提出基于查询子问句与声明原子化的分解框架,创新性地结合覆盖率与可验证性指标,支持无参考、多粒度评估。引入覆盖率感知的检索指标(C-Prec@k、C-nDCG@k)替代传统二元相关标签,增强指标的连续性与鲁棒性。设计了三阶段评估流程,结合LLM自动分解、对齐与指标计算,显著提高评估的自动化水平与细粒度诊断能力。实验证明其在多个数据集和模型上均优于现有方法。

新颖性

首次提出基于查询覆盖率与声明可验证性的统一评估原则,突破了以往只关注二元相关或参考答案的限制,实现了对多样查询类型的全覆盖评估。采用分解策略结合LLM自动对齐,提供了无参考、细粒度的评估新范式,填补了现有方法在开放式问答和多方面信息需求场景中的空白。

局限性

  • 当前依赖大规模预训练模型(如Qwen-30B),计算成本较高,实际部署存在效率挑战。对复杂多步推理或多模态信息的处理仍有限,未来需结合多模态信息增强评估能力。此外,评估指标虽与人类评价相关性高,但在极端复杂或偏离常识的场景中仍可能出现偏差。

未来方向

未来将探索多模态信息融合,提升复杂推理场景的评估能力;优化模型分解与对齐策略,降低计算成本;结合用户反馈,动态调整评估指标,更好适应实际应用需求。还计划扩展到多语言、多领域,推动标准化评估体系的建立。

AI 总览摘要

随着大规模预训练语言模型(如GPT-4、Qwen-30B)在知识问答和信息生成中的广泛应用,模型的评估成为关键瓶颈。传统指标多依赖参考答案或二元相关标签,难以全面反映模型在多样查询场景中的表现。本文提出Q-CARE(Query Coverage and Claim Verifiability),一种基于查询覆盖率与声明支持的无参考、细粒度评估框架。

Q-CARE通过三阶段流程:首先将查询与回答分解为子问句和原子声明,确保信息粒度的细化;其次利用大规模语言模型(如Qwen-30B)自动对检索文档、子问句和声明进行对齐,评估查询覆盖率和声明支持度;最后结合这些对齐结果,计算覆盖率感知的检索指标(C-Prec@k、C-nDCG@k)和声明层面的生成指标(完整性、简洁性、可验证性),实现对模型输出的全面评价。

实验证明,Q-CARE在八个公开数据集上的相关性显著优于现有指标(如RAGEval、RAGChecker),其相关系数最高达0.69,验证了其在多样查询类型中的优越性能。该方法不仅支持多模型、多任务的评估需求,还为自动化、标准化的知识增强模型监控提供了新工具。

未来,作者计划结合多模态信息,优化分解与对齐策略,降低计算成本,并扩展到多语言、多领域场景,推动模型评估的科学化与普适化。Q-CARE的提出,为大规模知识增强系统的可靠性和实用性提供了坚实基础,具有深远的学术和工业价值。

深度分析

研究背景

近年来,预训练语言模型(如BERT、GPT系列)在自然语言理解和生成中取得突破,但其事实性和可靠性仍面临挑战。传统评估方法如EM、ROUGE主要依赖参考答案,难以适应多样化、开放式的查询场景。随着检索增强生成(RAG)模型的兴起,如何有效评估其知识准确性成为研究热点。现有指标如RAGEval、RAGChecker在细粒度诊断方面有所突破,但多依赖静态参考答案或二元相关标签,限制了其在开放式问答中的应用。近年来,基于大模型的自动对齐和评分方法逐渐兴起,推动了无参考评估的发展,但仍缺乏统一、跨任务的评估框架。

核心问题

现有评估方法在多样查询场景中表现不一致,难以实现跨任务、跨类型的统一评估。特别是在开放式问答中,缺乏细粒度、无参考的指标,导致模型性能难以准确反映实际应用需求。此外,传统指标对检索和生成的耦合过强,不能有效区分检索质量与生成质量的贡献。如何设计一种既支持多样查询类型,又具有细粒度、自动化、无参考特性的评估框架,成为亟待解决的问题。

核心创新

提出Q-CARE,核心创新包括:1)引入查询子问句和声明原子化的分解策略,实现信息的细粒度表达;2)基于大模型自动对齐检索文档、子问句和声明,评估查询覆盖率和声明支持度;3)设计覆盖率感知的检索指标(C-Prec@k、C-nDCG@k),替代传统二元标签,增强连续性与鲁棒性;4)结合声明的完整性、简洁性与可验证性,全面评价生成质量。这些创新突破了现有方法在多任务、多场景中的局限,提供了统一、细粒度的评估新范式。

方法详解

  • �� 第一阶段:利用大模型(如Qwen-30B)对查询和回答进行分解,生成子问句和原子声明,确保信息完整且互不重叠;
  • �� 第二阶段:对检索文档、子问句和声明进行自动对齐,利用LLM(如Qwen-30B)判断支持关系,得到对齐集(如E(Q, C)、E(Q, A)、E(A, C));
  • �� 第三阶段:基于对齐结果,计算查询覆盖率(每个检索块支持的子问句比例)和声明支持度(声明被检索块支持的比例),生成覆盖率指标(C-Prec@k、C-nDCG@k)以及生成指标(完整性、简洁性、可验证性);
  • �� 最终,将这些指标融合,形成对模型输出的全面评价,支持多任务、多场景应用。

实验设计

采用八个公开数据集(如NQ、HotpotQA、PubMedQA)进行评估,涵盖不同查询类型。检索采用BM25,生成由多模型(如Qwen-30B、Gemma-27B)完成。指标包括传统的Prec@k、nDCG@k及提出的覆盖率指标,评估模型在不同场景中的表现。通过与人工标注的相关性分析,验证指标的有效性。还进行了模型规模和不同基础模型的对比,确保方法的稳健性。

结果分析

Q-CARE在八个数据集上的相关系数最高达0.69,优于RAGEval(0.29)和RAGChecker(0.32)。覆盖率指标(C-Prec@k、C-nDCG@k)在不同查询类型中表现稳定,尤其在开放式问答中优于传统指标。声明层面指标(完整性、简洁性、可验证性)有效反映生成质量,显著提升细粒度诊断能力。模型规模越大,评估相关性越高,Qwen-30B表现优异,验证了框架的可扩展性和实用性。

应用场景

可广泛应用于知识增强问答系统、智能客服、内容生成等场景,帮助开发者快速评估模型的事实性和可靠性。特别适合多任务、多领域的模型监控,为模型优化提供量化依据。未来还可结合多模态信息,提升复杂推理和多源信息融合的评估能力,推动行业标准化发展。

局限与展望

目前依赖大模型(如Qwen-30B),计算成本较高,实际部署存在效率挑战。对多步推理、多模态信息的处理仍有限,未来需结合多模态技术增强评估能力。此外,指标在极端复杂或偏离常识场景中可能偏差,需持续优化。

通俗解读 非专业人士也能看懂

想象你在一家工厂里,工厂的目标是制造高质量的产品。每个工人(模型)都要完成不同的任务,比如组装、检验、包装。为了确保产品质量,你需要检查每个环节是否都做得好,而不是只看最终产品。传统方法就像只看成品是否完美,但有时候成品看起来不错,但内部可能有问题。现在,Q-CARE就像是一个智能检测系统,它会把每个环节拆开,逐个检查每个部分是否都符合标准。它会问每个工人:“你这个部分是不是做得完整?有支持你的证据吗?”通过这样逐步检查,能更准确地判断整个生产线的质量。这种方法比只看成品更细致,也更可靠,能帮助工厂不断改进,生产出更好的产品。

简单解释 像给14岁少年讲一样

想象你在学校里做科学项目,你需要准备一份报告告诉老师你学到了什么。以前,你只需要把结果写出来,老师就知道你懂了。但有时候,老师还想知道你是怎么知道这些的。于是,你开始把每个步骤都写得更详细,比如你用的资料、做的实验、得到的结论。这样,老师就能更清楚你是不是真正理解了。Q-CARE就像这个过程,它把你的报告拆成很多小部分:每个问题的答案、用到的证据、每个步骤的解释。然后,它会检查每个部分是不是都支持你的结论。这样一来,不仅能知道你做得对不对,还能知道你是不是用对了资料、每个答案是不是都靠谱。这种方法让评估变得更细、更准,也更公平。

术语表

Retrieval-Augmented Generation (检索增强生成)

一种结合检索系统和生成模型的方法,通过检索相关资料支持生成内容,提升回答的事实性。

论文中描述如何利用检索信息增强生成模型的事实性和可靠性。

Query Decomposition (查询分解)

将复杂查询拆解为多个子问句,以便更细粒度地理解和处理信息需求。

用于Q-CARE中,将复杂查询转化为多个简化子任务。

Claim Verifiability (声明可验证性)

判断生成的声明是否有检索证据支持,确保内容的真实性。

核心指标之一,用于评价回答的事实支持程度。

Coverage-aware Metrics (覆盖率感知指标)

基于子问句覆盖情况设计的检索指标,反映检索内容的全面性。

替代传统二元相关标签,提升评估的连续性和鲁棒性。

Atomic Claims (原子声明)

回答中的最小、可验证的陈述单元,便于细粒度评估。

在回答分解阶段生成,用于后续对齐和验证。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步降低大模型在多模态、多源信息场景中的评估成本和复杂度,仍需探索多模态融合与高效对齐技术。
  • 2 在极端偏离常识或多步骤推理的复杂场景中,指标的鲁棒性和准确性仍有待验证。

应用场景

近期应用

知识增强问答系统评估

帮助开发者量化模型的事实性和知识覆盖,提升问答系统的可靠性。

内容生成质量监控

为内容平台提供自动化评估工具,确保生成内容的真实性和完整性。

远期愿景

智能评估体系标准化

推动行业建立统一、自动化的模型评估标准,支持多模态、多任务场景。

原文摘要

Retrieval-augmented generation improves the factuality of large language models by grounding responses in retrieved evidence, yet existing evaluation frameworks struggle to provide consistent, fine-grained diagnostics across the diverse spectrum of user queries, ranging from close-ended fact-seeking to open-ended explanatory requests. We propose Q-CARE, a query-agnostic and fully reference-free framework that enables fine-grained assessment by decomposing queries into sub-queries and answers into atomic claims. Q-CARE establishes a unified evaluation principle based on query coverage and claim verifiability, yielding coverage-aware retriever metrics (C-Prec@k, C-nDCG@k) and claim-level generator metrics (Completeness, Conciseness, and Verifiableness). On a human-annotated benchmark spanning eight datasets, Q-CARE achieves higher correlation with human judgments than four existing RAG evaluation metrics, including RAGEval and RAGChecker, proving its effectiveness as a reliable, automated evaluation framework. Code and data are publicly available at https://github.com/DISL-Lab/Q-CaRE-COLM-26.

cs.AI