CiteVQA: Benchmarking Evidence Attribution for Trustworthy Document Intelligence

TL;DR

CiteVQA通过严格归属准确性评估多模态大语言模型的证据归属能力,揭示答案仅评估的可靠性差距。

cs.CL 🔴 高级 2026-05-13 1 次浏览
Dongsheng Ma Jiayu Li Zhengren Wang Yijie Wang Jiahao Kong Weijun Zeng Jutao Xiao Jie Yang Wentao Zhang Bin Wang Conghui He
多模态 证据归属 文档智能 机器学习 模型评估

核心发现

方法论

CiteVQA采用自动化注释管道生成高保真数据集,结合多模态大语言模型进行证据链提取,确保每个答案都有可视化验证的证据支持。

关键结果

  • Gemini-3.1-Pro-Preview在严格归属准确性上仅达到76.0,而最强开源模型仅为22.5,显示出显著的归属幻觉现象。
  • 20个主流MLLMs中普遍存在归属幻觉,即模型给出正确答案但引用错误区域。
  • 实验揭示了答案准确性与证据归属之间的显著差距,尤其在多文档情境下。

研究意义

CiteVQA为文档智能提供了新的评估标准,填补了答案仅评估的可靠性差距,尤其在法律、金融和医学等高风险领域,确保每个结论都可追溯到具体来源。

技术贡献

CiteVQA引入了严格归属准确性(SAA)作为评估标准,结合自动化注释管道,解决了细粒度视觉注释的成本和一致性瓶颈。

新颖性

CiteVQA首次在文档VQA中引入元素级边界框引用,确保答案和证据的联合评估,揭示了现有评估方法的盲点。

局限性

  • 当前模型在多文档情境下的证据归属能力较弱,尤其是跨页证据链接。
  • 自动化注释可能存在偏差,尽管经过专家验证。

未来方向

未来研究可探索更高效的证据链提取方法,并在更多领域应用CiteVQA,提升多模态模型的可靠性。

AI 总览摘要

CiteVQA揭示了现有文档VQA评估方法的盲点,尤其是在高风险领域中,答案的准确性必须与证据的可追溯性结合评估。CiteVQA通过自动化注释管道生成高保真数据集,结合多模态大语言模型进行证据链提取,确保每个答案都有可视化验证的证据支持。实验显示,尽管某些模型在答案准确性上表现优异,但在证据归属上存在显著差距,尤其在多文档情境下。这一发现为文档智能提供了新的评估标准,填补了答案仅评估的可靠性差距,推动了多模态模型在法律、金融和医学等领域的应用。未来研究可探索更高效的证据链提取方法,并在更多领域应用CiteVQA,提升多模态模型的可靠性。

深度分析

研究背景

近年来,多模态大语言模型在文档理解领域取得了突破性进展,尤其是在复杂视觉布局分析和跨模态推理方面。然而,现有的文档VQA评估框架几乎只关注最终答案的准确性,忽视了模型推导答案的逻辑路径,即证据的精确提取。在法律咨询、财务审计和循证医学等高风险领域,证据是决策的基石,答案仅评估掩盖了模型可能依赖预训练背景知识进行猜测的关键失败模式。

核心问题

现有的文档VQA评估方法只关注答案的准确性,忽视了证据的可追溯性。这种评估方法掩盖了模型可能依赖错误证据得出正确答案的风险,尤其在高风险领域中,答案的准确性必须与证据的可追溯性结合评估。

核心创新

CiteVQA引入了严格归属准确性(SAA)作为评估标准,确保答案和证据的联合评估。通过自动化注释管道生成高保真数据集,结合多模态大语言模型进行证据链提取,确保每个答案都有可视化验证的证据支持。

方法详解

  • �� 自动化注释管道生成高保真数据集,确保数据的精确性和一致性。 • 使用多模态大语言模型进行证据链提取,确保每个答案都有可视化验证的证据支持。 • 引入严格归属准确性(SAA)作为评估标准,确保答案和证据的联合评估。

实验设计

实验设计包括对20个主流多模态大语言模型的评估,使用CiteVQA数据集进行测试。评估指标包括答案准确性、证据归属的严格归属准确性(SAA)、召回率和相关性等。实验揭示了答案准确性与证据归属之间的显著差距,尤其在多文档情境下。

结果分析

实验结果显示,尽管某些模型在答案准确性上表现优异,但在证据归属上存在显著差距,尤其在多文档情境下。Gemini-3.1-Pro-Preview在严格归属准确性上仅达到76.0,而最强开源模型仅为22.5,显示出显著的归属幻觉现象。

应用场景

CiteVQA可用于法律、金融和医学等高风险领域,确保每个结论都可追溯到具体来源。其评估标准可用于提升多模态模型的可靠性,推动其在更多领域的应用。

局限与展望

当前模型在多文档情境下的证据归属能力较弱,尤其是跨页证据链接。自动化注释可能存在偏差,尽管经过专家验证。未来研究可探索更高效的证据链提取方法,并在更多领域应用CiteVQA,提升多模态模型的可靠性。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里,想找一本书中的特定信息。你不仅需要找到正确的书,还需要找到书中的具体段落。CiteVQA就像一个聪明的助手,它不仅告诉你答案,还能指出答案在书中的具体位置。这对于需要精确信息的领域,如法律和医学,尤为重要。CiteVQA帮助确保每个答案都有可靠的来源,而不仅仅是猜测。

简单解释 像给14岁少年讲一样

想象你在玩一个寻宝游戏,你需要找到地图上的宝藏。CiteVQA就像是你的指南针,它不仅告诉你宝藏在哪里,还会指引你找到正确的路径。这对于那些需要精确信息的领域,如法律和医学,尤为重要。CiteVQA帮助确保每个答案都有可靠的来源,而不仅仅是猜测。

术语表

多模态大语言模型 (MLLMs)

结合多种模态(如文本和图像)的语言模型,能够理解和生成复杂的多模态数据。

用于文档理解和证据链提取。

严格归属准确性 (SAA)

一种评估标准,要求答案和引用的证据区域都必须正确。

用于评估模型的证据归属能力。

证据链

支持答案的证据集合,通常包括多个来源和元素。

通过自动化注释管道生成。

归属幻觉

模型给出正确答案但引用错误区域的现象。

在实验中普遍存在。

自动化注释管道

用于生成高保真数据集的自动化流程,确保数据的精确性和一致性。

用于CiteVQA的数据集构建。

开放问题 这项研究留下的未解疑问

  • 1 如何在多文档情境下提高证据归属能力,尤其是跨页证据链接。
  • 2 如何减少自动化注释中的偏差,提高数据集的精确性。

应用场景

近期应用

法律咨询

帮助法律专业人士快速找到相关法律条款和判例,提高工作效率。

远期愿景

医学诊断

辅助医生在大量医学文献中找到可靠的诊断依据,提高诊断准确性。

原文摘要

Multimodal Large Language Models (MLLMs) have significantly advanced document understanding, yet current Doc-VQA evaluations score only the final answer and leave the supporting evidence unchecked. This answer-only approach masks a critical failure mode: a model can land on the correct answer while grounding it in the wrong passage -- a critical risk in high-stakes domains like law, finance, and medicine, where every conclusion must be traceable to a specific source region. To address this, we introduce CiteVQA, a benchmark that requires models to return element-level bounding-box citations alongside each answer, evaluating both jointly. CiteVQA comprises 1,897 questions across 711 PDFs spanning seven domains and two languages, averaging 40.6 pages per document. To ensure fidelity and scalability, the ground-truth citations are generated by an automated pipeline-which identifies crucial evidence via masking ablation-and are subsequently validated through expert review. At the core of our evaluation is Strict Attributed Accuracy (SAA), which credits a prediction only when the answer and the cited region are both correct. Auditing 20 MLLMs reveals a pervasive Attribution Hallucination: models frequently produce the right answer while citing the wrong region. The strongest system (Gemini-3.1-Pro-Preview) achieves an SAA of only 76.0, and the strongest open-source MLLM reaches just 22.5. Ultimately, towards trustworthy document intelligence, CiteVQA exposes a reliability gap that answer-only evaluations overlook, providing the instrumentation needed to close it. Our repository is available at https://github.com/opendatalab/CiteVQA.

cs.CL cs.CV