DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

TL;DR

DocScope通过四阶段评估协议验证长文档理解的可信推理,发现证据链完整率仅29%。

cs.CL 🔴 高级 2026-05-09 1 次浏览
Xiang Feng Jiawei Zhou Zhangfeng Huang Kewei Wang Shanshan Ye Jinxin Hu Zulong Chen Yong Luo Jing Zhang
长文档理解 可信推理 多模态大语言模型 证据链 评估基准

核心发现

方法论

DocScope采用四阶段评估协议:页面定位、区域定位、事实提取和答案验证。每个阶段独立评估模型的推理轨迹,确保输出的答案不仅准确,还能被验证。使用1,124个问题和273个文档进行测试,所有证据注释由人工完成。

关键结果

  • 结果1:即使在正确答案中,完整证据链的最高观察率仅为29%。
  • 结果2:区域定位是所有模型中最弱的阶段。
  • 结果3:证据分散在长距离和多个文档集群中是主要困难。

研究意义

DocScope为长文档问答系统提供了一个全面的评估框架,填补了现有基准在证据验证方面的空白。它不仅关注答案的准确性,还强调推理过程的可验证性,为未来的研究提供了重要的参考。

技术贡献

DocScope通过引入四阶段评估协议,提供了一个细粒度的评估框架,能够独立诊断每个推理阶段的表现。这种方法使得研究人员可以更好地理解模型在长文档理解中的表现和不足。

新颖性

DocScope首次将长文档问答问题形式化为结构化推理轨迹预测问题,强调证据链的完整性和可验证性。

局限性

  • 局限1:当前模型在处理长距离和多个文档集群的证据时表现不佳。
  • 局限2:区域定位阶段的表现普遍较弱。

未来方向

未来研究可以关注如何改进区域定位阶段的表现,以及如何更有效地整合分散的证据。

AI 总览摘要

长文档理解在多模态大语言模型的应用中变得越来越重要。然而,现有的评估方法往往只关注答案的准确性,而忽视了推理过程的可验证性。DocScope通过引入四阶段评估协议,提供了一个全面的评估框架,使得研究人员可以更好地理解模型在长文档理解中的表现和不足。

DocScope的实验结果显示,即使在正确答案中,完整证据链的最高观察率仅为29%。这表明答案的准确性并不能替代推理轨迹的评估。区域定位是所有模型中最弱的阶段,证据分散在长距离和多个文档集群中是主要困难。

DocScope为长文档问答系统提供了一个全面的评估框架,填补了现有基准在证据验证方面的空白。它不仅关注答案的准确性,还强调推理过程的可验证性,为未来的研究提供了重要的参考。未来研究可以关注如何改进区域定位阶段的表现,以及如何更有效地整合分散的证据。

深度分析

研究背景

近年来,多模态大语言模型在文档理解任务中取得了显著进展。然而,随着这些模型在实际应用场景中的部署,单纯生成答案已无法满足用户需求。用户需要的不仅是准确的答案,还需要答案能够基于源文档进行验证和审计。因此,评估多模态大语言模型是否能够在长、视觉丰富的文档上产生可信的、可验证的推理成为一个关键问题。

核心问题

现有的长文档理解基准往往只关注证据验证问题的一个子集,忽视了多个关键维度。尤其是在处理长距离和多个文档集群的证据时,现有的评估方法往往无法全面反映模型的能力。这导致了答案的准确性与推理的可信度之间存在显著的脱节。

核心创新

DocScope首次将长文档问答问题形式化为结构化推理轨迹预测问题,强调证据链的完整性和可验证性。通过引入四阶段评估协议,DocScope能够独立诊断每个推理阶段的表现,使得研究人员可以更好地理解模型在长文档理解中的表现和不足。

方法详解

  • �� 页面定位:识别证据所在的页面。
  • �� 区域定位:在页面上定位具体的证据区域。
  • �� 事实提取:从证据区域中提取相关的事实陈述。
  • �� 答案验证:验证最终答案是否由这些事实推导而来。

实验设计

DocScope包含1,124个问题,来自273个文档。实验使用了6个专有模型、12个开放权重模型和多个领域特定系统。评估指标包括页面定位的精确度、召回率和F1分数,区域定位的严格F1和宽松F1,以及事实提取的一致性率。

结果分析

实验结果显示,即使在正确答案中,完整证据链的最高观察率仅为29%。区域定位是所有模型中最弱的阶段,证据分散在长距离和多个文档集群中是主要困难。不同模型在不同阶段表现出不同的能力特征。

应用场景

DocScope为长文档问答系统提供了一个全面的评估框架,填补了现有基准在证据验证方面的空白。它不仅关注答案的准确性,还强调推理过程的可验证性,为未来的研究提供了重要的参考。

局限与展望

当前模型在处理长距离和多个文档集群的证据时表现不佳。区域定位阶段的表现普遍较弱,未来研究可以关注如何改进这一阶段的表现,以及如何更有效地整合分散的证据。

通俗解读 非专业人士也能看懂

想象你在一个图书馆里寻找一本书的特定章节来回答一个问题。首先,你需要找到那本书(页面定位),然后找到书中的特定章节(区域定位),接着你需要从章节中提取相关信息(事实提取),最后用这些信息来回答问题(答案验证)。如果你在任何一个步骤中出错,最终的答案可能就不准确或无法验证。DocScope就像一个图书馆管理员,帮助你在每个步骤中都做出正确的选择。

简单解释 像给14岁少年讲一样

想象你在学校的图书馆里,老师给你一个问题,你需要在一本很厚的书里找到答案。首先,你得找到那本书的正确页码(页面定位),然后找到页码上的具体段落(区域定位)。接着,你要从段落中找出重要的信息(事实提取),最后用这些信息来回答老师的问题(答案验证)。如果你在任何一步中出错,答案可能就不对哦!DocScope就像一个超级聪明的助手,帮你在每一步都做出正确的选择。

术语表

页面定位 (Page Localization)

识别文档中包含证据的页面。

在DocScope中用于评估模型识别证据页面的能力。

区域定位 (Region Grounding)

在识别的页面上定位具体的证据区域。

用于评估模型在页面上精确定位证据的能力。

事实提取 (Fact Extraction)

从证据区域中提取相关的事实陈述。

用于评估模型从证据中提取准确事实的能力。

答案验证 (Answer Verification)

验证最终答案是否由提取的事实推导而来。

用于评估模型答案的可信度和准确性。

证据链 (Evidence Chain)

从问题到答案的完整推理路径。

DocScope中用于评估模型推理过程的完整性。

开放问题 这项研究留下的未解疑问

  • 1 如何提高区域定位阶段的表现?
  • 2 如何更有效地整合分散的证据?

应用场景

近期应用

学术研究

研究人员可以使用DocScope评估长文档问答系统的性能,并识别其在证据验证方面的不足。

远期愿景

智能助手

未来的智能助手可以利用DocScope的评估框架,提高长文档理解的准确性和可信度。

原文摘要

Evaluating whether Multimodal Large Language Models can produce trustworthy, verifiable reasoning over long, visually rich documents requires evaluation beyond end-to-end answer accuracy. We introduce DocScope, a benchmark that formulates long-document QA as a structured reasoning trajectory prediction problem: given a complete PDF document and a question, the model outputs evidence pages, supporting evidence regions, relevant factual statements, and a final answer. We design a four-stage evaluation protocol -- Page Localization, Region Grounding, Fact Extraction, and Answer Verification -- that audits each level of the trajectory independently through inter-stage decoupling, with all judges selected and calibrated via human alignment studies. DocScope comprises 1,124 questions derived from 273 documents, with all hierarchical evidence annotations completed by human annotators. We benchmark 6 proprietary models, 12 open-weight models, and several domain-specific systems. Our experiments reveal that answer accuracy cannot substitute for trajectory-level evaluation: even among correct answers, the highest observed rate of complete evidence chains is only 29\%. Across all models, region grounding remains the weakest trajectory stage. Furthermore, the primary difficulty stems from aggregating evidence dispersed across long distances and multiple document clusters, while an oracle study identifies faithful perception and fact extraction as the dominant capability bottleneck. Cross-architecture comparisons further suggest that activated parameter count matters more than total scale. The benchmark and code will be publicly released at https://github.com/MiliLab/DocScope.

cs.CL cs.CV