DocTrace: Towards Traceable Long Document VQA via Hierarchical Evidence Graph Reasoning

TL;DR

提出DocTrace,基于层次化证据图推理的长文档VQA模型,提升准确率和可追溯性。

cs.AI 🔴 高级 2026-08-04 44 次浏览
Le Xiang Zhicheng Guan Hong Chen Xiaocong Lin Zhenghua Lei Teng Hu Bolei He Long Zeng
多模态大模型 长文理解 证据图推理 可追溯性 深度学习

核心发现

方法论

本文将长文档视觉问答(LongDocVQA)转化为显式证据图推理问题。模型包括证据定位、结构化解析和证据图构建三阶段。通过自动生成监督数据,结合联合监督微调(SFT)和任务特定的组相对策略优化(GRPO),实现证据的逐步定位与推理。核心算法采用多任务学习结合强化学习,确保证据的可靠性和推理的可追溯性。模型在MMLongBench-Doc、LongDocURL和SlideVQA上均优于现有基线,尤其在长文档处理和证据追溯方面表现突出。

关键结果

  • 在MMLongBench-Doc上,DocTrace相较Qwen3-VL-8B-Instruct基础模型,准确率提升14.4个百分点(从38.5%到52.9%);在LongDocURL上提升11.3个百分点(从45.1%到56.4%);在SlideVQA上F1得分提升11.7点(从73.4到85.1)。模型还构建了节点级的证据溯源图,保证推理过程的透明性和可验证性。
  • 通过引入两阶段训练策略,模型在证据定位和推理图构建方面实现了显著提升。证据图的结构性和依赖关系被显式建模,增强了多跳推理能力。实验证明,证据图推理在长文档理解中具有优越的鲁棒性和可解释性。
  • 在多场景长文档任务中,模型展现出强大的适应性,尤其在多页、多模态信息融合和复杂推理路径中表现优异。证据图的引入显著改善了模型的推理透明度和错误追溯能力,为行业应用提供了更可靠的解决方案。

研究意义

本研究突破了长文档多模态问答中证据推理的瓶颈,将隐式推理转化为显式证据图,极大提升了推理的透明性和可验证性。模型不仅在准确率上优于现有方法,更实现了节点级的证据溯源,为金融审计、医学分析等高风险场景提供了可解释的决策依据。其层次化推理框架和强化学习训练策略,为未来多模态长文档理解提供了新思路,有望推动行业标准的制定与技术普及。

技术贡献

本文提出的DocTrace引入层次化证据图推理架构,结合自动生成监督数据和强化学习优化,显著改善了长文档多模态问答的可追溯性和准确性。创新点包括:• 层次化的证据定位、结构化解析与图推理流程,确保推理路径的明确性;• 结合多任务微调与强化学习,优化证据的可靠性和推理的连贯性;• 构建节点级的证据溯源图,实现推理过程的透明化。该方法突破了现有隐式推理的局限,为多跳推理提供了理论保证和工程实现路径。

新颖性

本研究首次将长文档VQA问题转化为显式证据图推理任务,突破了传统隐式推理的瓶颈。与以往仅依赖隐藏表示或粗粒度检索的方法不同,提出的层次化架构和强化学习训练策略,使证据的逐步定位、结构化解析和推理依赖关系得以明确建模,显著提升了推理的透明度和可验证性。这一创新为多模态长文档理解提供了全新解决方案,具有重要的学术和应用价值。

局限性

  • 模型在极长文档(超过120页)或多模态信息极度复杂的场景中,证据定位和图构建仍存在一定困难,表现受限于预训练模型的上下文容量和解析能力。
  • 自动生成的监督数据可能存在偏差,影响模型的推理准确性和证据的全面性,未来需引入更高质量的标注或人类校验机制。
  • 训练过程依赖大量计算资源,强化学习策略的调优复杂,实际部署时可能面临效率瓶颈,需优化推理速度和模型压缩技术。

未来方向

未来将探索多模态信息的更深融合,提升模型在多样化场景中的适应性。还计划引入更高效的证据筛选和结构优化算法,降低计算成本。同时,结合知识图谱和因果推理,增强模型的推理深度和解释能力,推动长文档理解在实际行业中的广泛应用。

AI 总览摘要

长文档视觉问答(LongDocVQA)面临多模态信息分散、推理路径复杂的挑战,现有方法多依赖隐式表示,难以实现推理过程的透明化。本文提出的DocTrace架构,通过层次化证据定位、结构化解析和显式证据图构建,有效解决了这一难题。模型在自动生成监督数据的基础上,结合微调和强化学习,优化证据的可靠性和推理路径的合理性。实验结果显示,DocTrace在MMLongBench-Doc、LongDocURL和SlideVQA上均优于现有最优模型,准确率提升14.4、11.3和11.7个百分点,且构建了节点级的证据溯源图,确保推理的可追溯性和可验证性。这一创新不仅提升了长文档理解的性能,也为高风险行业提供了透明、可信的决策依据。未来,模型将进一步融合多模态信息,优化推理效率,推动行业应用的普及。整体而言,DocTrace开启了多模态长文档推理的全新方向,为实现可信、可解释的AI提供了重要技术基础。

深度分析

研究背景

长文档理解作为多模态AI的重要方向,经历了从单页问答到跨页、多模态信息融合的演变。早期工作如Dude et al. 2023主要关注单页问答,后续如InternVL3(Zhu et al. 2025)和Qwen3VL(Bai et al. 2025)扩展到多页、多模态场景。尽管如此,现有模型多采用隐式推理或粗粒度检索,难以实现长文档中复杂推理路径的可追溯性。近年来,基于检索和交互的模型如VDocRAG、MoLoRAG等,提升了信息筛选效率,但仍缺乏显式的证据依赖建模。高风险应用场景如金融审计和医学诊断,要求模型不仅给出答案,更能追溯证据来源,确保推理的透明性和可信度。

核心问题

长文档VQA的核心难题在于信息分散、推理路径复杂,传统模型难以明确追踪每一步推理所依据的具体证据。隐式表示导致推理过程不透明,难以验证和改进。现有方法在多页、多模态信息的融合、跨页推理和证据依赖建模方面存在明显不足,限制了模型在实际高风险场景中的应用。如何构建可解释、可验证的推理路径,成为亟待解决的关键问题。

核心创新

本文提出层次化证据图推理架构,创新点包括:• 证据定位、结构化解析与图推理三阶段流程,确保推理路径明确;• 自动生成监督数据,结合微调和强化学习,优化证据的可靠性和推理连贯性;• 构建节点级证据溯源图,实现推理过程的透明化。这些创新突破了隐式推理的局限,为多跳推理提供了理论保证和工程实现路径。

方法详解

  • �� 输入长文档和问题,模型首先在低分辨率图像上进行粗略证据定位,筛选出相关页面;• 选中的页面在高分辨率下结构化解析,提取文本、表格、图像等元素,形成基础证据池;• 构建有向证据图,节点代表证据块,边表示推理依赖关系;• 通过强化学习优化证据定位和图结构,确保推理路径的正确性和完整性;• 最终结合证据图生成答案,实现推理的可追溯性。

实验设计

在MMLongBench-Doc、LongDocURL和SlideVQA三大数据集上,模型采用微调和强化学习训练,评估指标包括准确率、F1分数、证据定位的Page F1和Coverage。对比基线模型如Qwen3-VL-8B-Instruct,结果显示本模型在所有指标上均优于对手,特别是在多页、多模态推理任务中表现出色。通过消融实验验证了证据图推理和结构化解析的贡献,模型在长文档中的鲁棒性和可解释性得到显著提升。

应用场景

该模型可广泛应用于金融审计、法律文书分析、医学诊断等领域,满足对推理透明性和证据追溯的高要求。实现条件包括高质量的长文档扫描和多模态信息采集,结合行业特定知识库,可大幅提升决策的可信度。未来还可结合知识图谱和因果推理,推动行业智能化升级。

局限与展望

模型在极长或极复杂的文档中仍存在证据定位不准确的问题,自动生成监督数据可能引入偏差,训练和推理过程计算成本较高,限制了实时应用的普及。未来需优化模型结构和训练策略,提升效率和适应性。

通俗解读 非专业人士也能看懂

想象你在整理一本很厚的百科全书,要找到关于某个主题的所有相关信息。传统的方法就像随便翻翻,找到一些片段就给出答案,但你不知道这些片段是不是全部、是否正确。而新方法像是建立一张详细的思维导图,把每个信息点都标记清楚,知道每个结论是依据哪个具体的章节、图片或表格得来的。这样,不仅能找到答案,还能清楚告诉别人这个答案是怎么得来的,哪部分信息最重要。这就像是把复杂的知识变成一张有条理的证据链,让每一步都可以追溯,确保答案的可靠性和透明度。

简单解释 像给14岁少年讲一样

想象你在学校图书馆找资料,老师让你写一篇关于某个话题的报告。以前,你可能只记得大概内容,写完后老师也不知道你是不是用了正确的资料。而现在,有了新方法,就像你在写报告时画出一张图,标明每个信息来自哪本书、哪一页、哪一段。这样,不仅你自己知道每个结论的来源,别人也能看懂你是怎么得出这个答案的。这就像在做一个超级详细的证据地图,确保每个结论都能追溯到具体的资料来源。这样一来,你的报告就变得更可靠,也更容易被别人相信。

原文摘要

Long Document Visual Question Answering (LongDocVQA) requires Multimodal Large Language Models (MLLMs) to locate, integrate, and reason over heterogeneous document elements distributed across multiple pages. Existing approaches, including end-to-end MLLMs, retrieval-augmented generation (RAG) pipelines, and document agents, often lack explicit mechanisms to represent and verify how grounded evidence is progressively composed during reasoning, limiting both answer accuracy and traceability. In this paper, we cast LongDocVQA as an explicit evidence graph reasoning problem rather than implicit answer prediction. To this end, we propose DocTrace, a hierarchical framework that progressively performs evidence localization, structured document parsing, and evidence graph reasoning to enable explicit evidence provenance. To effectively learn these capabilities, we develop a two-stage training framework: joint Supervised Fine-Tuning (SFT) first initializes evidence localization and graph reasoning abilities, followed by task-specific Group Relative Policy Optimization (GRPO) with dedicated rewards to further optimize these capabilities. Extensive experiments on MMLongBench-Doc, LongDocURL, and SlideVQA demonstrate that DocTrace consistently outperforms both existing open-source baselines and proprietary MLLMs. Compared with the Qwen3-VL-8B-Instruct backbone, DocTrace achieves absolute improvements of 14.4, 11.3, and 11.7 points on the three benchmarks, respectively. Beyond competitive performance, DocTrace constructs traceable evidence graphs with explicit node-level provenance, enabling transparent and verifiable reasoning for long document understanding.

cs.AI