Doc-V*:Coarse-to-Fine Interactive Visual Reasoning for Multi-Page Document VQA

TL;DR

Doc-V*通过逐步证据聚合提升多页文档VQA性能,超越RAG基线47.9%。

cs.CL 🔴 高级 2026-04-15 2 次浏览
Yuanlei Zheng Pei Fu Hang Li Ziyang Wang Yuyi Zhang Wenyu Ruan Xiaojin Zhang Zhongyu Wei Zhenbo Luo Jian Luan Wei Chen Xiang Bai
多页文档 视觉问答 OCR-free 主动感知 证据聚合

核心发现

方法论

Doc-V*采用无OCR的主动框架,通过缩略图概览、语义检索和目标页面获取逐步聚合证据。使用模仿学习和群体相对策略优化训练,以平衡答案准确性和证据搜索效率。

关键结果

  • 在五个基准测试中,Doc-V*在跨领域性能上比RAG基线提高了47.9%,显示出其在证据聚合和选择性注意力上的有效性。
  • 在DUDE数据集上,Doc-V*的ANLS达到64.5,超越所有开源基线。
  • 在SlideVQA上,Doc-V*的F1得分为77.2,显著优于其他模型。

研究意义

Doc-V*在学术界和工业界均具有重要意义。它解决了现有方法在处理长文档时的扩展性和精确性之间的权衡问题,提供了一种更高效的证据聚合方式,适用于复杂的文档理解任务。

技术贡献

Doc-V*引入了主动感知的概念,与现有被动方法形成鲜明对比。通过逐步证据聚合,Doc-V*在不增加输入页面的情况下提高了文档理解能力。

新颖性

Doc-V*首次将多页文档VQA问题视为顺序证据聚合过程,采用主动感知策略,显著提升了跨领域性能。

局限性

  • 在处理极长文档时,Doc-V*的效率可能受到限制,尤其是在页面数量超过100时。
  • 对检索工具和超参数的敏感性仍然存在,可能影响模型的鲁棒性。

未来方向

未来研究可探索Doc-V*在更多文档类型上的应用,以及如何进一步优化其在极长文档上的性能。

AI 总览摘要

多页文档视觉问答(DocVQA)是一个复杂的任务,要求在长而密集的文档中进行语义、布局和视觉元素的推理。现有的无OCR方法在处理长文档时面临扩展性和精确性之间的权衡。Doc-V*通过主动感知框架,逐步聚合证据,显著提高了多页文档VQA的性能。

Doc-V*首先通过缩略图概览获取文档的整体结构,然后通过语义检索和目标页面获取来逐步聚合证据。该方法使用模仿学习和群体相对策略优化进行训练,以在答案准确性和证据搜索效率之间取得平衡。在五个基准测试中,Doc-V*超越了开源基线,并接近专有模型的性能。

Doc-V*的创新在于其主动感知策略,使得模型能够在不增加输入页面的情况下有效聚合证据。这种方法不仅提高了跨领域性能,还在处理复杂文档理解任务时显示出显著的鲁棒性。未来的研究可以进一步探索其在更多文档类型上的应用以及在极长文档上的性能优化。

深度分析

研究背景

多页文档视觉问答需要在长而复杂的文档中进行语义、布局和视觉元素的推理。传统的OCR方法将文档图像线性化为文本,容易丢失细粒度的布局信息。近年来,无OCR方法直接将文档建模为图像,利用多模态大语言模型进行视觉-语义推理。

核心问题

现有方法在处理长文档时面临扩展性和精确性之间的权衡。端到端模型处理整个文档的长图像序列,但由于注意力成本和上下文长度限制,扩展性差。视觉检索增强生成系统虽然提高了效率,但对检索错误和超参数敏感。

核心创新

Doc-V*采用主动感知框架,通过缩略图概览、语义检索和目标页面获取逐步聚合证据。与被动方法不同,Doc-V*能够动态调整策略,逐步整合不连续的视觉证据。

方法详解

  • �� 缩略图概览:获取文档的整体结构。
  • �� 语义检索:根据语义信息检索相关页面。
  • �� 目标页面获取:获取特定页面以聚合证据。
  • �� 证据聚合:在工作记忆中整合证据进行推理。

实验设计

实验在五个基准测试上进行,包括DUDE和MP-DocVQA。使用ANLS、F1和准确率等指标评估模型性能。实验结果表明,Doc-V*在跨领域性能上显著优于现有基线。

结果分析

Doc-V*在DUDE数据集上达到64.5的ANLS,超越所有开源基线。在SlideVQA上,F1得分为77.2,显著优于其他模型。实验结果表明,Doc-V*在证据聚合和选择性注意力上的有效性。

应用场景

Doc-V*适用于需要处理复杂文档理解任务的场景,如金融报告、学术论文和工业手册。其主动感知策略提高了文档理解的效率和准确性。

局限与展望

Doc-V*在处理极长文档时的效率可能受到限制,尤其是在页面数量超过100时。对检索工具和超参数的敏感性仍然存在,可能影响模型的鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个巨大的图书馆里寻找一本特定的书。传统方法是从头到尾浏览每一本书,耗时且容易遗漏。Doc-V*就像一个聪明的图书管理员,先快速浏览书架,找出可能的书籍,然后逐步检查每本书的内容,直到找到答案。这种方法不仅节省时间,还能确保找到最相关的信息。

简单解释 像给14岁少年讲一样

想象你在学校图书馆找一本关于恐龙的书。你不会从头到尾翻每本书,而是先看看书架上的书名,再打开几本看看目录,找到最有可能的书。Doc-V*就像这样聪明的搜索过程,快速找到你需要的信息!

术语表

OCR-free (无OCR)

一种不依赖光学字符识别技术的方法,直接对图像进行处理。

用于直接处理文档图像而不进行文本线性化。

Active Perception (主动感知)

一种动态调整感知策略以获取信息的过程。

Doc-V*通过主动感知策略逐步聚合证据。

Group Relative Policy Optimization (群体相对策略优化)

一种优化策略,通过奖励信号平衡答案准确性和证据搜索效率。

用于训练Doc-V*模型以提高性能。

Sequential Evidence Aggregation (顺序证据聚合)

一种逐步整合证据以进行推理的方法。

Doc-V*通过顺序证据聚合提高多页文档VQA性能。

ANLS (平均归一化Levenshtein距离)

一种用于评估文档问答任务中答案准确性的指标。

用于评估Doc-V*在DUDE数据集上的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在极长文档上进一步提高Doc-V*的效率?现有方法在处理页面数量超过100时可能受到限制。
  • 2 如何减少Doc-V*对检索工具和超参数的敏感性,以提高模型的鲁棒性?

应用场景

近期应用

金融报告分析

Doc-V*可用于快速分析复杂的金融报告,提高信息提取的效率和准确性。

远期愿景

跨领域文档理解

Doc-V*的主动感知策略可应用于更多领域,提升不同类型文档的理解能力。

原文摘要

Multi-page Document Visual Question Answering requires reasoning over semantics, layouts, and visual elements in long, visually dense documents. Existing OCR-free methods face a trade-off between capacity and precision: end-to-end models scale poorly with document length, while visual retrieval-based pipelines are brittle and passive. We propose Doc-$V^*$, an \textbf{OCR-free agentic} framework that casts multi-page DocVQA as sequential evidence aggregation. Doc-$V^*$ begins with a thumbnail overview, then actively navigates via semantic retrieval and targeted page fetching, and aggregates evidence in a structured working memory for grounded reasoning. Trained by imitation learning from expert trajectories and further optimized with Group Relative Policy Optimization, Doc-$V^*$ balances answer accuracy with evidence-seeking efficiency. Across five benchmarks, Doc-$V^*$ outperforms open-source baselines and approaches proprietary models, improving out-of-domain performance by up to \textbf{47.9\%} over RAG baseline. Other results reveal effective evidence aggregation with selective attention, not increased input pages.

cs.CL