DocAttriBench: Benchmarking Answer Grounding in Document Visual Question Answering

TL;DR

DocAttriBench通过MAPPET方法实现文档VQA中的答案定位,提供237k文档和296k问答对。

cs.CV 🔴 高级 2026-09-17 1 次浏览
Luca De Grandis Silvia Cappelletti William Raccagni Marcella Cornia Lorenzo Baraldi Rita Cucchiara
文档VQA 答案定位 多模态模型 数据集 机器学习

核心发现

方法论

我们提出了一种基于掩码困惑度的归因方法(MAPPET),结合文档布局和语言建模,识别每个答案最具信息量的元素。MAPPET通过掩码候选元素后困惑度的增加来测量,并将答案归因于对模型置信度贡献最大的元素。

关键结果

  • MAPPET在多个现有文档VQA数据集上应用,生成了DAB,包含237k文档和296k问答对,提供元素级定位。
  • 实验结果显示,尽管较大模型通常能实现更高的答案准确性,但即使是最强的模型也常常无法定位支持元素。
  • 经过微调的模型在定位准确性上超过了未微调的对照组,显示了DAB在开发具备定位能力的多模态模型中的有效性。

研究意义

DocAttriBench为文档VQA提供了一个可扩展的基准,支持开发具备定位能力、可验证和可信赖的模型。它解决了现有基准缺乏定位注释或提供有限质量标签的问题,并通过自动化方法减少了人工构建数据集的成本。

技术贡献

通过MAPPET,我们提供了一种新颖的自动化视觉答案定位框架,能够在文档VQA中实现细粒度的元素级定位。这种方法不仅提高了模型的定位能力,还为未来的多模态推理提供了新的可能性。

新颖性

DocAttriBench是首个大规模的文档VQA基准,提供高质量的元素级定位注释。与现有数据集相比,它在规模和注释质量上都有显著提升。

局限性

  • MAPPET可能在处理复杂布局或多页面文档时表现不佳,因为这些情况可能导致困惑度计算不准确。
  • 自动化注释可能引入错误或虚假定位,特别是在视觉内容不完全支持答案的情况下。

未来方向

未来的研究可以探索如何改进MAPPET在复杂文档上的表现,并开发更强大的多模态模型,以提高定位和答案生成的准确性。

AI 总览摘要

文档视觉问答(VQA)中的答案定位仍是一个开放的挑战,现有的基准缺乏高质量的定位注释。DocAttriBench(DAB)通过引入一种基于掩码困惑度的归因方法(MAPPET),为文档VQA提供了一个大规模的基准。MAPPET结合文档布局和语言建模,识别每个答案最具信息量的元素。应用于多个现有文档VQA数据集后,DAB包含237k文档和296k问答对,提供元素级定位。

实验结果显示,尽管较大模型通常能实现更高的答案准确性,但即使是最强的模型也常常无法定位支持元素。经过微调的模型在定位准确性上超过了未微调的对照组,显示了DAB在开发具备定位能力的多模态模型中的有效性。

DAB为文档VQA提供了一个可扩展的基准,支持开发具备定位能力、可验证和可信赖的模型。它解决了现有基准缺乏定位注释或提供有限质量标签的问题,并通过自动化方法减少了人工构建数据集的成本。未来的研究可以探索如何改进MAPPET在复杂文档上的表现,并开发更强大的多模态模型,以提高定位和答案生成的准确性。

深度分析

研究背景

文档视觉问答(VQA)旨在通过分析文档中的视觉和文本信息来回答问题。近年来,多模态大模型(MLLMs)在文档理解中取得了显著进展。然而,现有的基准数据集在定位注释方面存在不足,限制了模型的进一步发展。

核心问题

文档VQA中的核心问题是如何准确定位支持答案的视觉元素。现有数据集缺乏高质量的定位注释,导致模型难以在复杂文档中实现精确的答案定位。

核心创新

DocAttriBench通过MAPPET方法实现了文档VQA中的答案定位。MAPPET结合文档布局和语言建模,识别每个答案最具信息量的元素。这种方法不仅提高了模型的定位能力,还为未来的多模态推理提供了新的可能性。

方法详解

  • �� 提出MAPPET方法,通过掩码困惑度计算识别答案支持元素。
  • �� 将MAPPET应用于多个现有文档VQA数据集,生成DAB。
  • �� DAB包含237k文档和296k问答对,提供元素级定位注释。

实验设计

实验在多个文档VQA数据集上进行,评估模型的答案准确性和定位准确性。结果显示,经过微调的模型在定位准确性上超过了未微调的对照组。

结果分析

实验结果显示,尽管较大模型通常能实现更高的答案准确性,但即使是最强的模型也常常无法定位支持元素。经过微调的模型在定位准确性上超过了未微调的对照组。

应用场景

DocAttriBench为文档VQA提供了一个可扩展的基准,支持开发具备定位能力、可验证和可信赖的模型。

局限与展望

MAPPET可能在处理复杂布局或多页面文档时表现不佳,因为这些情况可能导致困惑度计算不准确。自动化注释可能引入错误或虚假定位,特别是在视觉内容不完全支持答案的情况下。

通俗解读 非专业人士也能看懂

想象你在看一本图文并茂的百科全书,里面有很多问题和答案。DocAttriBench就像是一个聪明的助手,它能帮你找到每个答案对应的具体图文位置。通过一种叫MAPPET的方法,它能识别出哪些图文信息对答案最重要。就像你在找某个问题的答案时,这个助手会告诉你应该看哪一页的哪个部分。这种方法不仅能提高找答案的效率,还能确保答案的准确性。

简单解释 像给14岁少年讲一样

想象你在玩一个关于百科全书的游戏,每次你回答问题时,游戏会要求你指出答案的来源。DocAttriBench就像是一个超级助手,它能帮你快速找到答案的具体位置。通过一种叫MAPPET的方法,它能识别出哪些图文信息对答案最重要。就像你在玩游戏时,这个助手会告诉你应该看哪一页的哪个部分。这种方法不仅能提高找答案的效率,还能确保答案的准确性。

术语表

MAPPET (掩码困惑度归因方法)

一种结合文档布局和语言建模的方法,用于识别答案最具信息量的元素。

用于DocAttriBench中实现文档VQA的答案定位。

DocAttriBench (文档归因基准)

一个大规模的文档VQA基准,提供元素级定位注释。

用于评估多模态大模型在文档VQA中的表现。

多模态大模型 (MLLMs)

能够处理多种数据类型(如文本和图像)的机器学习模型。

在文档理解和答案定位中应用。

困惑度 (Perplexity)

衡量语言模型生成句子的概率,困惑度越低,模型对答案的置信度越高。

用于MAPPET方法中评估元素的重要性。

视觉答案定位 (Visual Answer Grounding)

识别支持答案的具体视觉证据的任务。

在文档VQA中用于提高答案的准确性和可验证性。

开放问题 这项研究留下的未解疑问

  • 1 如何提高MAPPET在复杂文档上的表现?
  • 2 如何减少自动化注释中的错误和虚假定位?
  • 3 如何进一步提高多模态大模型的定位能力?

应用场景

近期应用

文档分析

研究人员可以使用DocAttriBench来评估和改进文档VQA模型的性能。

远期愿景

智能文档处理

未来可以开发出更智能的文档处理系统,自动识别和定位文档中的关键信息。

原文摘要

Answer grounding in document visual question answering remains an open challenge: most benchmarks lack grounding annotations or provide limited-quality labels, while constructing grounded datasets still requires costly manual effort. We introduce DocAttriBench (DAB), a large-scale benchmark for fine-grained, element-level source attribution in Document VQA, grounding answers to specific layout elements such as text blocks, tables, and images. To build DAB, we propose a Mask-based Perplexity-Derived Attribution method (MAPPET) that combines document layout and language modeling to identify the most informative element for each answer. MAPPET measures the increase in perplexity after masking candidate elements and attributes the answer to the element contributing most to model confidence. Applying MAPPET to multiple existing Document VQA datasets yields DAB, with 237k documents and 296k question-answer pairs with element-level grounding. We benchmark grounding-capable multimodal LLMs on DAB, evaluating answer accuracy, attribution accuracy, and overall answer quality. Results show that while larger models generally achieve higher answer accuracy, even the strongest models often fail to localize the supporting elements. DAB provides a scalable benchmark for developing grounded, verifiable, and trustworthy Document VQA models. Dataset and code are available at https://aimagelab.github.io/DocAttriBench/.

cs.CV