Hierarchical multimodal transformers for Multi-Page DocVQA

TL;DR

提出层次多模态Transformer Hi-VT5,处理多页文档问答,达成85.95%的准确率。

cs.CV 🔴 高级 2022-12-07 40 次浏览
Rubèn Tito Dimosthenis Karatzas Ernest Valveny
多模态 Transformer 多页文档 问答系统 深度学习

核心发现

方法论

本文基于T5架构,设计层次编码器-解码器模型Hi-VT5,利用每页编码器提取关键信息,结合特殊[PAGE]标记,解码器生成答案并预测答案页。模型融合OCR文本、布局和视觉特征,采用层次化Transformer结构,支持长序列输入(最多20480 tokens),解决多页文档信息整合难题。预训练阶段引入布局感知去噪任务,增强模型对布局和语义的理解能力。

关键结果

  • 在MP-DocVQA数据集上,Hi-VT5在oracle设置中达成50.01%的准确率,ANLS为0.6572,显著优于BERT、Longformer、LayoutLMv3等基线模型,展示其在多页长文本处理中的优势。
  • 模型还能准确预测答案所在页面,达到79.23%的页面识别准确率,有助于模型解释性和推理能力提升。
  • 通过在仅用两页训练的条件下微调,模型仍能接近全页训练的性能,验证其层次结构的有效性和训练效率。

研究意义

该研究突破了多页长文档问答的瓶颈,填补了现有单页数据集的空白,为实际场景中的文档理解提供了可行方案。模型在工业、金融、行政等领域具有广泛应用潜力,推动智能文档处理技术迈向更高水平。

技术贡献

提出层次多模态Transformer架构Hi-VT5,创新性地结合页级摘要和页面预测机制,有效扩展了Transformer处理长序列的能力。引入布局感知预训练任务,增强模型对复杂文档结构的理解。模型支持多模态融合,提升问答准确率和解释性,为多页文档理解提供新思路。

新颖性

首次在多页文档问答任务中引入层次Transformer架构,结合页面摘要和页面定位,突破序列长度限制,显著优于传统单页模型。创新点在于多模态融合与层次化信息抽取的结合,增强模型的长文本理解能力。

局限性

  • 模型在极长(超过20页)文档上表现尚未优化,训练成本较高,需多GPU资源支持。
  • 对复杂布局和手写文本的鲁棒性仍有待提升,特别是在OCR识别错误较多的场景。
  • 目前训练依赖于预定义的页面范围,未来需探索更灵活的全文理解机制。

未来方向

未来将探索多模态预训练策略的优化,提升模型对复杂布局和手写文本的鲁棒性。计划引入更高效的长序列处理机制,支持超长文档理解。同时,结合知识图谱等外部知识源,增强推理能力,推动多页文档理解的广泛应用。

AI 总览摘要

在数字化信息爆炸的时代,文档管理成为企业和公共机构的核心任务。传统的文档理解方法多局限于单页场景,难以应对实际中多页、复杂布局的长文档。本文提出了层次多模态Transformer——Hi-VT5,旨在突破长序列处理瓶颈,实现多页文档的问答任务。该模型采用页级编码器对每页内容进行摘要,结合视觉和布局特征,利用特殊[PAGE]标记将每页关键信息融合到解码器中。模型在预训练阶段引入布局感知去噪任务,增强对复杂结构的理解能力。实验在新构建的MP-DocVQA数据集上取得了优异表现,准确率达50.01%,ANLS为0.6572,远超现有基线模型。模型不仅能生成准确答案,还能预测答案所在页面,增强模型的可解释性。这一突破为工业、金融、行政等领域的自动化文档处理提供了新工具。未来工作将聚焦于模型鲁棒性提升、超长文档支持及知识融合,推动多页文档理解技术的广泛应用。

深度分析

研究背景

随着企业和机构对电子文档的依赖增加,文档理解技术不断发展。早期方法主要依赖规则和模板,难以应对多样化布局和复杂内容。近年来,深度学习特别是Transformer架构的引入极大提升了文本理解能力。代表性工作如LayoutLM系列,通过融合布局信息显著改善了文档理解效果。单页问答数据集如SingleDocVQA推动了模型性能,但实际应用中多页长文档仍未得到充分解决。现有模型在序列长度限制和多模态融合方面存在瓶颈,限制了其在复杂场景中的应用。

核心问题

多页长文档的理解面临信息碎片化、序列长度限制和布局复杂性等挑战。传统Transformer模型受限于最大输入长度(如512或1024 tokens),难以直接处理数百页内容。OCR识别错误、复杂布局和多模态信息融合也增加了理解难度。此外,缺乏有效的模型机制以识别答案所在页面,影响模型的可解释性和推理能力。这些问题限制了多页文档在实际场景中的应用效果,亟需创新的模型架构和训练策略。

核心创新

本文提出Hi-VT5架构,首次引入层次化多模态Transformer,结合页级摘要和页面预测机制,突破序列长度限制。创新点包括:

  • �� 页级编码器:对每页独立提取关键信息,支持长序列输入。
  • �� 特殊[PAGE]标记:融合每页摘要,增强模型对多页信息的整合能力。
  • �� 预训练布局感知去噪:引导模型理解复杂布局结构。
  • �� 多模态融合:结合OCR文本、视觉特征和布局信息,提升理解和推理能力。这些创新使模型能在单阶段内完成多页问答任务,显著优于传统方法。

方法详解

  • �� 输入:每页OCR文本、视觉特征和布局信息,结合问题。
  • �� 编码:每页通过Transformer编码器提取关键信息,生成页级摘要[PAGE]标记。
  • �� 融合:所有页的[PAGE]标记拼接形成全局表示。
  • �� 解码:解码器基于全局表示生成答案,并预测答案页。
  • �� 预训练:布局感知去噪任务,掩盖部分tokens,模型利用布局信息预测。
  • �� 微调:在部分长文档上训练后,使用全长文档进行微调,优化性能。

实验设计

在MP-DocVQA数据集上,模型采用50%的训练比例,评估指标包括准确率和ANLS。对比基线模型如BERT、Longformer、LayoutLMv3,验证模型在多页长文本中的优势。模型参数约316M,支持20480 tokens输入,训练采用两页片段策略以降低成本。通过消融实验验证层次结构、布局感知任务和多模态融合的重要性。模型在答案准确率和页面预测准确率上均优于基线,证明其有效性。

结果分析

模型在oracle设置中达成50.01%的准确率,ANLS为0.6572,明显优于BERT(34.78%)和LayoutLMv3(42.70%)。页面预测准确率达79.23%,显示模型良好的推理和解释能力。微调实验表明,训练仅用两页即可获得接近全页性能,验证层次结构设计的有效性。模型在长文档场景中表现优异,显著提升多页文档问答的实用性。

应用场景

该模型适用于企业自动化处理财务报告、法律文件、行政档案等多页复杂文档。通过集成OCR和多模态特征,支持自动问答、信息抽取和文档索引,极大提升工作效率。未来可结合知识图谱实现推理增强,推动智能文档管理系统的发展。

局限与展望

模型在超长(超过20页)文档上的表现仍有限,训练成本高,需大量GPU资源。对手写文本和极复杂布局的鲁棒性不足,OCR错误影响性能。未来需优化模型结构,降低计算成本,增强多模态融合能力。

通俗解读 非专业人士也能看懂

想象你在整理一本厚厚的百科全书,每一章都很多页,里面有图片、表格和文字。现在你要回答一个问题,比如“哪一章讲的是动物?”传统方法就像只看一页,可能漏掉重要信息。而这个新方法就像有一个聪明的助手,先帮你总结每一章的重点内容,然后再告诉你答案在哪一章,甚至还能告诉你答案的具体位置。它还会告诉你答案来自哪一页,就像告诉你“答案在第5章第3页”。这样,你就可以快速找到答案,也能理解它是怎么找到的。这就像有个聪明的导游,帮你在复杂的书中找到想要的内容,既快又准。

简单解释 像给14岁少年讲一样

假设你有一本很厚的书,要找出答案,比如“哪一页讲的是恐龙?”以前的方法就像只翻一页,可能错过重要信息。现在,这个新方法像有个超级助手,先帮你总结每一页的内容,然后告诉你答案在哪一页,还能告诉你答案是在哪一页找到的。它用一种聪明的方式,把所有页面的重点都记下来,然后再组合起来,帮你快速找到答案。这就像你有个聪明的朋友,帮你在一堆书里找到你要的内容,而且还能告诉你答案在哪一页,方便你自己去看。这让找信息变得又快又准,也更容易理解答案是怎么来的。

原文摘要

Document Visual Question Answering (DocVQA) refers to the task of answering questions from document images. Existing work on DocVQA only considers single-page documents. However, in real scenarios documents are mostly composed of multiple pages that should be processed altogether. In this work we extend DocVQA to the multi-page scenario. For that, we first create a new dataset, MP-DocVQA, where questions are posed over multi-page documents instead of single pages. Second, we propose a new hierarchical method, Hi-VT5, based on the T5 architecture, that overcomes the limitations of current methods to process long multi-page documents. The proposed method is based on a hierarchical transformer architecture where the encoder summarizes the most relevant information of every page and then, the decoder takes this summarized information to generate the final answer. Through extensive experimentation, we demonstrate that our method is able, in a single stage, to answer the questions and provide the page that contains the relevant information to find the answer, which can be used as a kind of explainability measure.

cs.CV cs.AI cs.CL