MARDoc: A Memory-Aware Refinement Agent Framework for Multimodal Long Document QA

TL;DR

MARDoc通过结构化记忆实现多模态长文档问答,显著提升多跳推理性能。

cs.CL 🔴 高级 2026-06-04 45 次浏览
Kaifeng Chen Hongtao Liu Qiyao Peng Jian Yang Yongqiang Liu Xiaochen Zhang Qing Yang
多模态 长文档问答 结构化记忆 多轮推理 智能代理

核心发现

方法论

MARDoc采用探索-提炼-反思的三阶段架构,利用动态结构化记忆替代传统单一上下文。探索阶段通过多粒度多模态检索获取信息,提炼阶段将交互轨迹压缩为结构化证据和推理记忆,反思阶段评估证据充分性并提供反馈。核心算法包括多模态检索工具、基于Transformer的记忆压缩机制和反思策略。模型在多轮交互中依赖更新的结构化记忆,有效减少噪声,增强事实保持和逻辑关系。

关键结果

  • 在MMLongBench-Doc和DocBench上,MARDoc使用Qwen3-VL-30B基础模型实现准确率57.1%,超越同样骨架的基线模型,表现出优异的多跳推理能力。相较传统单一上下文方法,结构化记忆显著降低信息稀散带来的噪声,提升模型对跨页、多模态信息的整合效率。
  • 在不同证据页数条件下,MARDoc表现出更强的鲁棒性,误差增长缓慢,验证了结构化记忆在长文档多跳推理中的优势。消融实验显示,提炼模块和反思模块缺一不可,缺失会导致性能大幅下降。
  • 模型在多模态长文档问答任务中达到了与闭源模型相当的效果,验证了结构化记忆在提升推理质量和效率方面的潜力。

研究意义

该研究突破了长文档多模态问答中的上下文膨胀问题,提出结构化记忆机制,有效缓解信息碎片化和逻辑断裂,推动智能代理在复杂场景中的应用。其方法不仅提升模型性能,也为未来多轮推理和知识管理提供新思路,具有重要的学术价值和工业应用前景。

技术贡献

提出基于动态结构化记忆的多模态长文档问答框架,创新性地将交互轨迹压缩为事实和推理链,避免传统单一上下文带来的信息稀释。引入多粒度检索、记忆提炼和反思机制,增强模型的多跳推理和错误检测能力,为长文本理解提供新技术路径。

新颖性

首次将结构化记忆引入多模态长文档问答,突破单一上下文的限制,结合多轮交互中的记忆提炼与反思策略,有效提升多跳推理的准确性和鲁棒性。这一设计区别于以往依赖全局上下文和单纯检索的方案,提供了更为高效的知识管理和推理机制。

局限性

  • 当前模型对极长或极复杂的文档仍存在信息遗漏和推理失误,尤其在多模态信息融合方面仍有提升空间。
  • 结构化记忆的构建和维护增加了计算成本,模型在大规模应用中可能面临效率瓶颈。
  • 未来需探索更智能的记忆压缩策略和多模态信息的深层融合,以应对更复杂的实际场景。

未来方向

未来将结合强化学习优化记忆更新策略,增强模型的自主学习能力;同时探索更高效的多模态信息编码和推理机制,扩展到更广泛的应用场景,如法律、医疗等专业领域。此外,结合知识图谱和外部知识库,提升模型的知识覆盖和推理深度。

AI 总览摘要

随着信息技术的发展,长文档的多模态问答成为人工智能研究的重要方向。现有方法多依赖单一上下文或全局检索,面临信息碎片化、逻辑断裂和噪声累积等挑战。为解决这一难题,本文提出MARDoc,一种基于结构化记忆的多轮推理框架。该方法引入探索-提炼-反思的三阶段机制,通过动态更新的结构化记忆,有效压缩交互轨迹,减少噪声干扰,提升多跳推理能力。实验结果显示,MARDoc在MMLongBench-Doc和DocBench两个长文档多模态问答基准上,均优于传统单一上下文模型,达到57.1%的准确率,表现出强大的推理和信息整合能力。这一创新机制不仅改善了模型的鲁棒性,也为未来多模态长文本理解提供了新的技术路径。尽管如此,模型在极长或复杂场景下仍存在一定局限,未来将结合强化学习和知识图谱,进一步提升性能和应用范围。整体而言,MARDoc的提出为多模态长文档问答开启了新的研究方向,具有重要的学术价值和实际应用潜力。

深度分析

研究背景

多模态长文档问答经历了从单模态短文本到跨页、多模态复杂场景的演变。早期研究主要依赖OCR和端到端模型(如Xu等,2020,2021),但受限于长文本处理能力。近年来,检索增强方法(如Guo等,2025)通过有限的检索范围缓解输入限制,但多模态信息的跨页关联仍困难。代理技术(如Sun等,2025)引入规划和工具调用,提升探索能力,但仍受单一上下文限制,难以实现高效多跳推理。结构化记忆机制(如Wu等,2025b)逐渐成为焦点,旨在解决信息碎片化和逻辑断裂问题,为长文本理解提供新思路。

核心问题

长文档多模态问答面临信息分散、跨页关联困难和多轮推理噪声累积等核心瓶颈。传统方法依赖全局上下文,随着交互轮次增加,关键证据被稀释,导致推理准确率下降。如何在保证信息完整的同时,有效过滤噪声,提升多跳推理的效率和鲁棒性,成为亟待解决的问题。这不仅关系到模型的理解能力,也影响实际应用中的可靠性和效率。

核心创新

本文提出结构化记忆机制,创新点包括:

  • �� 引入探索-提炼-反思的三阶段流程,动态维护长文档的事实和推理链;
  • �� 设计多模态检索工具,结合视觉和文本信息,提升信息获取的粒度和准确性;
  • �� 利用记忆提炼模块,将交互轨迹压缩为结构化的证据和推理链,避免噪声累积;
  • �� 反思机制评估证据充分性,提供针对性反馈,指导下一轮检索。这些创新有效缓解了传统方法中的信息稀散和逻辑断裂问题。

方法详解

  • �� 构建文档结构化轮廓,作为检索基础。• 探索阶段利用多模态工具检索相关信息,生成初步推理链。• 提炼阶段将交互轨迹压缩为结构化的证据和推理记忆,存入动态记忆库。• 反思阶段评估证据充分性,生成反馈指导下一轮检索。• 迭代过程中,结构化记忆不断更新,保持信息的相关性和逻辑性。• 最终利用反思结果生成答案,确保事实和推理的准确性。

实验设计

在MMLongBench-Doc和DocBench两个长文档基准上,采用Qwen3-VL-30B和Qwen3-VL-8B模型作为基础架构。比较对象包括传统单轮模型、检索增强模型和多轮代理模型。评估指标为准确率(Accuracy)和F1值,采用GPT-4o作为答案提取和评估工具。通过消融实验验证提炼和反思模块的重要性,分析不同证据页数对性能的影响。实验结果显示,MARDoc在多跳推理任务中显著优于对比模型,验证了结构化记忆的有效性。

结果分析

在两个基准上,MARDoc使用Qwen3-VL-30B模型达成57.1%的准确率,优于传统单一上下文模型(如DocAgent的49.1%)。在多证据页数增加时,模型性能下降幅度较小,表现出更强的鲁棒性。消融实验显示,提炼模块和反思模块缺一不可,缺失会导致性能大幅下降,验证了结构化记忆的关键作用。整体而言,模型在复杂多模态长文本中实现了高效推理和事实保持,为长文本问答提供了新解决方案。

应用场景

该技术可广泛应用于金融报告分析、科学文献理解、企业文件检索等场景,特别适合需要跨页、多模态信息整合的复杂任务。未来结合知识图谱和外部知识库,将极大提升模型的知识覆盖和推理深度,为智能决策和自动化分析提供强大支持。

局限与展望

模型在极长或极复杂文档中仍存在信息遗漏和推理失误,尤其在多模态信息深度融合方面有待提升。结构化记忆的维护增加计算成本,影响大规模部署的效率。未来需优化记忆压缩策略,提升模型的推理速度和准确性,拓展到更多实际应用场景。

通俗解读 非专业人士也能看懂

想象你在整理一本非常厚的书,里面有很多不同的章节、图片和表格。每次你想找到某个问题的答案,你不会一页页翻看全部内容,而是先用目录找到相关章节,然后只关注那些重要的部分。你还会记住自己找到的关键信息,避免重复查找。这样做可以节省时间,也不容易被无关信息干扰。MARDoc就像这样,它用一种聪明的方式,把所有信息整理成结构化的“目录”和“笔记”,让模型在回答问题时更快更准,避免被无关的细节迷惑。

简单解释 像给14岁少年讲一样

你知道当你在学校找答案时,不会每次都翻遍所有书页,而是用目录或索引快速找到相关内容,然后只看那些重要的部分?如果书里有很多图片、表格和文字,你还会用笔记把关键点记下来,方便下次查找。MARDoc就像这样聪明的学生,它用一种特别的方法,把所有的知识点整理成有条理的“笔记”和“索引”。每次回答问题时,它会先找出最重要的证据,把这些证据整理好,然后再用这些“笔记”来得出答案。这样一来,它就不用被无关的细节干扰,能更快、更准确地找到答案,就像你用索引和笔记帮你快速找到想要的内容一样。

术语表

结构化记忆 (Structured Memory)

一种将交互轨迹和推理链压缩成有组织的事实和逻辑关系的存储机制,帮助模型高效管理长文本信息。

在MARDoc中,用于替代传统的全局上下文,保持关键证据和推理链的完整性。

多模态检索 (Multimodal Retrieval)

结合文本、图像、表格等多种模态信息,通过工具检索相关内容,提升信息获取的粒度和准确性。

探索阶段利用多模态工具,从结构化轮廓中检索证据。

提炼模块 (Refiner)

将交互轨迹压缩为结构化的事实和推理链,减少噪声,增强推理连贯性。

在每轮交互后,提炼模块更新结构化记忆。

反思机制 (Reflector)

评估当前证据的充分性和推理的正确性,提供反馈指导下一轮检索。

确保模型在多轮推理中保持事实准确和逻辑合理。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升结构化记忆的压缩效率以应对极长文档?
  • 2 多模态信息融合的深层机制如何优化以减少噪声?
  • 3 模型在实际工业场景中的适应性和鲁棒性仍需验证。

应用场景

近期应用

财务报告分析

自动理解长篇财务报告中的关键信息,帮助投资者和分析师快速获取核心数据,提升决策效率。

科学文献理解

辅助科研人员快速梳理长篇论文中的实验结果和逻辑关系,促进科研进展。

远期愿景

智能法律文档处理

实现对复杂法律文件的自动理解和推理,辅助法律工作者进行案件分析和证据整理。

原文摘要

Iterative retrieval-reasoning agents have recently shown promise for multimodal long-document question answering. However, most existing systems maintain a single growing context that mixes retrieval traces, observations, and intermediate reasoning. As interactions accumulate, key evidence becomes scattered and diluted, making multi-hop reasoning noisy. We propose MARDoc, a Memory-Aware Refinement Agent framework that decouples long-document QA into three specialized agents: an Explorer for multi-granularity multimodal retrieval, a Refiner for distilling interaction traces into structured evidence and reasoning memories, and a Reflector for checking evidence sufficiency and providing targeted feedback. Across iterations, the agents rely on a dynamically updated structured memory rather than a full accumulated interaction history. This design reduces context noise while preserving answer-critical facts and their logical dependencies. Experiments on MMLongBench-Doc and DocBench show that MARDoc achieves strong results, outperforming same-backbone baselines and demonstrating the effectiveness of structured memory for agentic document QA.

cs.CL cs.AI