AWM: Answerable Working Memory for Long-Document VQA Agents

TL;DR

AWM-GRPO方法提升长文档VQA准确性8.1和11.9点。

cs.CL 🔴 高级 2026-08-26 5 次浏览
Dongzhuoran Zhou Yuqicheng Zhu Yule Liu Zhen Yang Rui Lu Yuxiao Dong Jie Tang Evgeny Kharlamov
长文档 VQA 工作记忆 强化学习 GRPO

核心发现

方法论

AWM-GRPO方法结合了终端工作记忆的可回答性信号,将其融入GRPO奖励中。通过在MMLONGBENCH-DOC和LONGDOCURL数据集上的实验,AWM-GRPO在确保最终答案优先的同时,赋予了终端工作记忆更高的优势。

关键结果

  • AWM-GRPO在MMLONGBENCH-DOC和LONGDOCURL数据集上分别比RAG基线提高了8.1和11.9个百分点。
  • 在提供金标准证据页面的情况下,42.5%的正确答案无法仅从终端工作记忆中回答。
  • AWM-GRPO将记忆缺失正确率降低了2.7个百分点。

研究意义

该研究通过引入可回答工作记忆(AWM),填补了长文档VQA中记忆质量评估的空白。AWM-GRPO方法不仅提高了最终答案的准确性,还增强了终端工作记忆的可回答性,推动了VQA领域的进步。

技术贡献

AWM-GRPO方法在现有的GRPO框架中引入了新的奖励信号,强调终端工作记忆的质量。这种方法不仅关注最终答案的正确性,还考虑了记忆的可回答性,提供了一种新的优化方向。

新颖性

AWM-GRPO首次将终端工作记忆的可回答性作为奖励信号融入GRPO中,区别于传统方法仅关注最终答案的正确性。

局限性

  • AWM-GRPO在处理复杂表格和布局问题时仍存在挑战,可能需要进一步优化。
  • 该方法在某些跨源设置中表现不佳。

未来方向

未来研究可以探索如何进一步优化AWM-GRPO在结构化证据保存方面的表现,并扩展其在其他VQA任务中的应用。

AI 总览摘要

长文档视觉问答(VQA)系统面临着从大量页面中提取和整合信息的挑战。传统方法主要关注最终答案的正确性,而忽视了工作记忆的质量,这可能导致即使答案正确,记忆仍不支持回答。AWM-GRPO方法通过将终端工作记忆的可回答性信号融入GRPO奖励中,解决了这一问题。

AWM-GRPO在MMLONGBENCH-DOC和LONGDOCURL数据集上的实验结果表明,其在提高最终答案准确性的同时,也增强了终端工作记忆的可回答性。这一方法在确保最终答案优先的同时,赋予了终端工作记忆更高的优势。

尽管AWM-GRPO在多个数据集上表现出色,但在处理复杂表格和布局问题时仍存在挑战。未来研究可以探索如何进一步优化其在结构化证据保存方面的表现,并扩展其在其他VQA任务中的应用。

深度分析

研究背景

长文档视觉问答(VQA)系统需要从大量页面中提取信息并整合成答案。现有方法主要关注最终答案的正确性,而忽视了工作记忆的质量,这可能导致即使答案正确,记忆仍不支持回答。

核心问题

现有VQA系统在评估中主要关注最终答案的正确性,而忽视了工作记忆的质量。这可能导致即使答案正确,记忆仍不支持回答。

核心创新

AWM-GRPO方法首次将终端工作记忆的可回答性作为奖励信号融入GRPO中,区别于传统方法仅关注最终答案的正确性。

方法详解

  • �� AWM-GRPO结合终端工作记忆的可回答性信号
  • �� 在GRPO中引入新的奖励信号
  • �� 强调终端工作记忆的质量
  • �� 在MMLONGBENCH-DOC和LONGDOCURL数据集上进行实验

实验设计

实验在MMLONGBENCH-DOC和LONGDOCURL数据集上进行,使用RAG基线进行比较。关键指标包括最终答案准确性和终端工作记忆的可回答性。

结果分析

AWM-GRPO在MMLONGBENCH-DOC和LONGDOCURL数据集上分别比RAG基线提高了8.1和11.9个百分点,并将记忆缺失正确率降低了2.7个百分点。

应用场景

AWM-GRPO方法可用于提高长文档VQA系统的准确性,特别是在需要从大量页面中提取和整合信息的场景中。

局限与展望

AWM-GRPO在处理复杂表格和布局问题时仍存在挑战,可能需要进一步优化。

通俗解读 非专业人士也能看懂

想象你在一个大型图书馆里寻找一本书中的特定信息。传统方法就像在书架上翻找,找到后直接回答问题。但如果你离开书架,可能会忘记细节。AWM-GRPO方法就像在你找到信息后,记下关键点,即使离开书架也能回答问题。这种方法确保了即使没有原始书籍,你也能凭记忆回答问题。

简单解释 像给14岁少年讲一样

想象你在打游戏,需要从一个大地图中找到线索。传统方法就像在地图上找到线索后直接回答问题,但如果你离开地图,可能会忘记细节。AWM-GRPO方法就像在找到线索后,记下关键点,即使离开地图也能回答问题。这种方法确保了即使没有原始地图,你也能凭记忆回答问题。

术语表

AWM (可回答工作记忆)

一种用于长文档VQA系统的记忆机制,确保终端工作记忆中包含足够的信息以支持回答问题。

在AWM-GRPO方法中,AWM被用作奖励信号的一部分。

GRPO (群体相对优势优化)

一种强化学习方法,通过对比群体内的相对优势来更新策略。

AWM-GRPO方法中使用GRPO来优化终端工作记忆的质量。

RAG (检索-生成)

一种结合检索和生成的模型架构,用于从大规模文档中提取信息。

AWM-GRPO在实验中与RAG基线进行比较。

MMLONGBENCH-DOC

一个用于评估长文档VQA系统的数据集,包含多页文档和复杂问题。

AWM-GRPO在该数据集上进行实验以验证其有效性。

终端工作记忆

在VQA系统中,记录从页面中提取的关键信息的记忆模块。

AWM-GRPO方法强调终端工作记忆的可回答性。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化AWM-GRPO在复杂表格和布局问题上的表现?
  • 2 AWM-GRPO在其他VQA任务中的适用性如何?

应用场景

近期应用

长文档信息提取

AWM-GRPO可用于提高从长文档中提取和整合信息的准确性。

远期愿景

智能文档分析

AWM-GRPO可能推动智能文档分析系统的发展,帮助用户快速获取关键信息。

原文摘要

Long-document visual question answering increasingly relies on VLM agents that retrieve candidate pages, inspect page images, write findings to working memory, and synthesize answers. Working memory should carry answer-supporting evidence across page inspections for later grounded answering, yet existing evaluation mainly checks final-answer correctness and evidence-page access. This creates a memory-quality blind spot: an agent may reach the right page and answer correctly while leaving behind memory too generic or incomplete to support answering once page context is removed. We introduce \emph{memory-only answerability}, a diagnostic that asks whether a reader can answer from the question and terminal working memory alone. Building on this diagnostic, \emph{Answerable Working Memory} (AWM) treats terminal working memory as an answerable evidence artifact, and AWM-GRPO incorporates this signal into the GRPO reward while preserving final-answer priority. Under GRPO, this reward assigns higher advantages to answer-correct trajectories whose terminal working memory remains answerable. On \textsc{MMLongBench-Doc}, even when gold evidence pages are provided, 42.5\% of correct answers still cannot be answered from terminal working memory alone. AWM-GRPO improves final-answer accuracy over the RAG baseline by 8.1 and 11.9 points on \textsc{MMLongBench-Doc} and \textsc{LongDocURL} and reduces the memory-missing-correct rate by 2.7 points over answer-only GRPO.

cs.CL