MonkeyOCR v1.5 Technical Report: Unlocking Robust Document Parsing for Complex Patterns

TL;DR

MonkeyOCR v1.5通过视觉一致性强化学习和两阶段管道实现复杂文档解析,OmniDocBench性能提升2.34%。

cs.CV 🔴 高级 2025-11-13 32 次浏览
Jiarui Zhang Yuliang Liu Zijun Wu Guosheng Pang Zhili Ye Yupei Zhong Junteng Ma Tao Wei Haiyang Xu Weikai Chen Zeen Wang Qiangjun Ji Fanxi Zhou Qi Zhang Yuanrui Hu Jiahao Liu Zhang Li Ziyang Zhang Qiang Liu Xiang Bai
OCR 文档解析 表格识别 视觉语言模型 强化学习

核心发现

方法论

MonkeyOCR v1.5采用两阶段管道:第一阶段通过视觉语言模型(VLM)预测布局和阅读顺序,第二阶段进行区域级内容识别。同时引入视觉一致性强化学习(GRPO)优化表格解析,并设计图像解耦表格解析和类型引导表格合并模块,解决嵌入图像和跨页表格问题。

关键结果

  • 结果1:在OmniDocBench v1.5上,MonkeyOCR v1.5整体性能提升2.34%,表格识别准确率提升3.77%。
  • 结果2:在OCRFlux复杂数据集上,MonkeyOCR v1.5比PPOCR-VL性能提升8.2%。
  • 结果3:在PubTabNet上,表格识别准确率达到90.7%,优于MinerU2.5的89.1%。

研究意义

MonkeyOCR v1.5通过统一的视觉语言框架和强化学习,显著提升复杂文档解析能力,解决了嵌入图像、跨页表格等长期存在的难题,为文档智能领域提供了新的技术路径。

技术贡献

技术贡献包括:1)视觉一致性强化学习框架,利用渲染对比提升表格解析精度;2)图像解耦表格解析模块,分离图像和文本处理;3)类型引导表格合并,自动重建跨页或跨列表格。

新颖性

首次提出基于视觉一致性的强化学习用于表格解析,并结合图像解耦和类型引导技术,显著提升复杂场景下的文档解析性能。

局限性

  • 局限1:对极端复杂的多语言文档支持有限,尤其是非主流语言。
  • 局限2:对超高分辨率文档的处理速度仍需优化。
  • 局限3:视觉一致性强化学习对计算资源需求较高。

未来方向

未来方向包括:扩展多语言支持,优化高分辨率文档处理效率,以及降低强化学习的计算成本。

AI 总览摘要

MonkeyOCR v1.5是一种专为复杂文档解析设计的视觉语言框架。其两阶段管道包括布局检测与阅读顺序预测,以及区域级内容识别,显著提升了文档解析的准确性和效率。

通过引入视觉一致性强化学习(GRPO),MonkeyOCR v1.5能够在无需人工标注的情况下优化表格解析质量。此外,图像解耦表格解析模块和类型引导表格合并模块解决了嵌入图像和跨页表格的处理难题。

实验结果表明,MonkeyOCR v1.5在OmniDocBench v1.5上超越PPOCR-VL和MinerU 2.5,尤其在复杂表格场景中表现出色。这一成果为文档智能领域提供了新的技术范式,同时也为未来的研究和应用奠定了基础。

深度分析

研究背景

文档解析是文档智能领域的核心任务,支持信息抽取、检索增强生成等应用。然而,复杂布局、多层嵌套表格、嵌入图像等问题使现有OCR系统难以应对。传统方法通常采用多阶段管道,容易产生误差累积,而端到端模型则面临计算复杂度高的问题。

核心问题

现有OCR系统在处理复杂表格(如跨页表格、嵌入图像表格)时表现不佳,难以同时保证高精度和高效率。这些问题限制了文档解析技术在实际场景中的应用。

核心创新

MonkeyOCR v1.5的核心创新包括:1)视觉一致性强化学习框架,通过渲染对比提升表格解析精度;2)图像解耦表格解析模块,分离图像和文本处理;3)类型引导表格合并技术,自动重建跨页或跨列表格。

方法详解

  • �� 阶段1:使用视觉语言模型(VLM)预测布局和阅读顺序,输出JSON格式的结构化数据。
  • �� 阶段2:对检测到的区域进行内容识别,包括文本、公式和表格。
  • �� 视觉一致性强化学习:通过渲染对比优化表格解析。
  • �� 图像解耦表格解析:检测嵌入图像并生成占位符,后续替换为原始图像。
  • �� 类型引导表格合并:通过规则匹配和BERT分类器重建跨页表格。

实验设计

实验在OmniDocBench、PubTabNet和OCRFlux数据集上进行,评估MonkeyOCR v1.5在表格识别、文本解析等任务中的性能。对比基线包括PPOCR-VL、MinerU2.5等。

结果分析

MonkeyOCR v1.5在OmniDocBench上整体性能提升2.34%,表格识别准确率提升3.77%。在OCRFlux复杂数据集上,性能比PPOCR-VL高出8.2%。

应用场景

适用于金融报表解析、学术论文表格提取、复杂文档数字化等场景,可显著提升文档处理效率。

局限与展望

局限包括对非主流语言支持不足、高分辨率文档处理速度较慢,以及强化学习的计算成本较高。未来可通过优化算法和硬件加速解决。

通俗解读 非专业人士也能看懂

想象你在整理一份复杂的会议记录,其中有跨页的表格和嵌入的图片。MonkeyOCR v1.5就像一个超级助手,先帮你把页面的布局和顺序整理好,然后逐一识别每个区域的内容。对于跨页表格,它能自动拼接成完整的表格;对于嵌入图片的表格,它会先把图片单独提取出来,再还原到正确的位置。整个过程高效又准确。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,但这个拼图很复杂,有些碎片跨了两张图片,还有些碎片是图片和文字混合的。MonkeyOCR v1.5就像一个聪明的机器人,它能先把所有碎片分类,再把跨页的拼图自动拼接好。对于那些带图片的拼图,它会先把图片单独拿出来,等拼图完成后再放回去。是不是很酷?

术语表

视觉语言模型 (VLM)

一种结合视觉和语言信息的深度学习模型,用于同时理解图像和文本。

用于布局检测和阅读顺序预测。

视觉一致性强化学习

通过对比原始图像和渲染结果的一致性来优化模型性能的强化学习方法。

用于提升表格解析的准确性。

图像解耦表格解析

一种将表格中的嵌入图像与文本分离处理的方法。

用于处理含图片的复杂表格。

类型引导表格合并

通过规则匹配和语义分类器重建跨页或跨列表格的方法。

用于跨页表格的自动拼接。

OmniDocBench

一个用于评估文档解析系统性能的基准数据集。

用于实验评估MonkeyOCR v1.5的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化对非主流语言的支持?
  • 2 如何降低视觉一致性强化学习的计算成本?
  • 3 是否可以扩展至实时文档解析场景?

应用场景

近期应用

金融报表解析

快速提取财务报表中的表格和嵌入图像,提升财务分析效率。

学术文档处理

自动解析论文中的复杂表格和公式,支持学术研究。

远期愿景

实时文档解析

实现实时处理复杂文档的能力,用于动态场景如会议记录。

原文摘要

Document parsing is a core task in document intelligence, supporting applications such as information extraction, retrieval-augmented generation, and automated document analysis. However, real-world documents often feature complex layouts with multi-level tables, embedded images or formulas, and cross-page structures, which remain challenging for existing OCR systems. We introduce MonkeyOCR v1.5, a unified vision-language framework that enhances both layout understanding and content recognition through a two-stage pipeline. The first stage employs a large multimodal model to jointly predict layout and reading order, leveraging visual information to ensure sequential consistency. The second stage performs localized recognition of text, formulas, and tables within detected regions, maintaining high visual fidelity while reducing error propagation. To address complex table structures, we propose a visual consistency-based reinforcement learning scheme that evaluates recognition quality via render-and-compare alignment, improving structural accuracy without manual annotations. Additionally, two specialized modules, Image-Decoupled Table Parsing and Type-Guided Table Merging, are introduced to enable reliable parsing of tables containing embedded images and reconstruction of tables crossing pages or columns. Comprehensive experiments on OmniDocBench v1.5 demonstrate that MonkeyOCR v1.5 achieves state-of-the-art performance, outperforming PPOCR-VL and MinerU 2.5 while showing exceptional robustness in visually complex document scenarios. A trial link can be found at https://github.com/Yuliang-Liu/MonkeyOCR .

cs.CV cs.AI