DeepSeek-OCR 2: Visual Causal Flow

TL;DR

DeepSeek-OCR 2通过DeepEncoder V2实现视觉因果流,提升OmniDocBench v1.5性能3.73%。

cs.CV 🔴 高级 2026-01-28 32 次浏览
Haoran Wei Yaofeng Sun Yukun Li
视觉语言模型 因果推理 文档识别 深度学习 图像处理

核心发现

方法论

DeepSeek-OCR 2采用DeepEncoder V2,结合视觉标记和因果流查询,通过自定义注意力掩码实现视觉标记的动态重排序。视觉标记使用双向注意力,而因果流查询使用因果注意力,最终输出仅因果流查询结果。

关键结果

  • DeepSeek-OCR 2在OmniDocBench v1.5上达到91.09%的性能,比DeepSeek-OCR提升3.73%。
  • 在阅读顺序编辑距离上,DeepSeek-OCR 2从0.085降至0.057。
  • 在文本识别编辑距离上,DeepSeek-OCR 2在大多数文档类型上表现优于前代。

研究意义

该研究在视觉语言模型中引入因果推理,模拟人类视觉处理的逻辑顺序,解决了传统模型中视觉标记固定顺序的问题。通过这种方法,DeepSeek-OCR 2在复杂文档布局的理解上取得了显著进展,为多模态模型的统一编码提供了新思路。

技术贡献

DeepSeek-OCR 2的技术贡献在于其创新的DeepEncoder V2架构,通过因果流查询实现视觉标记的动态重排序,打破了传统视觉语言模型中固定顺序的限制。此外,它还展示了语言模型架构在视觉编码中的潜力。

新颖性

DeepSeek-OCR 2首次将因果推理应用于视觉标记的动态重排序,与传统的固定顺序处理方法相比,提供了更接近人类视觉的处理方式。

局限性

  • 在处理文本密集型文档如报纸时,性能下降明显,可能由于视觉标记上限较低。
  • 训练数据中报纸样本不足,影响了模型在该类文档上的表现。

未来方向

未来工作可增加视觉标记的上限以提高文本密集型文档的识别能力,并扩充训练数据中的报纸样本。此外,探索更长的因果流查询以实现多次重排序也是可行的方向。

AI 总览摘要

DeepSeek-OCR 2通过引入DeepEncoder V2,解决了传统视觉语言模型中视觉标记固定顺序的问题。该模型模拟人类视觉的因果推理能力,能够根据图像语义动态重排序视觉标记,从而提升复杂文档布局的理解能力。

DeepEncoder V2通过自定义注意力掩码实现视觉标记的动态重排序,视觉标记使用双向注意力,而因果流查询使用因果注意力。这种设计使得视觉标记可以在不改变数量的情况下进行语义排序,从而实现更接近人类视觉的处理方式。

在OmniDocBench v1.5上的实验结果显示,DeepSeek-OCR 2在整体性能上比前代提升了3.73%,特别是在阅读顺序和文本识别上表现出色。尽管在处理文本密集型文档时仍有改进空间,但该模型为多模态模型的统一编码提供了新的思路。

深度分析

研究背景

近年来,视觉语言模型(VLMs)在图像和文本的联合理解中取得了显著进展。然而,传统模型通常采用固定的视觉标记顺序,这与人类灵活的视觉处理方式相悖。DeepSeek-OCR 2通过引入因果推理,模拟人类视觉的动态处理能力,为复杂文档布局的理解提供了新的解决方案。

核心问题

传统视觉语言模型在处理复杂布局的图像时,通常采用固定的视觉标记顺序,这种方法忽略了图像中语义关系的重要性。如何实现视觉标记的动态重排序,以更好地模拟人类视觉处理,是一个亟待解决的问题。

核心创新

DeepSeek-OCR 2通过DeepEncoder V2实现视觉标记的动态重排序。• 采用因果流查询,实现视觉标记的语义排序。• 自定义注意力掩码,视觉标记使用双向注意力,因果流查询使用因果注意力。• 仅输出因果流查询结果,提升模型的语义理解能力。

方法详解

  • �� 视觉标记通过视觉标记器进行初步处理。• DeepEncoder V2通过自定义注意力掩码实现视觉标记的动态重排序。• 视觉标记使用双向注意力,因果流查询使用因果注意力。• 最终输出仅因果流查询结果,供语言模型解码器使用。

实验设计

实验在OmniDocBench v1.5上进行,涵盖9大类文档。使用的视觉标记上限为1120,评估指标包括整体性能、文本识别编辑距离和阅读顺序编辑距离。通过与DeepSeek-OCR的对比,验证了新模型的有效性。

结果分析

DeepSeek-OCR 2在OmniDocBench v1.5上达到91.09%的性能,比DeepSeek-OCR提升3.73%。在阅读顺序编辑距离上,DeepSeek-OCR 2从0.085降至0.057,显示出显著的改进。

应用场景

DeepSeek-OCR 2可用于复杂文档的OCR任务,特别是在需要高精度文本识别和阅读顺序理解的场景中。其动态重排序能力使其在多模态模型的训练数据生成中具有重要应用价值。

局限与展望

尽管DeepSeek-OCR 2在大多数文档类型上表现优异,但在处理文本密集型文档如报纸时,性能下降明显。这可能是由于视觉标记上限较低和训练数据中报纸样本不足所致。未来可通过增加视觉标记上限和扩充训练数据来改进。

通俗解读 非专业人士也能看懂

想象你在整理一本复杂的相册,里面有各种照片和说明。传统的方法是按顺序翻阅每一页,但DeepSeek-OCR 2像是一个聪明的助手,它会根据每张照片的内容和重要性,重新安排它们的顺序,让你更容易找到想要的照片。它就像一个懂得优先级的朋友,帮助你快速找到最相关的信息。

简单解释 像给14岁少年讲一样

嘿,小朋友!想象你在玩一个拼图游戏,传统的方法是按顺序拼,但DeepSeek-OCR 2像是一个超级聪明的拼图助手,它会根据每块拼图的图案和颜色,重新安排它们的顺序,让你更快完成拼图。是不是很酷?这就是它在处理复杂文档时的工作方式哦!

术语表

视觉标记 (Visual Token)

图像被分割成的小块,每个小块代表图像的一部分信息。

在DeepSeek-OCR 2中,视觉标记用于表示图像的基本单元。

因果流查询 (Causal Flow Query)

一种用于动态重排序视觉标记的机制,模仿人类视觉的因果推理。

在DeepEncoder V2中,因果流查询用于重新排列视觉标记。

自定义注意力掩码 (Custom Attention Mask)

一种用于控制注意力机制的掩码,决定哪些标记可以互相关注。

在DeepEncoder V2中,自定义注意力掩码用于实现视觉标记的双向注意力和因果流查询的因果注意力。

OmniDocBench v1.5

一个用于评估文档识别性能的基准数据集,包含多种文档类型。

DeepSeek-OCR 2在OmniDocBench v1.5上进行性能评估。

编辑距离 (Edit Distance)

衡量两个字符串之间差异的指标,表示需要多少次编辑才能将一个字符串转换为另一个。

在文档识别中,用于评估文本识别和阅读顺序的准确性。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加计算复杂度的情况下,提高文本密集型文档的识别性能?
  • 2 如何扩展因果流查询的能力,以支持更复杂的视觉任务?

应用场景

近期应用

文档OCR服务

DeepSeek-OCR 2可用于在线OCR服务,提供高精度的文档识别和阅读顺序理解。

远期愿景

多模态模型训练

通过生成高质量的训练数据,支持多模态模型的统一编码和训练。

原文摘要

We present DeepSeek-OCR 2 to investigate the feasibility of a novel encoder-DeepEncoder V2-capable of dynamically reordering visual tokens upon image semantics. Conventional vision-language models (VLMs) invariably process visual tokens in a rigid raster-scan order (top-left to bottom-right) with fixed positional encoding when fed into LLMs. However, this contradicts human visual perception, which follows flexible yet semantically coherent scanning patterns driven by inherent logical structures. Particularly for images with complex layouts, human vision exhibits causally-informed sequential processing. Inspired by this cognitive mechanism, DeepEncoder V2 is designed to endow the encoder with causal reasoning capabilities, enabling it to intelligently reorder visual tokens prior to LLM-based content interpretation. This work explores a novel paradigm: whether 2D image understanding can be effectively achieved through two-cascaded 1D causal reasoning structures, thereby offering a new architectural approach with the potential to achieve genuine 2D reasoning. Codes and model weights are publicly accessible at http://github.com/deepseek-ai/DeepSeek-OCR-2.

cs.CV