cs.CV 2601.20552

DeepSeek-OCR 2: Visual Causal Flow

DeepSeek-OCR 2 uses DeepEncoder V2 for visual causal flow, achieving a 3.73% performance boost on OmniDocBench v1.5.

Haoran Wei, Yaofeng Sun, Yukun Li

2026-01-28 31
cs.CV 2601.16093

SAMTok: Representing Any Mask with Two Words

SAMTok discretizes masks into two tokens, enabling pixel-level understanding without architectural changes.

Yikang Zhou, Tao Zhang, Dengxian Gong et al.

2026-01-23 39
cs.CV 2601.14246

Soft Tail-dropping for Adaptive Visual Tokenization

Proposes Soft Tail-dropping Adaptive Tokenizer (STAT), dynamically adjusting token count based on image complexity, improving reconstruction and generation quality.

Zeyuan Chen, Kai Zhang, Zhuowen Tu et al.

2026-01-21 39