cs.CV 2511.05271

DeepEyesV2: Toward Agentic Multimodal Model

DeepEyesV2 employs a two-stage training and dynamic tool invocation to enhance multimodal reasoning, achieving 63.7% accuracy on RealX-Bench.

Jack Hong, Chenxiao Zhao, ChengLin Zhu et al.

2025-11-07 36