cs.CV 2509.24251

Latent Visual Reasoning

Latent Visual Reasoning (LVR) enables end-to-end reasoning in visual embedding space, boosting perception-intensive visual question answering by 5% (71.67% vs 66.67%).

Bangzheng Li, Ximeng Sun, Jiang Liu et al.

2025-09-29 39
cs.CV 2509.14232

GenExam: A Multidisciplinary Text-to-Image Exam

GenExam is a multidisciplinary text-to-image benchmark with 1000 samples across 10 subjects, integrating detailed prompts, ground-truth images, and fine-grained scoring.

Zhaokai Wang, Penghao Yin, Xiangyu Zhao et al.

2025-09-18 33