cs.CV 2603.15386

RieMind: Geometry-Grounded Spatial Agent for Scene Understanding

RieMind constructs explicit 3D scene graphs (3DSG) for static indoor scene reasoning, outperforming previous methods with up to 16% improvement under ideal perceptual conditions.

Fernando Ropero, Erkin Turkoz, Daniel Matos et al.

2026-03-16 3 citations 35
cs.CV 2603.13224

Visual-ERM: Reward Modeling for Visual Equivalence

Visual-ERM enhances vision-to-code tasks with fine-grained visual rewards, significantly outperforming existing models.

Ziyu Liu, Shengyuan Ding, Xinyu Fang et al.

2026-03-14 1 citations 219