POP-3D: Open-Vocabulary 3D Occupancy Prediction from Images
POP-3D introduces a zero-shot open-vocabulary 3D occupancy prediction model leveraging multimodal self-supervised learning, achieving 78% mIoU on nuScenes without manual annotations.
Antonin Vobecky, Oriane Siméoni, David Hurych et al.