PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models
PRISM leverages multi-view videos and a 3D knowledge ontology to enhance embodied VLM's spatial, physical, and action understanding in retail environments.
Amirreza Rouhi, Parikshit Sakurikar, Satya Sai Reddy et al.