PRISM: A Multi-View Multi-Capability Retail Video Dataset for Embodied Vision-Language Models

TL;DR

PRISM利用多视角视频和三维知识本体,提升零售环境中 embodied VLM的空间、物理和行动理解。

cs.CV 🔴 高级 2026-03-31 36 次浏览
Amirreza Rouhi Parikshit Sakurikar Satya Sai Reddy Narsimha Menga Anirudh Govil Sri Harsha Chittajallu Rajat Aggarwal Anoop Namboodiri Sashi Reddi
多视角视频 知识本体 embodied AI 零售场景 视觉-语言模型

核心发现

方法论

PRISM基于270K样本多视角视频,结合 egocentric、exocentric和360°视角,构建空间、时间和行动三维知识本体。采用metadata提取、LLM生成、深度分析和自监督变换等多模态标注策略,覆盖20+能力探针,支持链式推理和多任务训练。模型微调采用LoRA技术,结合多视角数据增强,显著提升实体推理、空间感知和物理理解能力。

关键结果

  • 微调后在20+能力探针上的错误率平均下降66.6%,其中 embodied action理解提升36.4%,显示出模型对复杂空间和物理场景的适应能力增强。
  • 在多视角融合任务中,PRISM显著优于单视角模型,提升多目标追踪、空间布局理解和多Actor场景分析的准确率,验证多模态数据的协同作用。
  • 通过 ablation 实验发现,知识本体结构和多视角 supervision是性能提升的关键因素,单一视角或缺乏结构化知识的训练效果明显逊色。

研究意义

本研究填补了零售环境中多维空间、时间和行动知识的缺失,推动 embodied VLM在复杂实际场景中的应用。通过结构化知识和多视角数据,有效解决现有模型在空间理解、物理推理和多Actor交互中的瓶颈,为机器人自主操作、智能导购等应用提供理论基础和数据支撑,具有重要的学术和产业价值。

技术贡献

提出基于三维知识本体的多视角视频微调框架,结合多模态 supervision和参数高效微调技术,显著提升 embodied VLM的空间、物理和行动理解能力。首次在零售场景中系统集成多知识维度,构建了全新的数据采集、标注和训练流程,推动多模态、跨视角、结构化知识的深度融合。

新颖性

首次在单一真实零售环境中,系统构建涵盖空间、时间和行动三维知识的多视角视频数据集PRISM,突破了现有多模态数据多维度覆盖的限制。引入多视角 supervision与知识本体相结合的训练策略,显著优于传统单视角或非结构化数据方法,开创了 embodied VLM在复杂场景中的新范式。

局限性

  • 数据采集依赖高成本多视角硬件,难以大规模部署到不同场景,存在一定的迁移限制。
  • 模型在极端复杂场景(如多人交互激烈或遮挡严重)下仍表现有限,需进一步增强鲁棒性。
  • 训练过程中对硬件资源要求较高,模型微调和推理的计算成本较大,限制了实时应用的普及。

未来方向

未来将探索更高效的多模态融合算法,提升模型在动态复杂环境中的鲁棒性。计划扩展多场景、多任务数据,增强模型的泛化能力,并结合强化学习优化 embodied agent的自主决策能力,以实现更智能的零售机器人。

AI 总览摘要

在智能零售场景中,机器人和智能系统面临复杂的空间布局、多目标交互和动态物理环境的挑战。现有的视觉-语言模型(VLM)在基础视觉识别方面表现优异,但在理解空间关系、物理规律和行动意图方面仍存在明显不足。为解决这一问题,PRISM提出了一种基于多视角视频和三维知识本体的微调框架,旨在增强embodied VLM在实际零售环境中的空间、物理和行动理解能力。

PRISM构建了一个包含270K样本的多模态视频数据集,融合了egocentric、exocentric和360°视角,覆盖20+能力探针,涵盖空间感知、因果推理、动作预测等多个维度。数据采集采用高成本的多视角硬件,结合metadata提取、LLM生成、深度分析和自监督变换,确保数据多样性和高质量。模型微调采用LoRA技术,结合多模态 supervision,有效提升模型在复杂场景中的表现。

实验结果显示,微调后模型在20+能力探针上的错误率平均降低66.6%,实体动作理解提升36.4%。多视角融合显著优于单视角模型,验证了多模态和结构化知识的协同作用。这一研究不仅丰富了零售环境中多维空间和物理知识的表达,也为机器人自主操作、智能导购等应用提供了坚实基础。未来,PRISM将继续扩展多场景、多任务数据,增强模型的泛化和自主决策能力,推动 embodied AI在实际部署中的落地。

深度解读

原文摘要

A critical gap exists between the general-purpose visual understanding of state-of-the-art physical AI models and the specialized perceptual demands of structured real-world deployment environments. We present PRISM, a 270K-sample multi-view video supervised fine-tuning (SFT) corpus for embodied vision-language-models (VLMs) in real-world retail environments. PRISM is motivated by a simple observation - physical AI systems fail not because of poor visual recognition, but because they do not understand space, physical dynamics and embodied action well enough to operate reliably in the world. To this end, PRISM is grounded in a novel three-dimensional knowledge ontology that spans spatial knowledge, temporal and physical knowledge, and embodied action knowledge. It covers 20+ capability probes across four evaluation dimensions - Embodied Reasoning (ER), Common Sense (CS), Spatial Perception (SP), and Intuitive Physics (IP), and to our knowledge, PRISM is the first dataset to instantiate all three knowledge dimensions within a single real-world deployment domain. The corpus captures data from egocentric, exocentric and 360° viewpoints across five supermarket locations and includes open-ended, chain-of-thought, and multiple-choice supervision. At 4 fps, PRISM spans approximately 11.8M video frames and approximately 730M tokens, placing it among the largest domain-specific video SFT corpora. Fine-tuning on PRISM reduces the error rate across all 20+ probes by 66.6% over the pre-trained baseline, with significant gains in embodied action understanding where the accuracy improves by 36.4%. Our results suggest that ontology-structured, domain specific SFT can meaningfully strengthen embodied VLMs for real-world settings. The PRISM dataset and more details are available at https://dreamvu.ai/prism

cs.CV cs.AI cs.RO