Towards Scalable Spatial Intelligence via 2D-to-3D Data Lifting

TL;DR

提出基于深度估计、相机校准的2D到3D数据提升方法,生成约200万场景,显著提升空间理解性能。

cs.CV 🔴 高级 2025-07-24 40 次浏览
Xingyu Miao Haoran Duan Quanhao Qian Jiuniu Wang Yang Long Ling Shao Deli Zhao Ran Xu Gongjie Zhang
空间智能 深度估计 3D重建 数据合成 多模态学习

核心发现

方法论

本研究提出一套结合尺度不变与尺度感知深度估计的2D到3D数据提升流程。首先,通过MoGe模型获得相对深度,再利用Metric3D v2进行全局尺度校准,结合相机参数推断,将2D图像投影到真实尺度的3D空间。该流程包括:• 生成相对深度图;• 估算全局尺度因子;• 预测相机内外参数;• 利用投影公式(如公式3、4)生成点云与标注。最终,自动生成包含点云、深度图、相机姿态和丰富标注的高质量3D数据。

关键结果

  • 通过该方法生成的COCO-3D和Objects365-v2-3D数据集,涵盖约200万场景、300+类别,显著优于现有室内外场景数据集(如ScanNet、Structured3D)。在点云实例分割、语义分割、3D问答等任务中,预训练模型在多个基准上提升了4-6%的mAP和IoU指标。
  • 在点云实例分割任务中,预训练在COCO-3D后,模型在ScanNet上mAP提升至28.64%,比未预训练提升4.34%;在S3DIS上提升至24.30%。在3D密集标注任务中,模型表现优异,验证了数据的多样性和真实性。
  • 消融实验显示,结合尺度感知深度估计显著优于单一相对深度模型,且相机参数预测的精确性直接影响点云质量。整体结果表明,自动生成的高质量3D数据能有效推动空间感知和理解能力的提升。

研究意义

本研究突破了空间智能领域数据瓶颈,利用廉价、易扩展的2D图像资源,自动生成大规模、真实感强的3D场景数据,为自主机器人、增强现实等应用提供坚实基础。相比传统依赖昂贵硬件采集的3D数据,本方法大幅降低成本,拓展了空间理解的应用场景。其生成的多任务、多场景数据,有助于训练更鲁棒、更泛化的空间感知模型,推动多模态AI系统的跨越式发展。

技术贡献

本论文提出一种融合尺度不变与尺度感知深度估计的2D到3D数据提升框架,创新点在于:• 结合MoGe与Metric3D v2模型实现高精度尺度校准;• 利用相机参数预测实现真实尺度投影;• 自动生成丰富空间标注,支持多任务训练。该方法突破了现有模拟和AI生成场景的局限,提供了可扩展、真实、多样的空间数据源。

新颖性

本研究首次系统性结合尺度不变与尺度感知深度估计,自动从2D图像生成大规模、真实尺度的3D场景,填补了现有场景级3D数据缺失的空白。相较于单一深度模型或纯生成方法,本方法在尺度一致性和细节保留方面具有明显优势,显著提升了空间理解的真实性和多样性。

局限性

  • 当前方法依赖于高质量的深度估计模型,复杂场景中的遮挡和动态对象仍可能导致生成误差。
  • 相机参数预测在极端角度或低光照条件下表现不佳,影响点云的准确性。
  • 生成的3D场景主要基于静态图像,难以直接应用于动态环境中的实时感知。

未来方向

未来将结合多视角信息和动态场景建模,提升生成的3D场景的完整性与动态感知能力。同时,探索端到端训练策略,增强模型对复杂环境的适应性,推动空间智能在机器人导航、虚拟现实等领域的实际应用。

AI 总览摘要

空间智能作为人工智能的前沿方向,旨在让机器理解和交互复杂的三维环境。然而,现有的3D数据集规模有限,采集成本高昂,严重制约了该领域的发展。传统的模拟方法虽然成本低,但存在明显的仿真-现实差距,难以满足真实场景的需求。基于此,本文提出了一套创新的2D到3D数据提升流程,结合尺度不变与尺度感知深度估计技术,从单幅图像自动生成高质量的3D场景,包括点云、深度图、相机参数和丰富标注。该方法利用MoGe模型获得相对深度,再通过Metric3D v2实现全局尺度校准,结合相机参数投影到真实空间,极大降低了数据采集成本。通过在COCO和Objects365-v2数据集上应用,成功生成约200万场景,涵盖300多个类别,极大丰富了空间理解的基础数据资源。实验证明,预训练模型在点云实例分割、语义分割和3D问答任务中,性能提升显著,验证了数据的真实性和多样性。该技术不仅突破了数据瓶颈,还为自主机器人、增强现实等应用提供了坚实基础。未来,将结合多视角和动态场景,推动空间智能的广泛落地。

深度分析

研究背景

空间智能近年来成为计算机视觉和机器人领域的重要前沿。早期研究主要关注轻量级感知模型,如PointNet、VoxelNet,强调高效特征提取。随着多模态大模型的发展,出现融合视觉与语言的3D理解模型(如LAVIS、OpenVQA),推动场景理解向更高层次迈进。然而,受限于缺乏大规模、多样化的空间数据集,模型泛化能力不足,限制了实际应用。现有数据主要依赖昂贵硬件采集(如LiDAR、RGB-D相机),或模拟生成,存在真实性不足、场景复杂度有限等问题。

核心问题

当前空间智能发展受制于缺乏大规模、真实、多样的3D场景数据。硬件采集成本高、范围有限,模拟数据差距大,难以满足深度学习模型对多样性和真实性的需求。现有的AI生成3D资产多为单个对象,场景级生成不足,且缺乏尺度一致性。解决这一瓶颈,迫切需要一种低成本、高效率、真实感强的空间数据合成方法,以支撑更复杂的空间理解任务。

核心创新

本研究的创新点在于:• 提出结合尺度不变与尺度感知深度估计的2D到3D提升框架,自动生成真实尺度的场景数据;• 利用预训练模型(MoGe、Metric3D v2)实现高精度深度和尺度校准;• 结合相机参数预测,确保投影到真实空间的准确性;• 扩展至大规模、多类别、多场景的空间数据集(COCO-3D、Objects365-v2-3D),显著丰富了空间理解资源。这些创新极大降低了数据获取成本,提升了模型泛化能力。

方法详解

  • �� 采集单幅2D图像,使用MoGe模型获得相对深度图,捕获细节信息;• 利用Metric3D v2模型估算全局尺度因子,结合深度图进行尺度校准;• 预测相机内外参数(使用WildCamera和PerspectiveFields),实现图像到3D空间的投影;• 通过公式(如公式3、4)将像素点投影到世界坐标系,生成点云;• 利用2D标注(分割掩码或边界框)结合投影,自动生成3D标注;• 移除无效点,手动验证生成的点云和标注,确保质量。

实验设计

在COCO和Objects365-v2数据集上,训练预训练模型(如Mask3D、LLaVA-ReCap),进行点云实例分割、语义分割、3D问答等任务。采用标准指标(mAP、IoU)评估性能,比较不同预训练策略和模型架构。通过消融实验验证尺度感知深度估计的重要性,以及相机参数预测对点云质量的影响。在室内外场景中,模型表现优异,验证了数据的多样性和真实性。

结果分析

预训练在COCO-3D数据上,模型在点云实例分割任务中,mAP提升至28.64%,比未预训练提升4.34%;在S3DIS上提升至24.30%。在密集标注任务中,模型在多场景中表现出优异的泛化能力,验证了合成数据的有效性。消融分析显示,尺度校准和相机参数预测是提升性能的关键因素。整体结果表明,自动生成的3D场景数据能显著推动空间理解技术的发展。

应用场景

该方法可广泛应用于自主机器人导航、增强现实、虚拟试衣和场景模拟等领域。只需利用已有的2D图像资源,即可快速构建大规模空间数据集,降低成本,提升模型泛化能力。未来,结合多视角和动态场景,将进一步拓展其在实时感知和交互中的应用潜力。

局限与展望

目前方法依赖深度估计模型的性能,复杂场景中的遮挡和动态对象仍可能导致误差。相机参数预测在极端角度或低光照条件下表现不足,影响点云的准确性。生成场景主要为静态环境,难以直接应用于动态实时感知,未来需结合多视角和动态建模技术以完善。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,手里拿着食材(图片),但你不知道这些食材的具体大小和位置。这个研究就像用特殊的眼镜(深度估计和相机参数)帮你看清楚每一样食材的真实大小和位置,然后用这些信息把所有食材放到正确的碗里(3D场景)。以前,要做这些需要昂贵的设备和很多时间,但现在只用普通的照片,就能快速、准确地还原出厨房的样子。这就像用魔法一样,让机器变得更聪明,能理解复杂的空间环境。

简单解释 像给14岁少年讲一样

想象你在学校的操场上拍了一张照片,你知道里面有很多人、球和椅子,但不知道它们的真实大小和距离。这个研究就像用特别的算法,把照片变成一个3D的模型,让你可以看到每个人和东西的真实大小和位置。以前,要做到这一点需要昂贵的设备,比如激光扫描仪,但现在只用普通的相机和一些聪明的数学方法,就能做到。它就像给照片装上了“魔法眼”,让机器可以理解空间,就像我们用眼睛看东西一样清楚。

术语表

深度估计 (Depth Estimation)

用算法预测场景中每个像素到相机的距离,分为相对深度和尺度感知深度。

在论文中用于从单幅图像生成3D场景。

尺度校准 (Scale Calibration)

调整深度图的尺度,使其反映真实世界的距离关系。

确保生成的3D模型具有正确的大小。

相机参数 (Camera Parameters)

描述相机内外参数,包括焦距、主点、位置和姿态,用于空间投影。

用于将2D图像投影到3D空间。

点云 (Point Cloud)

由空间中大量点组成的3D数据,反映场景的几何结构。

作为3D场景的核心表示。

多模态大模型 (MLLM)

结合视觉、语言等多模态信息进行理解和推理的深度学习模型。

用于空间理解和问答任务。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升深度估计在复杂场景中的准确性,尤其是动态环境中的表现仍是挑战。现有模型在遮挡和光照变化时表现不足,未来需结合多视角和动态信息增强模型鲁棒性。
  • 2 生成的3D场景在动态交互和实时感知方面仍有限制,如何实现实时更新和动态建模是未来研究重点。

原文摘要

Spatial intelligence is emerging as a transformative frontier in AI, yet it remains constrained by the scarcity of large-scale 3D datasets. Unlike the abundant 2D imagery, acquiring 3D data typically requires specialized sensors and laborious annotation. In this work, we present a scalable pipeline that converts single-view images into comprehensive, scale- and appearance-realistic 3D representations - including point clouds, camera poses, depth maps, and pseudo-RGBD - via integrated depth estimation, camera calibration, and scale calibration. Our method bridges the gap between the vast repository of imagery and the increasing demand for spatial scene understanding. By automatically generating authentic, scale-aware 3D data from images, we significantly reduce data collection costs and open new avenues for advancing spatial intelligence. We release two generated spatial datasets, i.e., COCO-3D and Objects365-v2-3D, and demonstrate through extensive experiments that our generated data can benefit various 3D tasks, ranging from fundamental perception to MLLM-based reasoning. These results validate our pipeline as an effective solution for developing AI systems capable of perceiving, understanding, and interacting with physical environments.

cs.CV cs.AI