SpatioLM: Towards General Physical Spatial Intelligence in Vision-Language Models

TL;DR

提出SpatioLM,通过非侵入式模块提升VLM空间推理能力,达成71.6分。

cs.CV 🔴 高级 2026-08-03 59 次浏览
Jing Wu Jianhua Wu Jiayi Guan Jiahong Chen Jinghui Lu Hangjun Ye Bingzhao Gao Long Chen
视觉-语言模型 空间推理 深度学习 多模态 模型优化

核心发现

方法论

SpatioLM采用冻结预训练VLM主干,插入非侵入式的Spatio-Vision模块,通过选择中间ViT层(第16层)提取视觉tokens,利用伪深度和相机信息作为监督信号,训练深度和相机射线图预测。模块由堆叠的Spatio-Vision Blocks组成,采用交替注意机制实现帧内细粒度和跨帧全局几何关系建模。训练目标结合语言模型交叉熵、视觉token蒸馏和密集几何监督,确保空间推理能力提升同时保持模型的通用性。

关键结果

  • 在VSI-Bench上,SpatioLM达到了71.6的最高分,首次突破70分,显著优于现有模型。深度估计任务中,MD-S和MD-M的准确率分别达到了83.5%和69.0%,在DA-2K和深度相关多任务中表现优异。模型在空间感知和理解任务中均优于对比模型,验证了其空间推理能力的提升,同时保持了预训练模型的通用能力。
  • 在下游的机器人操控任务中,模型表现出良好的迁移能力,能在离散和连续动作空间中实现高效空间理解,表明其在实际应用中的潜力。
  • 通过引入伪深度和相机监督,模型学习到的几何特征更具物理一致性,验证了伪标签引导的有效性。消融实验显示,交替注意机制和中间层tokens的选择对性能提升至关重要。

研究意义

本研究突破了在不依赖额外3D先验或外部空间编码器的条件下,增强视觉-语言模型的空间推理能力的瓶颈。通过参数高效的非侵入式设计,兼顾模型的通用性和空间理解能力,为多模态模型在机器人、自动驾驶等实际场景中的应用提供了新路径。该方法简化了模型架构,降低了硬件依赖,推动了多模态空间智能的研究前沿,有望引领未来更高效、更通用的空间感知模型发展。

技术贡献

提出基于冻结预训练VLM的非侵入式Spatio-Vision模块,利用中间层视觉tokens和伪深度、相机信息作为监督信号,有效激发模型内在的几何空间知识。设计交替注意机制实现帧内细粒度与跨帧全局几何关系建模,避免对预训练模型的破坏。结合密集深度和射线图预测,增强模型的物理一致性。整体架构实现参数高效、可插拔,兼容多任务,显著提升空间推理性能。

新颖性

首次提出无需额外3D先验或外部空间编码器,利用预训练VLM的隐含空间结构,通过非侵入式模块实现空间推理。采用中间层tokens提取和交替注意机制,突破了现有依赖外部几何信息或侵入式微调的限制,保持模型的通用性和扩展性。这一设计在不牺牲预训练能力的基础上,有效提升空间理解能力,具有重要创新意义。

局限性

  • 模型依赖伪深度和相机信息的质量,若伪标签偏差较大,可能影响空间推理效果。
  • 在极端复杂场景或动态环境中,空间推理的准确性仍有提升空间,尤其是在多视角或遮挡条件下。
  • 虽然参数高效,但引入的Spatio-Vision模块仍增加一定计算负担,未来需优化效率以适应实时应用。

未来方向

未来将探索多模态融合策略,增强模型对动态场景的空间理解能力;同时结合强化学习或自监督技术,提升模型在复杂环境中的鲁棒性。还计划扩展到多任务学习,涵盖更多空间相关任务,如导航、操作等,推动空间智能的广泛应用。

AI 总览摘要

随着多模态视觉-语言模型(VLMs)在语义理解和推理方面取得巨大成功,其在空间推理能力上的不足成为制约实际应用的瓶颈。传统方法多依赖外部3D先验或空间编码器,导致模型复杂度增加且通用性下降。为解决这一难题,本文提出SpatioLM,一种参数高效、非侵入式的空间推理增强框架。该方法在冻结预训练VLM主干的基础上,插入由堆叠的Spatio-Vision Blocks组成的模块,通过选择中间层tokens,利用伪深度和相机信息作为监督信号,激发模型内在的几何空间知识。交替注意机制实现帧内细粒度与跨帧全局几何关系建模,显著提升空间感知和理解能力。实验结果显示,SpatioLM在VSI-Bench上达到了71.6的优异成绩,首次突破70分大关,优于现有多模态模型,验证了其在空间推理任务中的优越性。同时,该模型在机器人操控等下游任务中表现出良好的迁移能力,彰显其实际应用潜力。该研究不仅突破了在不依赖外部3D信息的条件下增强空间推理的瓶颈,也为多模态空间智能的发展提供了新思路。未来,结合动态场景、多任务学习,将进一步推动空间智能的广泛应用。

深度分析

研究背景

多模态视觉-语言模型(VLMs)近年来在语义理解和跨模态推理中取得显著进展,代表性工作如CLIP(Radford et al., 2021)和LLaVA(Zhang et al., 2024b)等,推动了视觉问答、图像生成等应用。然而,这些模型主要专注于语义层面,空间推理能力不足,限制了在机器人导航、自动驾驶等场景中的应用。传统方法通过引入深度图、点云或外部空间编码器(如DepthLM、OmniEVA)提升空间理解,但依赖硬件或复杂预处理,难以在纯RGB场景中推广。架构改进如引入外部空间编码器(SpatialLLM)虽提升性能,但破坏预训练特征分布,影响模型通用性。近年来,利用工具调用或强化学习实现3D推理的方法虽有突破,但存在多步延迟和错误累积的问题。综上,如何在保持模型通用能力的同时,提升空间推理,是当前研究的核心难题。

核心问题

核心问题在于如何在不依赖额外3D先验或空间编码器的情况下,激发预训练VLM中的隐含空间结构,从而实现高效、准确的空间推理。现有方法多依赖外部输入或侵入式微调,导致模型复杂度增加、迁移能力下降。如何设计一种参数高效、非侵入的方案,既能激发模型内在的几何空间知识,又能保持其在多任务、多场景下的通用性,是亟待解决的难题。这一问题关系到多模态模型在实际应用中的可扩展性和鲁棒性,尤其在机器人、自动驾驶等对实时性和精度要求极高的场景中尤为关键。

核心创新

本研究提出SpatioLM,核心创新在于:1)利用预训练VLM的中间层视觉tokens,避免依赖外部3D输入;2)设计非侵入式的Spatio-Vision模块,通过堆叠的交替注意机制,捕获帧内细粒度和跨帧全局几何关系;3)引入伪深度和相机信息作为监督,指导模型学习物理一致的空间特征;4)采用参数高效的微调策略,仅训练空间模块,保持预训练模型的通用性。这些创新突破了传统依赖外部空间信息的限制,显著提升模型空间推理能力,同时保持了多任务适应性。

方法详解

  • �� 视觉输入:采用预训练VLM的视觉编码器,提取中间层(第16层)视觉tokens,作为空间特征的基础。
  • �� 空间特征激发:通过堆叠的Spatio-Vision Blocks,利用交替注意机制,分别建模帧内细粒度几何和跨帧全局几何关系。
  • �� 伪监督:引入伪深度和相机射线图作为监督信号,训练密集深度和射线图预测子头,增强空间特征的物理一致性。
  • �� 模块设计:模块由参数少的堆叠块组成,采用零初始化的投影层融合空间特征,插入到冻结的语言模型中。
  • �� 训练目标:结合交叉熵、视觉token蒸馏和密集几何损失,优化空间推理能力,同时保持模型的语义理解能力。
  • �� 推理阶段:无需额外3D输入,仅通过激活空间模块,进行高效的空间推理和任务执行。

实验设计

采用VSI-Bench、深度估计(MD-S、MD-M、DA-2K)和空间理解(路线规划、对象关系)等多项任务,验证模型性能。训练数据涵盖真实与合成场景,模型在64块GPU上训练600轮,微调空间模块。对比基线包括现有空间增强模型和纯预训练模型,指标涵盖准确率、误差、成功率等。通过消融实验验证交替注意机制和中间层tokens的重要性,评估模型迁移到机器人操控任务中的表现。

结果分析

SpatioLM在VSI-Bench上达到了71.6分,超越所有对比模型,深度估计指标中MD-S达83.5%、MD-M达69.0%。在多任务深度推理中表现优异,验证了空间理解的提升。迁移到机器人操控任务后,表现出优异的空间感知和路径规划能力,显示出良好的泛化性。消融实验显示,交替注意机制和中间层tokens的选择对性能提升至关重要。整体结果证明,该方法在提升空间推理能力的同时,保持了模型的通用性。

应用场景

该模型适用于机器人导航、自动驾驶、增强现实等场景,能在无需额外硬件的情况下实现高精度空间理解。通过微调空间模块,可快速适应不同任务需求,极大降低部署成本。未来结合强化学习,有望实现自主空间推理与决策,推动智能机器人和自动驾驶系统的发展。

局限与展望

模型对伪深度和相机信息的依赖可能在极端环境中表现不佳,尤其在动态或遮挡复杂场景。虽然参数高效,但引入的空间模块仍增加计算负担,需优化以满足实时应用需求。未来需增强模型对多视角、多动态场景的适应性,提升鲁棒性和泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和操作。每台机器都能完成特定任务,但它们都需要知道彼此的位置和关系。以前,工厂会用专门的地图或传感器告诉每台机器它们的相对位置,但这样很麻烦,也容易出错。现在,假设你有一台聪明的机器人,它可以通过观察周围的机器,自己学会它们之间的距离和位置,而不需要额外的地图或传感器。这个机器人就像论文中的SpatioLM,它利用已有的视觉信息(比如图片中的物体)和一些虚拟的“深度”信息,自己理解空间关系。这样,它可以更好地导航、操作,甚至帮忙做复杂的任务。这个方法让机器人变得更聪明、更灵活,也更容易在不同环境中工作,就像人类用眼睛观察和判断空间一样。

简单解释 像给14岁少年讲一样

想象你在玩一款超级酷的游戏,你的角色需要在房间里找到隐藏的宝藏。以前,你只能靠猜测或者用特殊的地图来知道宝藏在哪,但这很麻烦,也不总是准。现在,有一种新方法,就像你有一双会“看见”空间的眼睛,不用额外的地图,只靠观察房间里的东西,就能知道它们之间的距离和位置。这就像论文里的SpatioLM,它用一种聪明的方式,从图片里提取信息,然后自己学会理解空间关系。它还会用一些虚拟的“深度”信息,帮自己更好地判断距离。这样一来,它就能帮你更快找到宝藏,甚至在复杂的房间里也能表现得很棒。这就像让机器变得更聪明,能自己理解空间,帮人类完成各种任务,未来会变得更酷!

原文摘要

Vision-Language Models (VLMs) perform well on commonsense reasoning tasks but struggle with visual spatial reasoning. Most existing solutions introduce extra 3D prior inputs or external spatial encoders, which increase complexity and degrade the underlying VLMs' general-purpose capabilities after spatial fine-tuning. To this end, we propose a parameter-efficient \textit{\textbf{Spatio}-vision \textbf{L}anguage \textbf{M}odels (SpatioLM)}, that enhances spatial intelligence without extra 3D prior inputs or third-party spatial encoders. Concretely, we design a plug-and-play and non-invasive spatio-vision module that elicits the spatial knowledge inherent in VLMs. Furthermore, we innovatively leverage pseudo depth and camera information as supervision to guide the model in learning physically coherent representations. Extensive experiments show that SpatioLM achieves significant improvements in diverse tasks, including spatial perception and understanding while effectively limiting the degradation of general capabilities. Notably, the model achieves an impressive score of 71.6 on the VSI-Bench (the first model to surpass 70). In addition, it attains competitive performance when transferred to embodied manipulation tasks. Code is available at \href{https://github.com/xiaomi-research/spatio-lm}{\faGithub~spatio-lm}.

cs.CV cs.CL cs.LG