SpatialCLI: Learning to Reason With Spatial Tools, Then Without Them

TL;DR

SpatialCLI通过三阶段学习,将空间工具的感知能力内化,提升VLM的空间推理能力,实验中从29.3%提升至84.6%。

cs.AI 🔴 高级 2026-07-30 61 次浏览
Yang Zhou Zixuan Huang Sunzhu Li Zhuo Yang Chen Zhang Shunian Chen Caijun Yan Jianyao Xu Shunyu Liu Weijie Fu Peiliang Li Xiaozhi Chen Yuxiang Cai
空间推理 多模态学习 外部工具 模型内化 embodied AI

核心发现

方法论

SpatialCLI采用Call-Learn-Internalize三阶段框架:第一阶段Call通过调用SAM、Grounding DINO等专家模型作为空间工具,增强VLM的感知能力;第二阶段Learn利用Cold-Start SFT和基于策略的RL优化工具调用策略;第三阶段Internalize将成功的工具使用轨迹转化为模型内部的推理链,通过双视角训练实现感知能力的内化。该方法结合外部空间工具与模型内推理,显著提升多空间任务的表现。实验中,基于Qwen3-VL-8B-Instruct模型,工具辅助性能从29.3%提升至84.6%,超越GPT-5.6 Sol的72.1%。

关键结果

  • 在SpatialCLI-Bench上,SpatialCLI-8B模型使用工具后,准确率从29.3%提升到84.6%,无工具状态下仍达73.8%,显示内化能力强大。模型在多任务空间推理(定位、分割、深度、姿态)中表现优异,整体提升超过50%。
  • 在MindCube等复杂场景中,工具辅助模型表现提升显著,特别是在深度和姿态任务中,性能提升超过20%。训练后模型能在无需外部工具时保持较高推理能力,验证了内化效果。
  • 对比现有方法如SpaceTools和AlloSpatial,SpatialCLI在多任务协作和感知能力内化方面表现更优,验证了其在复杂空间推理中的优势。

研究意义

该研究突破了VLM在空间感知和推理中的瓶颈,将外部专家模型的感知能力转化为模型内在能力,推动基础模型向具备复杂空间理解的方向发展。这不仅提升了机器人、自动驾驶等 embodied AI的性能,也为多模态、多任务空间推理提供了新思路。通过内化感知能力,模型未来能在无需外部工具的情况下,进行更高效、更自主的空间推理,极大增强AI的自主性和适应性。

技术贡献

提出SpatialCLI框架,结合工具调用、策略优化和轨迹内化技术,系统性地将空间专家模型的感知能力内化到VLM中。创新点包括:引入多阶段训练流程,利用轨迹Verbalization实现感知链的自然语言表达,以及双视角训练确保能力的内化与工具策略的兼容。这一体系架构突破了传统单一模型感知能力的限制,为基础模型的空间理解提供了新途径。

新颖性

首次系统性结合空间工具调用与模型内推理,通过轨迹内化实现感知能力的自主学习。不同于以往仅依赖外部工具或单一感知模型的方法,SpatialCLI实现了多空间能力的协同与内化,推动基础模型向具备复杂空间推理的方向发展。这在多模态空间任务中具有里程碑意义。

局限性

  • 当前方法依赖大量成功轨迹的采集,训练成本较高,且在极端复杂场景下仍存在感知误差。模型在某些多目标、多遮挡环境中仍表现不稳定,说明感知内化尚未完全解决所有空间推理难题。
  • 对空间工具的依赖可能限制模型在未覆盖场景中的泛化能力,未来需增强工具的多样性和鲁棒性。
  • 模型训练过程复杂,参数调优和轨迹采集效率有待优化,实际部署时对计算资源要求较高。

未来方向

未来将探索更高效的轨迹采样与内化机制,提升模型在极端复杂场景中的表现。还计划结合强化学习与自监督技术,减少对标注轨迹的依赖,增强模型的自主感知能力。此外,将扩展空间工具的多样性,支持更复杂的空间推理任务,推动基础模型在实际机器人和自动驾驶中的应用落地。

AI 总览摘要

随着 embodied AI向真实世界环境深入发展,空间感知与推理成为核心挑战。传统的通用视觉-语言模型(VLM)在理解整体任务方面表现出色,但在细节感知和空间关系推理上仍存在不足。专门的空间感知模型虽能提供精确的局部信息,却难以转化为任务级的决策依据。为解决这一瓶颈,本文提出SpatialCLI框架,分为Call、Learn、Internalize三阶段,系统性地将空间专家模型的感知能力内化到VLM中。

在第一阶段,调用SAM、Grounding DINO等模型作为空间工具,增强感知能力;第二阶段,通过Cold-Start SFT和策略RL优化工具调用策略,提升工具使用的效率与准确性;第三阶段,将成功的工具轨迹转化为自然语言推理链,实现感知能力的自主内化。该方法在多个空间任务和基准上均取得了优异表现,尤其在MindCube和SpatialCLI-Bench中,性能提升显著。

实验结果显示,内化后模型在无需外部工具时仍保持较高推理能力,验证了感知能力的有效内化。这一突破不仅增强了基础模型的空间理解能力,也为机器人、自动驾驶等应用提供了更强的自主感知和推理能力。未来,SpatialCLI有望通过扩展工具多样性和优化训练流程,推动 embodied AI迈向更高的智能水平。

深度分析

研究背景

空间感知与推理一直是多模态AI研究的重要方向。早期工作如Visual Grounding、3D理解模型(如SAM、VGGT)主要解决局部感知任务,但难以实现复杂空间关系的整合。近年来,结合大规模预训练模型(如GPT、Qwen系列)与空间任务的研究逐渐兴起,但仍存在感知细节不足、任务级推理困难的问题。空间工具的引入(如SpaceTools、AlloSpatial)改善了局部感知,但缺乏系统的内化机制,限制了模型自主推理能力。本文在此基础上,提出将空间专家模型作为工具,通过轨迹内化实现感知能力的自主学习,填补了这一空白。

核心问题

现有模型在空间任务中表现有限,主要原因是缺乏有效的感知能力内化机制。虽然外部工具能提供精确的局部信息,但模型难以自主决定何时调用工具、如何整合多源信息,导致推理不连续或不准确。这限制了模型在复杂、多目标场景中的应用能力。解决这一问题需要一种机制,使模型不仅能调用工具,还能将工具提供的感知信息转化为内在能力,从而实现自主、连续的空间推理。

核心创新

核心创新包括:1)提出三阶段框架,将空间工具调用、策略学习和能力内化有机结合;2)引入轨迹Verbalization,将工具使用轨迹转化为自然语言推理链,增强模型理解;3)设计双视角训练,确保模型在无工具状态下也能进行空间推理。这一体系不同于传统方法,突破了外部依赖限制,推动模型自主空间理解能力的提升。

方法详解

  • �� Call阶段:调用SAM、Grounding DINO、Depth Anything等模型作为空间工具,增强感知;• Learn阶段:利用Cold-Start SFT和基于策略的RL优化工具调用策略,提升工具使用效率;• Internalize阶段:将成功轨迹转化为自然语言推理链,通过双视角训练实现感知能力的内化;• 轨迹Verbalization:逐步将工具轨迹转化为结构化推理链,避免长文本处理困难;• 双视角训练:一方面训练模型在无工具情况下的感知推理,另一方面保持工具调用策略的有效性。

实验设计

采用Qwen3-VL-8B-Instruct、Qwen3.6-35B-A3B等模型,分别在SpatialCLI-Bench、MindCube等空间任务基准上进行评估。训练包括SFT和RL两个阶段,使用大量轨迹数据,调优参数以最大化任务准确率。对比基线模型和不同训练策略,验证工具调用和内化的有效性。实验还包括 ablation 研究,分析轨迹Verbalization和双视角训练的贡献。

结果分析

模型在SpatialCLI-Bench中,性能从29.3%提升至84.6%,无工具状态下达73.8%,表现优于现有SOTA。在复杂场景中,深度和姿态任务提升超过20%。训练后模型在无需外部工具时仍保持较高推理能力,验证了感知能力的内化。与传统方法相比,性能提升明显,验证了策略优化和轨迹内化的有效性。

应用场景

该方法可广泛应用于机器人自主导航、自动驾驶、增强现实等领域,提升系统对空间环境的理解和推理能力。未来还可结合强化学习和自监督技术,减少对标注轨迹的依赖,实现更高效的自主学习。模型的空间感知能力内化,将极大推动 embodied AI 在实际场景中的应用落地。

局限与展望

当前方法依赖大量成功轨迹,训练成本较高,且在极端复杂场景中仍存在感知误差。空间工具的覆盖范围有限,泛化能力有待提升。模型训练过程复杂,参数调优困难,实际部署时对计算资源要求较高。未来需优化轨迹采样效率,增强模型鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,厨房里有很多不同的工具,比如刀、锅、搅拌器。你知道每个工具的用法,但有时候需要用到多个工具合作完成一道菜。比如,要切菜(用刀),然后放到锅里(用锅),再用搅拌器搅拌。这就像让AI模型学会用不同的空间工具,比如识别物体、测量距离、判断姿态。最开始,模型只是知道这些工具的用法,但不能自己决定什么时候用。后来,通过反复练习和总结,模型学会了在不同场景下自主选择工具,甚至能在没有工具的情况下,凭记忆和推理完成任务。这就像你学会了厨房的所有技巧,能自己做出美味的菜肴,而不需要每次都看教程。这个过程让AI变得更聪明、更自主,能在复杂环境中灵活应对各种空间任务。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要用不同的工具,比如放大镜、剪刀、尺子,来帮你找到拼图的正确位置。刚开始,你可能不知道什么时候用哪个工具,也不知道怎么用。后来,你开始试着用放大镜找细节,用尺子测距离,慢慢总结出一套自己的方法。你还会记住每次用工具的过程,下一次遇到类似问题时就能自己解决了。这就像AI模型学会了用空间工具,先用外部专家模型帮忙看细节,然后自己总结出一套内在的推理方法。最终,它可以不用工具,也能靠记忆和推理,自己完成拼图。这个过程让它变得更聪明、更自主,就像你变成了拼图高手一样!

原文摘要

Vision-language models (VLMs) are increasingly used in embodied agents to interpret visual inputs, reason about spatial relationships, and make task-level decisions based on that reasoning. However, a fundamental capability mismatch remains: general VLMs can reason about the overall task but often miss the visual details that determine success, while specialist vision models can capture those details but cannot translate them into task-level decisions. In this work, we propose SpatialCLI, a framework that teaches VLMs to reason with spatial tools and progressively internalize the specialist perceptual capabilities they provide. SpatialCLI proceeds in three stages: (1) Call exposes specialist vision models as spatial tools to augment the VLM's perception; (2) Learn uses Cold-Start SFT and agentic RL to improve tool use; and (3) Internalize verbalizes successful tool-use trajectories to internalize specialist perceptual capabilities. We further introduce SpatialCLI-Bench, a 516-example benchmark for compositional perception across localization, segmentation, depth, and pose. On MindCube, SpatialCLI raises Qwen3-VL-8B-Instruct from 29.3% to 84.6% with tools, surpassing GPT-5.6 Sol with tools (72.1%), while retaining 73.8% without tools after internalization.

cs.AI