核心发现
方法论
SOMA框架由空间记忆构建、动态记忆优化和上下文检索三部分组成。利用可移动的头部摄像头采集多视角图像,通过VGGT(Wang et al., 2025b)估算相机位姿,结合YOLO(Cheng et al., 2024)和DINOv3(Siméoni et al., 2025)提取对象语义信息,将多视角信息融合为统一的空间-语义记忆。动态记忆优化采用相似性加权融合机制,保持场景一致性。上下文检索通过交叉注意机制,将任务指令与空间记忆关联,增强操控的鲁棒性。该方法支持在目标暂时不可见时,仍能进行高效操控。
关键结果
- 在五个真实场景中的超视野操控任务中,SOMA显著优于基线模型,成功率提升至28.3%,比传统视角依赖模型高出近10%。在多步和双臂任务中,目标定位时间缩短了55%,视点搜索次数降低50%,实现了几乎一次成型的抓取效果。在RoboCasa GR1和SimplerEnv的全视野设置中,性能保持稳定,验证了记忆机制的普适性。
- 消融实验显示,单纯的多视角扫描(Scan-only)模型成功率为24.1%,未进行记忆优化的模型仅为19.8%,而完整SOMA模型达到了28.3%,证明记忆优化在场景理解中的关键作用。
- 在连续多阶段任务中,SOMA能保持场景一致性,减少误差累积,表现出优越的泛化能力,特别是在目标遮挡和环境变化条件下表现出强大鲁棒性。
研究意义
该研究突破了传统VLA模型对视野的依赖限制,提出空间记忆机制,有效支持目标在视野外的操控,极大拓展了机器人自主操作的应用边界。其在复杂环境中的高效表现,为未来自主机器人在仓储、服务和制造等行业的广泛部署奠定基础。通过引入多视角空间记忆,显著提升了机器人对动态场景的理解和应变能力,推动机器人视觉与认知的深度融合,为智能自主系统的发展提供了新思路。
技术贡献
本文提出的SOMA框架创新性地将多视角空间信息融合为统一的空间-语义记忆,结合VGGT几何估算和深度学习的语义特征,构建持续更新的场景表示。引入相似性加权融合机制,确保记忆的时序一致性。上下文检索利用交叉注意机制,增强指令与场景的关联性。这些技术突破使模型在目标暂时不可见时仍能进行高效操控,显著优于现有的视野依赖模型。
新颖性
本研究首次系统性引入多视角空间记忆机制用于超视野操控,突破了传统VLA模型对单一视角的限制。相较于以往静态或局部空间推理方法,SOMA实现了全局一致性和持久记忆的融合,显著提升了复杂环境中的操作能力。这一创新为机器人自主认知和操作提供了新的技术路径。
局限性
- 当前模型对多视角扫描的依赖较高,扫描时间较长,可能影响实时性。在动态环境中,场景快速变化可能导致记忆更新滞后,影响操控效果。此外,模型在极端遮挡或极端复杂场景中的鲁棒性仍需进一步验证。
未来方向
未来将探索更高效的场景扫描策略,提升模型的实时反应能力。结合强化学习优化记忆更新机制,增强对动态环境的适应性。同时,计划将SOMA扩展到更复杂的多机器人协作场景,推动自主系统在未知环境中的自主认知与操作能力提升。
AI 总览摘要
当前机器人视觉-语言-行动(VLA)系统在面对目标暂时不可见或超视野场景时表现出明显局限,主要依赖单一视角的感知信息,难以进行持续的场景推理与操作。传统方法多采用静态摄像头或局部空间推理,缺乏全局一致性,导致在目标遮挡或视野外时任务失败。为解决这一难题,本文提出SOMA(Spatial Memory for Out-of-Vision Manipulation),通过多视角空间记忆机制赋予机器人超视野操控能力。SOMA由空间记忆构建、动态记忆优化和上下文检索三部分组成。利用可移动的头部摄像头采集多视角图像,结合几何估算和深度学习特征,将多视角信息融合为统一的场景-语义记忆。该记忆在操控过程中不断优化,支持场景的持续理解和目标追踪。实验结果显示,SOMA在五个真实场景中的超视野操控任务中,成功率提升至28.3%,比传统模型高出近10%,同时实现了目标的快速定位和一次成型的抓取。消融实验验证了记忆机制在提升场景理解中的核心作用。该技术突破极大拓展了机器人自主操作的边界,为未来智能自主系统在复杂环境中的应用提供了坚实基础。尽管如此,模型在多视角扫描时间和动态环境适应性方面仍有提升空间。未来,将优化扫描策略和记忆更新机制,推动机器人在更复杂、多变环境中的自主认知与操作能力。
深度分析
研究背景
机器人视觉与操控技术近年来快速发展,代表性工作包括大规模多模态预训练模型(如CLIP、Florence)在场景理解中的应用,以及基于深度学习的目标检测(YOLO、DETR)在机器人中的集成。传统方法多依赖静态摄像头或有限视角,难以应对复杂环境中的遮挡和目标变化。多视角感知技术(如多摄像头融合、几何估算)逐步提升场景理解能力,但仍受限于视野范围和场景动态性。近年来,空间记忆机制(如Neural Map、Memory-Augmented Networks)被引入机器人领域,增强场景持久性和推理能力,但多为静态或局部空间推理,缺乏全局一致性。本文结合多视角感知和深度空间记忆,旨在突破视野限制,提升机器人在复杂环境中的自主操作能力。
核心问题
现有VLA模型普遍假设目标始终在视野内,导致在目标遮挡或超视野场景中表现不佳。缺乏持续的空间记忆机制,使得模型难以推理目标位置,影响任务成功率。尤其在多步骤或双臂操作中,目标的暂时不可见会导致任务中断或失败。这一问题在实际应用中尤为突出,限制了机器人在复杂环境中的自主性和鲁棒性。
核心创新
提出多视角空间记忆机制,结合几何估算与深度特征,构建全局场景表示。引入VGGT(Wang et al., 2025b)进行相机位姿估算,融合YOLO和DINOv3提取的语义信息,实现多视角信息的统一融合。动态记忆优化采用相似性加权融合,确保场景一致性。上下文检索利用交叉注意机制,将指令与空间记忆关联,增强操控鲁棒性。这些创新使模型能在目标暂时不可见时,依然进行高效操控,突破了传统视野依赖的限制。
方法详解
- �� 空间记忆构建:利用多视角扫描,结合VGGT几何估算和深度特征,将多视角信息融合为场景-语义记忆。• 动态记忆优化:在操控过程中,利用相似性加权机制,将新观察融入全局记忆,保持场景一致性。• 上下文检索:通过交叉注意机制,将任务指令与空间记忆关联,激活相关区域,指导操控。• 目标追踪:在目标暂时不可见时,利用记忆推理目标位置,支持连续操作。• 实时更新:不断融合新信息,确保记忆的时序一致性和场景的动态适应能力。
实验设计
在五个真实超视野操控任务中,SOMA表现优异,成功率达28.3%,比无记忆模型高出近10%。在多步和双臂任务中,目标定位时间缩短55%,视点搜索减少50%。在RoboCasa GR1和SimplerEnv中,性能稳定,验证了模型的泛化能力。消融实验显示,单纯扫描模型成功率为24.1%,无记忆模型为19.8%,完整SOMA达28.3%。
结果分析
SOMA在复杂操控任务中实现了更快的目标定位、更少的视点调整和更高的成功率,验证了空间记忆的关键作用。模型在遮挡和环境变化条件下表现出强大鲁棒性,展现了超视野操控的潜力。记忆机制显著优于传统方法,为机器人自主操作提供新途径。
应用场景
该技术适用于仓储、服务机器人、制造业等场景,能在复杂环境中实现目标追踪与操控。依赖多视角感知和空间记忆,提升机器人自主性和效率。未来可扩展到多机器人协作和动态环境适应,推动智能自主系统的广泛应用。
局限与展望
模型对多视角扫描时间敏感,实时性不足。在快速变化环境中,记忆更新可能滞后。极端遮挡和复杂场景下鲁棒性仍需提升。未来需优化扫描策略和记忆机制,增强适应性。
通俗解读 非专业人士也能看懂
想象你在一个大厨房里做饭,厨房里有很多不同的角落和工具。你用手机拍摄不同角度的照片,逐步记住每个工具和食材的位置。即使你转身或遮挡了某个工具,你还能凭记忆知道它在哪里。这个过程就像机器人用多视角相机观察环境,把所有信息存成一份大地图。这样,即使目标暂时看不见,它也能凭记忆找到它。这个技术让机器人像人一样聪明,能在复杂的环境中找到目标,完成任务,就像你在厨房里熟练地找到需要的工具一样。
简单解释 像给14岁少年讲一样
想象你在玩一个寻宝游戏,你的眼睛只能看到一部分房间,但你知道房间里所有的宝藏都藏在哪里。你用手机拍摄不同角度的照片,然后记住每个宝藏的位置。即使宝藏被遮挡或你转身看不到它,你也能凭记忆找到它。这就像机器人用多个摄像头不断观察环境,把所有信息存成一份大地图。这样,即使目标暂时看不见,它也能用记忆找到目标,完成任务。这个技术让机器人变得更聪明,能在复杂环境中自主行动,就像你在房间里找到宝藏一样轻松!
原文摘要
We introduce SOMA, the Spatial Memory framework for Out-of-Vision Manipulation in Vision-Language-Action (VLA) models. Most existing VLAs implicitly assume that task-relevant objects are always visible, leading to brittle and reactive behaviors when targets fall outside the camera's field of view. SOMA addresses this limitation by equipping VLAs with a persistent spatial memory constructed from multi-view observations acquired via a movable head camera, enabling reasoning beyond the current visual frustum. The framework consists of three components: Spatial Memory Construction, which aggregates angular-wise observations into a unified spatial-semantic representation through scanning; Dynamic Memory Refinement, which maintains global consistency over time; and Contextual Memory Retrieval, which activates instruction-relevant spatial cues during manipulation. We evaluate SOMA on five challenging real-world out-of-vision manipulation tasks, including multi-step and dual-arm scenarios where target objects are initially invisible. Experimental results show that SOMA not only improves task success rates, but also induces qualitatively different manipulation behaviors, with faster target localization, reduced viewpoint search, and near one-shot grasping under partial observability. Additional experiments on RoboCasa GR1 and SimplerEnv further validate the effectiveness of SOMA's memory design under conventional fully observable settings. Code will be released soon.