Efficient Camera Pose Augmentation for View Generalization in Robotic Policy Learning

TL;DR

GenSplat通过3D高斯散射实现视图泛化,提升机器人策略学习的鲁棒性。

cs.RO 🔴 高级 2026-03-31 26 次浏览
Sen Wang Huaiyi Dong Jingyi Tian Jiayi Li Zhuo Yang Tongtong Cao Anlin Chen Shuang Wu Le Wang Sanping Zhou
3D重建 视图泛化 机器人学习 高斯散射 策略增强

核心发现

方法论

GenSplat采用前馈3D高斯散射框架,通过从稀疏、未校准的输入中重建高保真3D场景来实现视图泛化。该方法使用置换等变架构,并设计了3D先验蒸馏策略以防止几何崩溃。通过渲染多样的合成视图,系统性地增强观察空间。

关键结果

  • 在大规模扰动下,GenSplat使策略成功率提高了56%,从27.78%提升到43.33%。
  • 在中等扰动下,策略成功率提高了8.9%。
  • 小扰动下,成功率提高了6.7%。

研究意义

GenSplat在机器人策略学习中通过视图泛化显著提升了策略的鲁棒性。它解决了现有2D视觉策略在新视图下泛化能力不足的问题,减少了对昂贵数据收集的依赖,推动了机器人在真实世界中的可扩展部署。

技术贡献

GenSplat通过前馈3DGS框架实现了几何一致的视图增强,消除了对传感器校准和场景优化的需求。3D先验蒸馏策略确保了合成视图的几何一致性,为策略学习提供了可靠的数据。

新颖性

GenSplat首次在稀疏、未校准的机器人数据集上实现了高保真3D场景重建,突破了传统方法对密集多视图覆盖和精确相机校准的依赖。

局限性

  • 在极端稀疏视图下,可能出现拓扑碎片和不一致遮挡。
  • 对3D先验模型的依赖可能限制其在不同领域的适用性。

未来方向

未来工作可探索在更复杂环境下的应用,以及减少对3D先验模型的依赖,以提高通用性。

AI 总览摘要

现有的2D视觉策略在处理新视图时表现不佳,限制了机器人在真实环境中的应用。GenSplat通过3D高斯散射框架实现了视图泛化,能够从稀疏、未校准的输入中重建高保真3D场景。其核心技术包括置换等变架构和3D先验蒸馏策略,确保了合成视图的几何一致性。实验结果显示,GenSplat在各种扰动下显著提高了策略的鲁棒性,尤其是在大规模扰动下,成功率提高了56%。这一方法不仅提升了策略的执行能力,还减少了对昂贵数据收集的依赖,具有广泛的应用潜力。然而,该方法在极端稀疏视图下可能出现拓扑碎片,未来工作可探索在更复杂环境下的应用。

深度分析

研究背景

在机器人学习中,2D视觉策略因其对静态观察的依赖而难以泛化到新视图。这种局限性限制了机器人在真实环境中的应用,尤其是在视角变化频繁的场景中。近年来,3D重建技术的发展为解决这一问题提供了新的思路。

核心问题

现有2D视觉策略在新视图下泛化能力不足,导致在空间扰动下表现不佳。这一问题不仅影响了策略的鲁棒性,还增加了数据收集的成本。

核心创新

GenSplat通过前馈3D高斯散射框架实现了视图泛化。其创新点在于:1) 使用置换等变架构重建高保真3D场景;2) 设计3D先验蒸馏策略,确保几何一致性;3) 通过合成视图增强观察空间。

方法详解

  • �� 使用置换等变架构从稀疏输入中重建3D场景。• 设计3D先验蒸馏策略,防止几何崩溃。• 渲染多样的合成视图,增强观察空间。

实验设计

实验在真实机器人平台上进行,使用Franka Research 3臂和Robotiq 2F-85夹爪。评估六个操作任务,收集100个专家演示,涵盖丰富的空间和视觉多样性。

结果分析

在大规模扰动下,GenSplat使策略成功率提高了56%。在中等扰动下,成功率提高了8.9%。小扰动下,成功率提高了6.7%。

应用场景

GenSplat可用于机器人操作任务中的视图泛化,减少对昂贵数据收集的依赖,提高策略的鲁棒性。

局限与展望

在极端稀疏视图下,可能出现拓扑碎片和不一致遮挡。对3D先验模型的依赖可能限制其在不同领域的适用性。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师需要从不同角度观察食材来准备菜肴。传统方法就像厨师只能从一个固定位置看,导致准备不充分。GenSplat就像给厨师提供了一个全景镜头,可以从多个角度观察食材,确保每个步骤都准确无误。通过这种方式,厨师可以更好地准备菜肴,而不必担心视角的限制。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,需要从不同角度观察地图。传统方法就像只能从一个固定位置看地图,导致你可能错过一些重要信息。GenSplat就像给你一个全景视角,可以从多个角度观察地图,确保你不会错过任何细节。这样,你就能更好地完成任务,而不必担心视角的限制。

术语表

3D Gaussian Splatting (3D高斯散射)

一种用于重建3D场景的技术,通过高斯函数参数化场景几何。

用于实现视图泛化的核心技术。

View Generalization (视图泛化)

使策略能够在未见过的视图下执行的能力。

GenSplat的主要目标。

Permutation-Equivariant Architecture (置换等变架构)

一种架构设计,确保输入顺序不影响输出结果。

用于3D场景重建的关键组件。

3D-Prior Distillation (3D先验蒸馏)

从预训练模型中提取几何知识以指导重建的策略。

用于防止几何崩溃的关键策略。

Robotic Policy Learning (机器人策略学习)

通过学习算法使机器人能够执行特定任务的过程。

GenSplat的应用领域。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端稀疏的视图条件下保持几何一致性?
  • 2 如何减少对3D先验模型的依赖以提高通用性?

应用场景

近期应用

机器人操作任务

通过视图泛化提高机器人在复杂环境中的操作能力,减少数据收集成本。

远期愿景

自动驾驶

通过视图泛化提高自动驾驶系统在复杂交通环境中的鲁棒性。

原文摘要

Prevailing 2D-centric visuomotor policies exhibit a pronounced deficiency in novel view generalization, as their reliance on static observations hinders consistent action mapping across unseen views. In response, we introduce GenSplat, a feed-forward 3D Gaussian Splatting framework that facilitates view-generalized policy learning through novel view rendering. GenSplat employs a permutation-equivariant architecture to reconstruct high-fidelity 3D scenes from sparse, uncalibrated inputs in a single forward pass. To ensure structural integrity, we design a 3D-prior distillation strategy that regularizes the 3DGS optimization, preventing the geometric collapse typical of purely photometric supervision. By rendering diverse synthetic views from these stable 3D representations, we systematically augment the observational manifold during training. This augmentation forces the policy to ground its decisions in underlying 3D structures, thereby ensuring robust execution under severe spatial perturbations where baselines severely degrade.

cs.RO