核心发现
方法论
GaussianWAM利用多视角同步观察,结合预训练的几何模型VGGT和视觉基础模型CLIP,将几何和语义信息绑定到共享的3D高斯原语上。通过可微渲染,将几何、深度和语义信号反投影到WAM的表示空间中,进行训练时蒸馏,提升表示的空间几何和语义一致性。训练结束后,所有教师模型和高斯模块被移除,保持推理路径不变。该方法在LIBERO-Plus、RoboTwin等数据集上均表现出显著提升。
关键结果
- 在LIBERO-Plus上,GaussianWAM将FastWAM的成功率从52.05%提升至71.29%,Cosmos Policy从71.52%提升至77.30%。在多视角几何和语义蒸馏基础上,性能提升显著,尤其在摄像头变化和光照变化场景中效果突出。
- 结合CLIP和VGGT的蒸馏,建立了强基线,进一步通过高斯场统一异构信号,提升模型空间理解能力。
- 在真实机器人任务中,表现出良好的迁移能力和鲁棒性,验证了训练时高斯蒸馏的实用性和有效性。
研究意义
该研究突破了WAM在空间几何和语义理解上的瓶颈,将训练时知识蒸馏引入3D高斯场,显著增强了模型对场景空间结构和对象语义的感知能力。此技术不仅提升了机器人操控的精度和鲁棒性,也为未来自主系统的空间理解提供了新思路,具有重要的理论价值和实际应用潜力。
技术贡献
提出基于3D高斯场的知识蒸馏框架,创新性地将异构的几何和语义信号绑定到共享的高斯原语上,通过渲染生成密集监督信号,训练过程中实现空间结构和语义的联合优化。该方法无需在推理时引入额外模块,保持了原有WAM的推理效率,极大简化了空间几何和语义感知的集成难题。
新颖性
首次将多视角几何和语义信息通过高斯场统一建模,并在训练中进行蒸馏,避免了传统方法中引入复杂的3D重建或多模态融合模块。该方法在保持推理效率的同时,显著增强了模型的空间理解能力,是对现有WAM和3D表示技术的突破性补充。
局限性
- 当前方法依赖预训练模型的准确性,若基础模型在特定场景表现不佳,可能影响蒸馏效果。
- 高斯场的参数优化在复杂场景中可能面临收敛困难,需进一步优化算法稳定性。
- 在极端遮挡或动态场景中,空间几何和语义的联合建模仍存在一定挑战。
未来方向
未来将探索多模态融合的更深层次方法,提升对动态复杂场景的适应性。同时,考虑引入自监督机制,减少对预训练模型的依赖,增强模型的自主学习能力。还将扩展到更大规模的真实环境中,验证其工业应用潜力。
AI 总览摘要
随着机器人自主操作需求的不断增长,空间几何和语义理解成为关键瓶颈。传统的WAM在视觉预测方面表现优异,但在空间结构和对象语义的保持上仍有不足。GaussianWAM提出一种创新方案,通过训练时引入3D高斯场,将多视角几何和语义信息统一绑定,显著提升模型的空间感知能力。
该方法利用预训练的VGGT深度模型和CLIP语义模型,将异构信号映射到共享的高斯原语上,并通过可微渲染生成密集的监督信号,训练模型学习到更具空间一致性和语义相关性的表示。训练结束后,所有高斯模块和教师模型被移除,模型推理路径保持不变,保证了部署效率。
在LIBERO-Plus和Cosmos Policy等多个数据集上,GaussianWAM均取得了优异的性能提升,尤其在场景变化和复杂环境中表现出更强的鲁棒性。这一技术突破不仅增强了机器人对空间结构的理解,也为自主系统的空间感知提供了新思路。未来,结合多模态和自监督技术,GaussianWAM有望在更大规模的真实环境中实现广泛应用。
深度分析
研究背景
机器人自主控制中,空间理解和语义感知是核心难题。早期方法多依赖RGB图像或二维潜在空间,难以保证空间结构的准确性。近年来,基于深度学习的3D表示如点云、体素等逐渐兴起,但在效率和精度间仍有折中。代表性工作包括GQN、NeRF等,提升了场景重建能力,但在机器人任务中的空间一致性不足。随着基础模型如CLIP、VGGT的出现,结合多模态信息成为趋势,但如何高效融合异构信号仍是难点。
核心问题
现有WAM在视觉预测方面表现良好,但在空间几何和对象语义的保持上存在不足。多视角几何信息未被有效整合,导致模型在空间交互和精确操控中表现欠佳。异构信号的融合缺乏统一的空间载体,限制了模型的空间理解能力。此外,传统方法引入复杂的3D重建或多模态融合模块,增加了训练和推理复杂度,难以在实际应用中部署。
核心创新
GaussianWAM创新性地引入3D高斯场作为统一的空间载体,将多视角几何和语义信息绑定到共享的高斯原语上,实现异构信号的空间对齐。通过渲染生成密集的监督信号,训练模型学习到空间结构和语义的联合表示。该方法在训练时引入,推理时完全移除,保持了原有推理路径的效率。相比传统多模态融合和3D重建,极大简化了模型复杂度,提升了空间理解能力。
方法详解
- �� 利用预训练VGGT模型提取深度和相机参数,构建几何-valid掩码。• 使用CLIP提取密集语义特征,将其与几何信息绑定到同一空间网格。• 初始化高斯场,将几何和语义信息绑定到每个有效像素对应的高斯原语。• 通过可微渲染将高斯场投影到多视角图像空间,生成深度、语义和覆盖信号。• 设计损失函数对几何、深度和覆盖进行优化,训练高斯场参数。• 将渲染的信号缓存,作为训练时的密集监督,指导WAM学习空间结构和语义信息。
实验设计
在LIBERO、LIBERO-Plus、RoboTwin等数据集上,采用FastWAM和Cosmos Policy作为基线模型。训练采用70k和5k步,使用多GPU加速,设置不同的超参数。对比无蒸馏、CLIP VGGT蒸馏和高斯场蒸馏的效果,评估成功率、鲁棒性和迁移能力。通过 ablation 研究验证高斯场的贡献,分析不同场景下的性能差异。
结果分析
GaussianWAM在LIBERO-Plus上将FastWAM成功率从52.05%提升至71.29%,在摄像头、光照、噪声和机器人变化场景中表现出显著优势。结合CLIP和VGGT的蒸馏,建立了强大基线,进一步提升性能。在实际机器人任务中,表现出良好的迁移和鲁棒性,验证了训练时高斯蒸馏的实用性。整体来看,该方法显著改善了WAM的空间理解和操控能力。
应用场景
该技术适用于自主机器人、工业自动化和虚拟现实等场景,能显著提升空间交互的精度和鲁棒性。无需在推理时引入额外模块,便于部署。未来可结合多模态信息和自监督学习,推动自主系统在复杂环境中的应用。
局限与展望
依赖预训练模型的准确性,复杂场景中的高斯参数优化可能面临收敛困难。极端遮挡和动态环境下,空间几何和语义的联合建模仍需改进。此外,训练过程较长,需优化算法效率。未来需解决模型在极端条件下的表现和训练效率问题。
通俗解读 非专业人士也能看懂
想象你在厨房做饭。每次准备食材时,你会看一看每个食材在哪里、它们的味道和用途。你用眼睛观察(视觉信息),用手感受(空间位置),还记得每个食材的味道(语义信息)。如果你能把这些信息都放在一个大篮子里,随时知道每个食材在哪里、它们的味道和用法,那么做饭就会变得更快更好。GaussianWAM就像这样,把场景中的空间位置和语义信息放到一个“高斯篮子”里,训练时让模型学会用这个篮子记住场景的空间和语义信息,推理时就不用这个篮子了,但模型已经学会了如何快速找到和理解场景中的物体。
简单解释 像给14岁少年讲一样
想象你在学校的操场上玩捉迷藏。你知道每个朋友藏在哪里(空间位置),他们穿的衣服代表谁(语义信息),你用这些线索找到他们。现在,如果你有一个神奇的地图,能把朋友们藏的地方和他们的衣服信息都画在一起(用高斯场),你就能更快找到他们。GaussianWAM就像这个神奇的地图,它在训练时用很多照片和信息,把场景的空间和语义都画在一起,学会了怎么快速理解场景。等到真正玩的时候,它就不用地图了,但已经学会了怎么用这些信息找到目标。这让机器人在复杂环境中变得更聪明、更快,能更好地完成任务。
原文摘要
World-Action Models (WAMs) jointly learn future visual prediction and action generation, using video dynamics as a representation-learning signal for robotic manipulation. However, their video latents are primarily optimized for visual prediction and are not explicitly encouraged to preserve cross-view geometric structure or spatially localized, object-relevant semantics. We propose \textbf{GaussianWAM}, a training-time representation-enhancement framework that organizes geometric and semantic supervision through a 3D Gaussian field. Given synchronized multi-view observations, frozen geometry and vision foundation models provide depth, camera parameters, and dense semantic features. GaussianWAM binds these heterogeneous signals to shared Gaussian primitives and renders spatially aligned semantic, depth, and coverage targets, which are distilled into the current-observation representations of the WAM. All teacher models, Gaussian components, and auxiliary prediction heads are removed after training, leaving the original WAM inference path without additional modules or forward computation. On LIBERO-Plus, GaussianWAM improves FastWAM from 52.05\% to 71.29\% and Cosmos Policy from 71.52\% to 77.30\%. Direct CLIP and VGGT distillation already establishes a strong FastWAM baseline of 69.37\%, while Gaussian-field unification further improves it to 71.29\%, supporting the benefit of spatially organizing heterogeneous teacher signals. GaussianWAM also improves performance on standard LIBERO and shows positive transfer trends on RoboTwin and real-world manipulation. These results suggest that training-time Gaussian distillation provides a practical way to inject geometry- and semantics-related supervision into WAM representations without changing their deployment architecture.