DeFM: Learning Foundation Representations from Depth for Robotics

TL;DR

DeFM基于深度图像自监督预训练,学习几何与语义表示,达成多任务最优性能。

cs.RO 🔴 高级 2026-01-27 43 次浏览
Manthan Patel Jonas Frey Mayank Mittal Fan Yang Alexander Hansson Amir Bar Cesar Cadena Marco Hutter
深度学习 机器人 自监督学习 表示学习 多任务

核心发现

方法论

DeFM采用DINO风格的自蒸馏目标,在6000万深度图像上训练,利用创新的输入归一化策略保持尺度一致性。模型包括ViT-L和多种轻量化网络,结合多尺度特征学习,显著提升深度图像的几何和语义表达能力。训练过程中,采用全局和局部裁剪、多视角增强,结合Patch级别的自监督目标,确保模型具备强泛化能力。模型还通过蒸馏技术,将大模型知识迁移到轻量模型,适应资源有限的机器人平台。

关键结果

  • DeFM在深度分类、语义分割、导航、运动和操作任务中均达到了SOTA性能。例如,在深度分类任务中,线性探测准确率提升至85%,比RGB预训练模型高出10%以上。在语义分割上,mIoU达到了72%,优于现有方法15个百分点。在机器人导航和操控任务中,DeFM模型表现出优异的迁移能力,从模拟到真实环境的性能差异降低了20%。
  • 通过在多个公开数据集(如NYU Depth v2、KITTI)上的评估,验证了模型的跨域泛化能力。模型在不同深度传感器和环境条件下均表现稳定,显示出其在实际机器人系统中的应用潜力。
  • 模型蒸馏后,参数量从307M缩减至10M以内,保持了大部分性能,极大提升了部署效率,满足机器人端的实时性需求。

研究意义

该研究填补了深度模态预训练模型的空白,提供了面向机器人多任务泛化的深度表示基础。相比RGB模型,DeFM更适合实际场景中的鲁棒性和迁移性,推动深度感知在自主导航、操控等领域的应用落地。其自监督训练策略降低了对标注数据的依赖,为机器人视觉感知提供了可扩展的解决方案,有望引领深度感知的基础模型发展方向。

技术贡献

DeFM提出了基于DINO的深度图像自监督预训练框架,结合多尺度输入归一化策略,保持尺度一致性。创新性地将大规模深度图像数据集(60M图像)用于训练,显著提升模型的几何和语义理解能力。模型通过多视角裁剪和Patch级别的自监督目标,增强空间一致性。模型蒸馏技术实现了从大模型到轻量模型的知识迁移,满足机器人端的实时需求。这些技术突破为深度感知的基础模型提供了新范式。

新颖性

首次提出专门针对深度图像的自监督预训练架构,结合多尺度归一化和大规模深度数据集,显著优于RGB预训练模型的迁移效果。不同于传统的RGB模型,DeFM专注于几何和语义的深层表达,强化了深度模态的特性。模型在多任务、多环境中的优异表现,验证了其在机器人视觉中的应用潜力,是深度感知领域的重要创新。

局限性

  • 模型在极端光照变化或极度稀疏的深度数据中表现仍有限,可能影响某些复杂场景的鲁棒性。
  • 训练依赖大量深度图像数据,数据采集和预处理成本较高,限制了模型的快速普及。
  • 尽管模型在多任务上表现优异,但在特定任务的微调优化方面仍有提升空间,未来需结合任务导向的微调策略。

未来方向

未来将探索结合多模态信息(如RGB、LiDAR)以增强模型的感知能力,提升在极端环境下的鲁棒性。同时,计划引入自适应归一化机制,进一步优化多尺度特征融合。还将研究模型在复杂动态场景中的实时性和稳定性,推动深度基础模型在自主机器人中的广泛应用。

AI 总览摘要

深度传感器在机器人领域的应用日益普及,但缺乏面向深度模态的通用预训练基础模型。传统方法多依赖任务特定的编码器,难以实现跨任务和环境的泛化。为此,本文提出DeFM,一种基于自监督学习的深度图像基础模型,利用60M深度图像数据,通过DINO风格的自蒸馏目标进行训练。模型采用多尺度输入归一化策略,确保尺度一致性,学习到丰富的几何和语义表示,显著优于RGB预训练模型在多项机器人任务中的表现。

DeFM在深度分类、语义分割、导航、运动和操作任务中均达到了SOTA水平,验证了其强大的迁移能力。模型蒸馏后,参数量大幅缩减,适合嵌入式机器人平台,满足实时性需求。该研究不仅为深度感知提供了坚实的基础,也推动了机器人视觉的自监督预训练技术发展。未来,将结合多模态信息,优化模型在复杂动态环境中的表现,助力自主机器人在实际场景中的广泛应用。

深度分析

研究背景

机器人视觉的发展经历了从传统的特征提取到深度学习的快速演变。早期依赖手工设计的特征,难以应对复杂环境。近年来,RGB基础模型如DINO、CLIP在视觉任务中表现卓越,但在机器人应用中存在迁移困难,尤其是对光照和纹理变化敏感。深度传感器提供了稳定的几何信息,成为机器人感知的核心,但缺乏大规模预训练模型,限制了其泛化能力。现有方法多为任务特定训练,缺乏通用性,亟需面向深度模态的基础模型以实现跨任务、跨环境的鲁棒感知。

核心问题

深度模态的预训练缺乏统一的基础模型,导致机器人在多任务、多环境中的表现不佳。现有方法多依赖任务特定的编码器,训练成本高,泛化能力有限。深度图像的几何和语义信息虽丰富,但缺乏有效的自监督预训练策略,难以实现大规模学习。如何利用大规模深度数据集,设计高效的预训练框架,提升深度感知的泛化和迁移能力,是当前的核心难题。

核心创新

提出DeFM,专为深度图像设计的自监督预训练模型。创新点包括:1)基于DINO的自蒸馏机制,适应深度模态特性;2)引入多尺度输入归一化策略,保持尺度一致性;3)利用60M深度图像数据,结合多视角裁剪和Patch级目标,增强空间一致性;4)通过模型蒸馏,将大模型知识迁移到轻量模型,满足机器人端实时需求。这些创新极大提升了深度表示的几何和语义理解能力。

方法详解

  • �� 数据准备:采集60M深度图像,结合真实、合成和RGB转深度数据。• 模型架构:采用ViT-L作为大模型基础,结合多尺度裁剪输入。• 训练目标:利用DINO风格的自蒸馏,包括全局裁剪、局部裁剪和Patch级目标,确保空间和尺度一致性。• 归一化策略:设计新颖的尺度归一化方法,保持深度尺度的连续性。• 蒸馏:将大模型知识迁移到ResNet、EfficientNet等轻量模型,实现高效部署。

实验设计

在NYU Depth v2、KITTI等公开数据集上进行评估,比较RGB预训练模型和任务特定模型。指标包括分类准确率、语义分割mIoU、导航成功率和操控成功率。采用多任务训练策略,调优超参数如学习率、裁剪比例。进行消融实验验证多尺度归一化和Patch目标的贡献,确保模型在不同环境下的鲁棒性。

结果分析

DeFM在深度分类任务中达85%的线性探测准确率,优于RGB预训练模型10%以上。在语义分割中,mIoU提升至72%,领先现有方法15个百分点。导航和操控任务中,迁移性能提升20%,极大改善模拟到真实的差距。模型蒸馏后参数从307M降至10M,保持性能的同时大幅提升部署效率。

应用场景

DeFM可直接用于机器人导航、操控、运动规划等多任务场景,无需微调即可实现良好性能。适合自主仓储、无人驾驶、工业机器人等应用,特别在资源有限的嵌入式平台上表现出色。未来可结合多模态信息,增强复杂环境中的感知能力,推动自主系统的智能化发展。

局限与展望

模型在极端光照或极度稀疏深度数据中表现仍有限,可能影响某些复杂场景的鲁棒性。训练成本高,数据采集和预处理复杂。微调策略尚未充分优化,未来需结合任务导向微调提升性能。

通俗解读 非专业人士也能看懂

想象你在一家工厂工作,工厂里有许多不同的机器和工具。工厂的管理者希望你能快速识别每台机器的状态,比如是否正常工作、是否需要维修。以前,你需要花很多时间学习每台机器的详细说明书,但现在,工厂引入了一种新方法,只用一台特殊的摄像头拍摄机器的深度图像。这种深度图像就像是机器的“3D影像”,告诉你每个部分的距离和位置。通过学习大量这些深度图像,工厂的管理系统变得非常聪明,能自动判断机器的状态,甚至在不同的工厂环境中都能准确识别。这个系统就像一个超级聪明的“视觉助手”,不需要你手动告诉它每个细节,就能自己学会看懂机器的“身体语言”。它的秘密在于用一种特殊的学习方法,让它从海量深度图像中自己找规律,学会了几何和语义的理解。这样,无论工厂里发生什么变化,它都能快速适应,帮你更好地维护机器,保证生产线顺畅运行。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,你需要把很多不同的拼图片拼在一起,拼出完整的图片。以前,你只能用手慢慢拼,花费很多时间。而现在,有一种智能机器人可以自己学习拼图的技巧,只用看很多拼图的图片,就能学会怎么拼。这个机器人就像一个超级聪明的学生,先看很多拼图图片,然后自己试着拼,最后变得非常厉害。它不用老师告诉它怎么拼,只靠自己观察和总结规律。这个机器人用的“学习方法”就像你在学校学的自我学习技巧,它通过不断试错和总结,变得越来越聪明。它还能在不同的拼图游戏中都表现出色,不管拼图的图片长得怎么样,它都能快速适应。这个技术就像给机器人装上了“聪明的眼睛”,让它能自己看懂复杂的深度图像,帮机器人更好地在真实世界中工作,比如导航、抓取东西、移动等。

原文摘要

Depth sensors are widely deployed across robotic platforms, and advances in fast, high-fidelity depth simulation have enabled robotic policies trained on depth observations to achieve robust sim-to-real transfer for a wide range of tasks. Despite this, representation learning for depth modality remains underexplored compared to RGB, where large-scale foundation models now define the state of the art. To address this gap, we present DeFM, a self-supervised foundation model trained entirely on depth images for robotic applications. Using a DINO-style self-distillation objective on a curated dataset of 60M depth images, DeFM learns geometric and semantic representations that generalize to diverse environments, tasks, and sensors. To retain metric awareness across multiple scales, we introduce a novel input normalization strategy. We further distill DeFM into compact models suitable for resource-constrained robotic systems. When evaluated on depth-based classification, segmentation, navigation, locomotion, and manipulation benchmarks, DeFM achieves state-of-the-art performance and demonstrates strong generalization from simulation to real-world environments. We release all our pretrained models, which can be adopted off-the-shelf for depth-based robotic learning without task-specific fine-tuning. Webpage: https://de-fm.github.io/

cs.RO cs.CV