TR2M: Transferring Monocular Relative Depth to Metric Depth with Language Descriptions and Dual-Level Scale-Oriented Contrast

TL;DR

TR2M利用图像和文本预测像素级尺度变换,将相对深度转为绝对深度,提升跨域泛化能力。

cs.CV 🔴 高级 2025-06-16 64 次浏览
Beilei Cui Yiming Huang Long Bai Hongliang Ren
深度估计 多模态学习 尺度转换 对比学习 跨域泛化

核心发现

方法论

TR2M框架结合图像和文本描述,通过预训练的图像编码器(如DINOv2)和文本编码器(如CLIP)提取特征,采用交叉模态注意力机制融合信息。模型预测两个像素级的变换图(尺度图和偏移图),实现相对深度到绝对深度的像素级转化。利用伪深度生成策略筛选高置信度的监督信号,并引入双层尺度对比损失强化尺度一致性。整个系统参数量少,具有良好的跨域泛化能力。

关键结果

  • 在NYUv2数据集上,TR2M在绝对误差(AbsRel)指标上达到了0.082,优于多种基于语言和迁移的深度估计方法,且参数量仅19M,表现出强大的零样本迁移能力。
  • 在KITTI数据集上,TR2M实现了0.066的AbsRel,接近或优于最新的端到端深度模型,验证了其在室外场景中的适应性。
  • 消融实验显示,结合图像和文本信息的融合机制显著优于单模态输入,伪深度筛选和尺度对比损失共同提升了模型的尺度感知和泛化能力。

研究意义

该研究突破了单模态深度估计在尺度一致性上的瓶颈,通过引入语言描述实现像素级的尺度转移,为无人驾驶、机器人导航等应用提供了低成本、高泛化的解决方案。其创新的多模态融合和尺度对比机制,为深度估计领域提供了新的思路,有望推动跨域深度感知技术的快速发展。

技术贡献

提出结合图像和文本信息的像素级尺度映射预测框架,创新性地引入伪深度筛选策略和双层尺度对比学习,有效解决尺度不确定性问题。模型参数极少,便于迁移和部署,显著优于传统的单模态或基于大规模标注的深度模型,增强了模型的跨域适应性和零样本能力。

新颖性

首次提出利用文本描述进行像素级的相对深度到绝对深度的转移,结合多模态特征融合、伪深度筛选和尺度对比,创新性地实现了跨域、低参数的深度估计新方法。这在深度估计研究中具有开创性意义,填补了语言辅助深度转化的空白。

局限性

  • 模型依赖预训练的图像和文本编码器,可能在特定领域或语义模糊的描述中表现不佳。
  • 伪深度筛选策略对超参数敏感,可能在噪声较多的场景下引入误导信息。
  • 当前方法主要针对静态场景,动态场景中的深度变化和运动信息未充分考虑。

未来方向

未来将探索多模态特征的动态融合机制,提升模型对复杂场景和运动场景的适应性。同时,结合自监督和无监督学习策略,减少对预训练模型的依赖,增强模型的自主学习能力。还计划扩展到多任务联合学习,提升深度估计的同时实现语义理解和场景理解。

AI 总览摘要

深度估计作为理解三维场景的核心技术,长期以来面临尺度不确定性和跨域泛化的挑战。传统的度量深度估计(MMDE)依赖大量标注数据,难以迁移到新场景;而相对深度估计(MRDE)虽具泛化优势,却缺乏尺度信息,限制了实际应用。本文提出TR2M框架,通过结合图像和文本描述,预测像素级的尺度变换图,实现从相对深度到绝对深度的高效转化。该方法利用预训练的多模态编码器提取特征,采用交叉模态注意力融合信息,结合伪深度筛选和尺度对比学习,显著提升模型的尺度感知和跨域能力。在NYUv2和KITTI等多个公开数据集上,TR2M表现优异,绝对误差低至0.082和0.066,优于现有多模态和迁移方法。其参数量仅19M,模型轻量,适应性强,展现出强大的零样本迁移能力。该研究不仅推动了深度估计技术的理论创新,也为无人驾驶、机器人导航等实际场景提供了低成本、高性能的解决方案。未来,作者计划结合动态场景和多任务学习,进一步增强模型的泛化和实用性,开启深度感知的新篇章。

深度分析

研究背景

深度估计是计算机视觉中的基础任务,随着深度学习的发展,出现了一系列端到端的深度预测模型。早期方法多依赖结构光、激光等传感器,成本高昂。近年来,单目深度估计(MDE)逐渐成为研究热点,代表性工作如Eigen et al.(2014)提出的多尺度卷积网络,以及后续的ResNet、DPT等架构。尽管取得了显著进步,但大部分模型在不同场景下的泛化能力不足,尤其在跨域应用中表现不佳。为解决这一问题,研究者们引入了几何先验、摄像机参数等信息,但成本较高。相对深度估计(MRDE)通过学习场景中的相对关系,增强了泛化能力,但尺度信息缺失限制了实际应用。近年来,结合多模态信息的深度估计逐渐兴起,利用文本、语义信息辅助深度预测成为新的研究方向。

核心问题

现有深度估计方法在尺度一致性和跨域适应性方面仍存在瓶颈。MMDE模型虽能输出绝对深度,但依赖大量标注数据和特定传感器,难以迁移到新场景;MRDE模型虽泛化好,但缺乏尺度信息,限制了在机器人导航、虚拟现实等场景中的应用。引入语言描述作为辅助信息,虽然在某些任务中提升了性能,但多模态融合的像素级尺度转化仍未充分解决。如何利用少量参数实现跨域、尺度一致的深度估计,是当前亟待突破的问题。

核心创新

本研究提出TR2M框架,创新点在于:1)结合图像和文本描述,利用预训练的多模态编码器提取丰富的场景信息;2)采用交叉模态注意力机制实现多模态特征融合,增强尺度信息的表达能力;3)设计像素级的尺度变换预测,利用两个变换图(尺度图和偏移图)实现相对深度到绝对深度的转化;4)引入伪深度筛选策略,提升监督信号的质量;5)提出双层尺度对比学习,强化尺度一致性和特征分布的匹配。这些创新使模型参数极少,具备强大的跨域迁移能力。

方法详解

  • �� 输入:RGB图像I和对应文本描述L。
  • �� 特征提取:用预训练的DINOv2(图像)和CLIP(文本)提取特征FI和FL。
  • �� 特征融合:通过交叉模态注意力机制(Eq.1-2)融合图像和文本特征,得到融合特征Ff。
  • �� 变换图预测:用两个轻量级解码器(如DPT)预测尺度图A和偏移图B。
  • �� 深度转化:利用公式(Eq.3)将相对深度Dr通过像素级线性变换转为绝对深度。
  • �� 伪深度筛选:通过最小二乘法(Eq.5)对伪深度进行线性校准,筛选高置信度伪深度作为监督。
  • �� 损失函数:结合尺度不变的对数损失(Eq.4)、伪深度对比损失(Eq.6)和尺度对比(Eq.7-9),优化模型。
  • �� 训练:端到端优化,加入边缘平滑损失(Les)确保平滑性。

实验设计

在NYUv2和KITTI数据集上进行训练和评估,使用多种指标(AbsRel、RMSE等)衡量性能。模型参数量少,训练采用AdamW,批次为8,学习率1e-5,训练20轮。对比不同输入模态、伪深度筛选策略和尺度对比的影响。还在五个未见数据集上进行零样本测试,验证泛化能力。实验结果显示,TR2M在绝对误差和尺度一致性方面优于多项基线方法,验证了其跨域适应性。

结果分析

在NYUv2上,TR2M的AbsRel为0.082,优于大部分迁移模型;在KITTI上,AbsRel为0.066,表现接近最先进的端到端模型。参数仅19M,模型轻量,适合实际部署。消融实验表明,融合文本信息、伪深度筛选和尺度对比是性能提升的关键因素。零样本测试中,TR2M在五个不同场景下均表现优异,显示出极强的泛化能力。

应用场景

该技术可广泛应用于无人驾驶、机器人导航、虚拟现实等场景,尤其在缺乏多传感器支持的情况下,通过文本描述实现高精度深度估计。只需少量参数和预训练模型,便于在边缘设备部署,降低成本。未来结合动态场景和多任务学习,有望实现更复杂的场景理解。

局限与展望

模型依赖预训练编码器,可能在描述模糊或语义不明确的场景中表现不佳。伪深度筛选策略对超参数敏感,可能在噪声较多的场景引入误导。当前主要针对静态场景,动态变化和运动信息未充分考虑。未来需要优化鲁棒性和实时性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们需要知道每个物品的具体位置和大小,但没有直接的尺子或传感器。于是他们用相机拍照,并用描述告诉别人:‘这个箱子大约有两米长,放在左边的架子上’。工人们利用图片和描述,结合经验和规则,推算出每个物品的准确位置和大小。TR2M就像这些工人,利用图像和文字信息,像拼图一样拼出场景的深度信息,让机器人或自动驾驶汽车更好地理解环境。它通过学习不同场景中的规律,能在没有专门传感器的情况下,准确判断距离和深度,帮助机器更智能、更安全地工作。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你的任务是知道每个物体距离你有多远,但你没有用尺子测量。你只能看图片和听描述,比如‘前面有一辆车,距离大约20米’。你根据图片中的线索和描述,猜测出距离。这就像TR2M,它用图片和文字帮机器人判断每个物体的距离,不需要专门的激光或深度传感器。它学会了用这些线索,像我们用眼睛和话语一样,理解场景中的距离关系。这样,机器人可以在不同的环境中都能准确知道距离,比如在家里、街道或手术室,都能帮上大忙。这种技术让机器变得更聪明,也更容易在各种场景中工作。

术语表

Cross-Modality Attention(交叉模态注意力)

一种融合不同模态特征(如图像和文本)的方法,通过注意力机制增强信息交互,提升多模态任务的表现。技术上利用查询、键、值机制实现特征融合。

在TR2M中,用于融合图像和文本特征,增强尺度信息的表达能力。

Pseudo Depth(伪深度)

通过对相对深度和真实深度进行线性校准生成的估算深度,用于补充缺失的监督信号,提升模型的尺度一致性。

在训练中筛选高置信度的伪深度作为监督,增强模型的尺度感知。

Scale-Oriented Contrastive Learning(尺度导向对比学习)

一种利用深度分布信息,将特征按尺度类别进行对比的学习策略,强化模型对尺度变化的敏感性和一致性。

在TR2M中,用于提升模型的尺度识别和跨域泛化能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态场景中保持尺度一致性仍未完全解决,尤其在运动模糊和遮挡情况下的深度估计。
  • 2 多模态特征融合的鲁棒性和效率有待提升,尤其在低质量文本描述或复杂环境中。
  • 3 模型在极端场景(如夜间、恶劣天气)下的性能仍需验证,未来需结合多传感器信息增强鲁棒性。

应用场景

近期应用

无人驾驶辅助

利用TR2M实现无需激光传感器的深度感知,提升自动驾驶在复杂环境中的安全性和成本效益。

机器人导航

在缺乏高精度传感器的场景下,通过图像和描述实现自主导航,降低成本,增强适应性。

远期愿景

智能场景理解

结合多模态信息,推动场景理解和场景重建的自动化,助力虚拟现实、增强现实等行业的智能化升级。

原文摘要

This work presents a generalizable framework to transfer relative depth to metric depth. Current monocular depth estimation methods are mainly divided into metric depth estimation (MMDE) and relative depth estimation (MRDE). MMDEs estimate depth in metric scale but are often limited to a specific domain. MRDEs generalize well across different domains, but with uncertain scales which hinders downstream applications. To this end, we aim to build up a framework to solve scale uncertainty and transfer relative depth to metric depth. Previous methods used language as input and estimated two factors for conducting rescaling. Our approach, TR2M, utilizes both text description and image as inputs and estimates two rescale maps to transfer relative depth to metric depth at pixel level. Features from two modalities are fused with a cross-modality attention module to better capture scale information. A strategy is designed to construct and filter confident pseudo metric depth for more comprehensive supervision. We also develop scale-oriented contrastive learning to utilize depth distribution as guidance to enforce the model learning about intrinsic knowledge aligning with the scale distribution. TR2M only exploits a small number of trainable parameters to train on datasets in various domains and experiments not only demonstrate TR2M's great performance in seen datasets but also reveal superior zero-shot capabilities on five unseen datasets. We show the huge potential in pixel-wise transferring relative depth to metric depth with language assistance. (Code is available at: https://github.com/BeileiCui/TR2M)

cs.CV