Visual Autoregressive Modelling for Monocular Depth Estimation

TL;DR

提出了一种基于视觉自回归(VAR)的单目深度估计方法,仅需74K样本微调,取得了室内数据集的最新性能。

cs.CV 🔴 高级 2025-12-28 38 次浏览
Amir El-Ghoussani André Kaup Nassir Navab Gustavo Carneiro Vasileios Belagiannis
单目深度估计 视觉自回归 生成模型 数据可扩展性 3D视觉

核心发现

方法论

该方法采用视觉自回归(VAR)模型,通过引入尺度条件上采样机制和无分类器指导,进行十个固定自回归阶段的推理。使用Switti模型进行预训练,并在Hypersim和vKITTI数据集上进行微调。

关键结果

  • 在NYUv2和ScanNet上取得了最先进的室内性能,AbsRel分别为6.4和7.9,δ1分别为94.8%和93.4%。
  • 在室外数据集KITTI、ETH3D和DIODE上表现良好,AbsRel分别为10.4、8.1和22.3。
  • 与基于扩散的模型相比,VAR模型在数据需求和计算开销上更具优势。

研究意义

该研究为单目深度估计提供了新的生成模型范式,通过自回归先验模型的引入,显著减少了数据需求,并提高了模型对3D视觉任务的适应性。

技术贡献

提出了一种新的自回归生成模型,结合尺度条件上采样和无分类器指导,提供了与现有扩散模型不同的理论和工程实现可能性。

新颖性

首次将大规模文本到图像VAR模型应用于深度估计,提出了独特的尺度条件上采样机制,显著减少了数据需求。

局限性

  • 在室外场景中,性能略逊于某些基于CNN的模型,可能是由于训练数据集的域差异。
  • 推理速度仍然较慢,尽管比扩散模型快。

未来方向

未来工作可以探索在更多真实场景数据集上的微调,以及改进推理速度和模型的泛化能力。

AI 总览摘要

单目深度估计是计算机视觉中的一个重要任务,传统方法依赖于大规模数据集和复杂的训练过程,难以适应多样化的应用场景。

本文提出了一种基于视觉自回归(VAR)的单目深度估计方法,通过引入尺度条件上采样机制和无分类器指导,显著减少了数据需求,仅需74K样本即可实现微调。

实验结果表明,该方法在室内数据集NYUv2和ScanNet上取得了最先进的性能,并在室外数据集KITTI、ETH3D和DIODE上表现良好,展示了其在3D视觉任务中的潜力。尽管在某些室外场景中略逊于基于CNN的方法,但其数据可扩展性和适应性为未来研究提供了新的方向。

深度分析

研究背景

单目深度估计是从单个2D图像预测场景深度的任务。传统方法依赖于监督学习和自监督学习,前者需要大量标注数据,后者通过几何约束减少标注需求。近年来,生成模型如扩散模型被应用于深度估计,但其计算开销大,数据需求高。

核心问题

单目深度估计面临尺度模糊、透视模糊和遮挡等挑战。现有方法在数据需求和计算开销上存在瓶颈,难以在多样化场景中推广。

核心创新

本文创新性地将视觉自回归(VAR)模型应用于深度估计,提出了尺度条件上采样机制和无分类器指导,减少了数据需求,提高了模型的适应性。

方法详解

  • �� 使用Switti模型进行预训练,适应深度估计任务。
  • �� 引入尺度条件上采样机制,跨分辨率传播几何线索。
  • �� 设计无分类器指导规则,平衡自回归先验和条件上采样器的贡献。
  • �� 提出重新编码策略,支持中间预测。

实验设计

在Hypersim和vKITTI数据集上进行微调,使用NYUv2、ScanNet、KITTI、ETH3D和DIODE进行测试。评估指标包括AbsRel和δ1,比较基线为扩散模型和CNN模型。

结果分析

在NYUv2上,AbsRel为6.4,δ1为94.8%;在ScanNet上,AbsRel为7.9,δ1为93.4%。在KITTI上,AbsRel为10.4,δ1为90.1%。与基于扩散的模型相比,VAR模型在数据需求和计算开销上更具优势。

应用场景

该方法可用于自动驾驶、机器人视觉和增强现实等领域,尤其适用于数据有限的场景。

局限与展望

在室外场景中,性能略逊于某些基于CNN的模型,可能是由于训练数据集的域差异。推理速度仍然较慢,尽管比扩散模型快。未来可通过更多真实场景数据集的微调和改进推理速度来提升性能。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个食谱,但没有所有的食材。传统方法就像需要所有食材才能做出完美的菜,而我们的VAR方法就像是用现有的食材创造出美味的菜。我们的方法通过少量的数据(食材)和一些巧妙的技巧(上采样机制和无分类器指导),成功地做出了美味的菜(准确的深度估计)。这就像是用有限的资源实现了最大的效果。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,需要从一个图片中猜出它的3D形状。传统方法就像是需要很多提示才能猜对,而我们的新方法就像是只需少量提示就能猜出答案。我们的方法使用了一种叫做VAR的技巧,就像是游戏中的超级道具,能帮助你更快更准地猜出答案。虽然在某些关卡上还不如其他方法,但它已经很厉害了!

术语表

视觉自回归 (Visual Autoregressive)

一种生成模型,通过逐步预测图像的不同分辨率层次来生成图像。

用于单目深度估计,通过多尺度预测实现。

尺度条件上采样 (Scale-wise Conditional Upsampling)

一种机制,通过跨分辨率传播几何线索来提高深度估计的准确性。

在VAR模型中用于增强几何信息的传播。

无分类器指导 (Classifier-free Guidance)

一种策略,通过平衡自回归先验和条件上采样器的贡献来优化预测。

用于控制模型在不同阶段的预测。

Switti模型 (Switti Model)

一种大规模文本到图像的VAR模型,用于预训练。

作为VAR模型的基础进行微调。

Hypersim数据集 (Hypersim Dataset)

一个包含461个室内场景的合成数据集,用于模型微调。

用于训练和评估VAR模型的性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在更大规模的真实场景数据集上验证VAR模型的性能?
  • 2 如何进一步提高VAR模型的推理速度以适应实时应用?

应用场景

近期应用

自动驾驶

在自动驾驶中,VAR模型可以用于实时深度估计,提高车辆的环境感知能力。

远期愿景

增强现实

VAR模型可以应用于增强现实中,实现更逼真的场景渲染,提升用户体验。

原文摘要

We propose a monocular depth estimation method based on visual autoregressive (VAR) priors, offering an alternative to diffusion-based approaches. Our method adapts a large-scale text-to-image VAR model and introduces a scale-wise conditional upsampling mechanism with classifier-free guidance. Our approach performs inference in ten fixed autoregressive stages, requiring only 74K synthetic samples for fine-tuning, and achieves competitive results. We report state-of-the-art performance in indoor benchmarks under constrained training conditions, and strong performance when applied to outdoor datasets. This work establishes autoregressive priors as a complementary family of geometry-aware generative models for depth estimation, highlighting advantages in data scalability, and adaptability to 3D vision tasks. Code available at "https://github.com/AmirMaEl/VAR-Depth".

cs.CV