Fus3D: Decoding Consolidated 3D Geometry from Feed-forward Geometry Transformer Latents

TL;DR

Fus3D利用预训练几何Transformer的中间特征,直接回归密集SDF,实现快速无摄像头校准的3D重建。

cs.CV 🔴 高级 2026-03-27 24 次浏览
Laura Fink Linus Franke George Kopanas Marc Stamminger Peter Hedman
3D重建 Transformer SDF 多视角几何 深度学习

核心发现

方法论

本文提出一种基于预训练多视角几何Transformer的中间特征空间,直接进行3D几何提取。通过引入学习的体素化嵌入,将多视角信息融合到结构化的体素网格中,利用交叉和自注意力机制逐步吸收几何信息。最后,采用卷积解码器将体素特征映射到密集的Signed Distance Field (SDF)。同时,设计了考虑非封闭网格的有效性监督策略,利用深度图或3D模型生成SDF,解决实际场景中的不完整和非封闭问题。

关键结果

  • 在稀疏和密集视角条件下,Fus3D能在不到三秒内输出完整且定义良好的SDF,显著优于传统TSDF融合方法。实验证明,在DTU和Objaverse数据集上,Fus3D的重建精度比UFORecon和VolRecon提升约29%的Chamfer距离,且在无摄像头参数的情况下仍保持优异性能。
  • 在稀疏视角(如2视图)场景中,Fus3D能有效补全未观察到的表面,避免信息丢失;在多视角(如24视图)条件下,避免误差累积,保持高保真度。
  • 引入的有效性监督机制增强了模型对非封闭网格和未观测区域的鲁棒性,提升了实际应用中的可靠性。

研究意义

该方法突破了传统基于后处理融合的3D重建瓶颈,充分利用预训练Transformer的潜在几何先验,实现快速、完整、鲁棒的3D几何重建。对自动化场景理解、机器人导航、虚拟现实等领域具有重要推动作用,特别是在缺乏精确摄像头参数或稀疏视角条件下,提供了全新的解决方案。

技术贡献

本文创新点在于直接从预训练几何Transformer的中间特征空间提取3D信息,避免传统的逐视角预测和融合步骤,极大简化流程。提出的学习体素嵌入机制实现了多视角几何信息的逐步融合,结合有效性监督策略,提升了模型在实际场景中的适应性。该方法还首次实现了无摄像头校准的端到端密集SDF回归,为3D重建提供了新的技术路径。

新颖性

这是首个将预训练几何Transformer的中间特征直接用于密集SDF回归的工作,突破了传统的predict-then-fuse范式,提出了端到端的3D提取框架。相较于现有的基于体素或点云的重建方法,Fus3D无需摄像头参数,显著简化流程并提升鲁棒性。

局限性

  • 模型对场景的空间范围和边界定义依赖于预设的体素网格,可能在极大或复杂场景中面临尺度限制。
  • 在极端稀疏视角(如仅两视图)场景中,重建仍存在一定的未观察区域未能完全补全的问题。
  • 训练过程依赖大量高质量的深度图或3D模型,数据准备成本较高,泛化能力在未见场景中仍待验证。

未来方向

未来将探索动态场景的时序建模,提升模型对运动和变化的适应性。同时,结合自监督和弱监督技术,减少对高质量标注数据的依赖,增强模型在实际应用中的普适性。还将研究多模态信息融合,如结合LiDAR或激光扫描数据,以进一步提升重建精度和鲁棒性。

AI 总览摘要

Fus3D提出了一种基于预训练几何Transformer中间特征的端到端密集SDF回归方法,显著简化了传统的多视角3D重建流程。现有方法多依赖逐视角预测后续融合,如TSDF或Poisson重建,容易在稀疏视角下出现不完整,且在多视角条件下误差累积。Fus3D创新性地直接从Transformer的中间特征中提取几何信息,利用学习的体素化嵌入逐步融合多视角信息,避免了后处理融合的局限。通过引入有效性监督策略,模型在非封闭网格和未观测区域表现出极强的鲁棒性。实验结果显示,在DTU和Objaverse数据集上,Fus3D在无摄像头参数条件下,重建速度快于三秒,Chamfer距离比UFORecon和VolRecon提升约29%,在稀疏和密集视角场景中都表现出优异的完整性和细节保留能力。这一方法不仅推动了自动化3D场景理解的发展,也为机器人、虚拟现实等行业提供了高效、鲁棒的技术方案。未来,作者计划扩展到动态场景和多模态融合,进一步提升模型的泛化能力和应用范围。

深度分析

研究背景

三维重建技术经历了从传统的结构光、激光扫描到基于深度学习的隐式表示的演变。代表性工作包括SfM、MVS、SLAM结合TSDF融合,以及NeRF等视图合成方法。近年来,预训练几何Transformer如VGGT、DUSt3R等在场景几何恢复中表现出色,能够在单次前向推理中获得深度和相机参数,但仍依赖后续融合步骤,存在不完整和误差累积问题。

核心问题

当前多视角几何重建多依赖逐视角预测后融合,导致在稀疏视角下缺失细节,且多视角误差累积影响整体质量。缺少端到端、无摄像头参数的密集几何回归方案,限制了模型在实际场景中的应用。如何充分利用Transformer的潜在几何先验,避免后处理融合,是亟待解决的核心问题。

核心创新

本文提出直接从Transformer中间特征提取3D几何信息,利用学习的体素化嵌入逐步融合多视角信息,避免传统predict-then-fuse流程。引入有效性监督机制,增强模型对非封闭和未观测区域的鲁棒性。采用端到端训练,极大简化流程,提升重建完整性和速度,为无摄像头参数的密集SDF回归提供新路径。

方法详解

  • �� 使用VGGT作为基础几何Transformer,处理多视角图像,输出中间特征;
  • �� 设计学习的3D体素嵌入,将多视角信息通过交叉和自注意力逐步融合到结构化体素网格中;
  • �� 利用多阶段Transformer逐步提取和融合特征,构建丰富的几何先验;
  • �� 通过卷积解码器,将体素特征映射到密集SDF,定义场景的距离场;
  • �� 引入有效性监督策略,利用深度图或3D模型生成的SDF,处理非封闭和未观测区域,增强鲁棒性。

实验设计

在DTU和Objaverse数据集上,采用不同视角数(2-24)进行评估。比较基线包括UFORecon和VolRecon,指标为Chamfer距离和F-score。模型训练采用多阶段策略,利用高质量深度和模型数据进行监督。实验还包括稀疏视角补全能力和多视角一致性分析,验证模型在实际场景中的应用潜力。

结果分析

Fus3D在无摄像头参数条件下,Chamfer距离比UFORecon提升约29%,在稀疏视角(如2视图)场景中能有效补全未观察到的表面,避免信息丢失。在多视角(24视图)场景中,误差明显低于传统融合方法,重建更完整、更细腻。模型还展现出对非封闭网格和未观测区域的鲁棒性,验证了其实际应用价值。

应用场景

该技术适用于无人机、机器人自主导航、虚拟现实内容生成等场景,尤其在缺乏精确摄像头参数或场景稀疏的条件下,能快速生成高质量3D模型。无需复杂校准,极大简化部署流程,推动自动化场景理解的发展。

局限与展望

模型对场景尺度和边界定义敏感,可能在极大或复杂场景中表现不佳。训练依赖大量高质量深度和3D模型,数据准备成本高。在极端稀疏视角下仍存在未观察区域未能完全补全的问题,未来需优化尺度适应性和数据效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,手边有各种食材和工具。传统做菜时,你需要按照食谱一步步准备,最后还要把所有菜肴组合在一起。而Fus3D就像是一个聪明的厨师,它能直接从厨房的中间储藏室里,快速找到所有需要的食材和调料,直接把菜肴做出来,而不需要逐步准备和拼装。它用一种特殊的“厨具”——预训练的几何Transformer,提前学会了很多菜的做法,能在几秒钟内完成复杂的菜肴。这样,不仅节省时间,还能做出更完整、更美味的菜肴。它的秘密在于:它能从厨房的“中间存储”里,直接提取所有的做菜信息,而不用每次都从零开始拼凑。这就像是有个超级厨师,能一眼看出所有食材的最佳搭配,做出完美的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏。以前,你需要一块一块拼,花很长时间才能拼出完整的图像。而现在,这个新方法就像有个神奇的拼图助手,它能一眼看出所有拼图块的关系,把它们快速拼在一起,形成完整的画面。这个助手用了一种叫“Transformer”的聪明算法,已经提前学会了很多拼图的规律。它不用逐块拼,直接从“中间存储”的信息里,找到拼图的完整样子。这样,不管拼图有多复杂,只要几秒钟,就能拼出一幅完整的画面。就像你有了一个超级聪明的朋友,帮你快速完成拼图,看到的世界也变得更清楚、更完整了。

原文摘要

We propose a feed-forward method for dense Signed Distance Field (SDF) regression from unstructured image collections in less than three seconds, without camera calibration or post-hoc fusion. Our key insight is that the intermediate feature space of pretrained multi-view feed-forward geometry transformers already encodes a powerful joint world representation; yet, existing pipelines discard it, routing features through per-view prediction heads before assembling 3D geometry post-hoc, which discards valuable completeness information and accumulates inaccuracies. We instead perform 3D extraction directly from geometry transformer features via learned volumetric extraction: voxelized canonical embeddings that progressively absorb multi-view geometry information through interleaved cross- and self-attention into a structured volumetric latent grid. A simple convolutional decoder then maps this grid to a dense SDF. We additionally propose a scalable, validity-aware supervision scheme directly using SDFs derived from depth maps or 3D assets, tackling practical issues like non-watertight meshes. Our approach yields complete and well-defined distance values across sparse- and dense-view settings and demonstrates geometrically plausible completions. Code and further material can be found at https://lorafib.github.io/fus3d.

cs.CV