Off The Grid: Detection of Primitives for Feed-Forward 3D Gaussian Splatting

TL;DR

提出“Off-The-Grid”架构,通过子像素级检测优化3D高斯原语布局,显著提升场景重建质量与效率。

cs.CV 🔴 高级 2025-12-17 55 次浏览
Arthur Moreau Richard Shaw Michal Nazarczuk Jisu Shin Thomas Tanay Zhensong Zhang Songcen Xu Eduardo Pérez-Pellitero
3D重建 神经渲染 高斯散射 无姿态 自监督学习

核心发现

方法论

本文提出一种基于深度学习的“Off-The-Grid”架构,利用类似关键点检测的解码器在图像块内学习3D高斯原语的分布。模型结合预训练的VGGT作为基础,采用子像素级检测机制,通过多密度自适应机制动态分配原语数量。训练过程中,利用光度监督实现端到端优化,无需3D标注,模型能在秒级生成高质量场景,超越现有像素和体素对齐方法,减少原语数量同时提升细节表现。

关键结果

  • 在多视角新视点合成任务中,本文模型在12视图条件下,PSNR达21.21,SSIM为0.647,LPIPS为0.353,优于AnySplat的17.71、0.507和0.393,且仅用原语的7分之一,显著提升细节还原能力。
  • 在多个公开数据集(如DL3DV、Charge、Tanks and Temples)上,模型表现出更高的鲁棒性和细节还原能力,尤其在极端视角下避免了像素对齐带来的模糊和伪影问题。
  • 消融实验表明,多密度自适应机制和子像素检测显著优于传统像素或体素对齐策略,原语数量减少70%以上,场景细节捕获更为精准。

研究意义

该研究突破了传统像素或体素对齐的限制,提出更具表达力的原语布局方式,极大改善了无姿态场景的实时重建与渲染效果。其端到端自监督训练框架降低了对3D标注的依赖,为场景理解、虚拟现实和增强现实等应用提供了高效、精细的解决方案,推动神经渲染技术向更高质量、更广泛的场景适应性发展。

技术贡献

引入子像素级检测机制和多密度自适应分配策略,结合预训练的3D重建模型VGGT,创新性地实现了无姿态、端到端的场景重建。模型通过学习原语的空间分布和置信度,有效减少冗余,提升细节表现。技术上实现了原语位置的非规则化和动态调节,突破了传统规则网格的限制,为高效场景表达提供新思路。

新颖性

首次提出“Off-The-Grid”原语检测架构,突破像素和体素对齐的限制,利用子像素检测和自适应密度机制实现更精细的原语布局。相较于现有PixelSplat和Voxel-Gaussian方法,本研究在保持高效率的同时,显著提升细节还原和场景一致性,展现出更强的表达能力和泛化能力。

局限性

  • 模型依赖预训练的VGGT作为基础,可能在极端场景或复杂几何结构中表现不佳,存在一定的泛化风险。
  • 多密度机制虽然提升了细节捕获,但在极端高密度场景下仍可能出现冗余或计算瓶颈,需进一步优化。
  • 目前主要在静态场景中验证,动态场景和实时交互应用仍需适配和扩展。

未来方向

未来将探索多尺度、多层次的原语检测策略,结合动态场景和实时交互需求,提升模型的鲁棒性和泛化能力。同时,结合更高效的自监督机制,减少对预训练模型的依赖,推动场景重建向更广泛的应用场景扩展。

AI 总览摘要

近年来,神经场景重建技术不断突破,尤其是3D高斯散射(3DGS)模型凭借其渲染效率在虚拟现实和增强现实中展现巨大潜力。然而,现有方法多依赖规则网格或像素对齐策略,限制了场景细节的还原能力和模型的表达灵活性。本文提出的“Off-The-Grid”架构,通过在图像块内学习子像素级的高斯原语分布,有效突破了传统像素和体素对齐的局限。

该方法结合预训练的VGGT模型,利用深度学习解码器在无姿态条件下动态检测和分配原语,采用多密度自适应机制,显著提升了场景细节的捕获能力。训练过程中,模型通过光度损失实现端到端自监督,无需任何3D标注,能够在几秒内生成高质量的场景重建。

在多个公开数据集上的实验结果显示,该模型在新视点合成任务中优于现有最先进技术,PSNR达21.21,SSIM为0.647,LPIPS为0.353,远超PixelSplat和Voxel-Gaussian方法,且原语数量减少70%以上。这不仅提升了场景的细节还原,也大幅降低了冗余和伪影的产生。

该研究的创新点在于引入非规则化的子像素检测和多密度动态分配机制,为无姿态场景的高效、精细重建提供了新思路。其端到端自监督框架极大简化了流程,降低了对3D标注的依赖,为虚拟现实、影视特效、场景理解等行业带来了广阔的应用前景。未来,模型将进一步扩展到动态场景和实时交互中,推动神经渲染技术迈向更高水平。

深度分析

研究背景

神经场景重建技术经历了从NeRF到高效点云和高斯散射模型的发展。NeRF通过体积渲染实现高质量重建,但计算成本高,限制了实时应用。高斯散射模型如3DGS通过点或高斯原语实现场景表达,提升了渲染速度,但多依赖规则网格或像素对齐,限制了细节表现和表达灵活性。近年来,端到端的无姿态学习和自监督技术逐渐兴起,试图突破预先设定的几何约束,提升模型的泛化能力和效率。

核心问题

现有的无姿态3D场景重建方法多依赖像素或体素对齐策略,导致原语布局缺乏灵活性,难以捕获复杂细节。同时,规则网格限制了原语的表达能力,难以适应多样化场景。如何在保证效率的同时,实现更精细、更自然的场景表达,成为核心难题。此外,缺乏有效的子像素级检测机制,使得场景细节还原不足,伪影和模糊问题严重。

核心创新

本研究提出“Off-The-Grid”检测架构,突破像素和体素对齐限制,实现子像素级原语检测。引入多密度自适应机制,根据图像块内容动态分配原语数量,提升细节捕获。结合预训练的VGGT模型,端到端训练,无需3D标注,显著简化流程。模型通过学习原语空间分布和置信度,有效减少冗余,提升场景细节还原能力。这些创新共同推动无姿态场景重建迈向更高精度和效率。

方法详解

  • �� 利用预训练的VGGT模型提取多视角几何信息,生成初步场景结构。• 设计子像素检测解码器,结合热图机制在图像块内学习高斯原语的二维中心位置。• 采用多密度自适应机制,根据Shannon熵动态分配不同密度的原语,优先处理细节丰富区域。• 从检测到的二维点,通过插值深度和相机参数实现三维空间中的高斯中心位置。• 预测每个高斯的尺度、方向、透明度和置信度,利用MLP从描述符中解码其他参数。• 在多视角中融合原语,利用置信度筛选冗余或不可靠的原语,提升模型的鲁棒性。• 通过光度损失和几何一致性损失进行端到端训练,无需3D标注,模型能在秒级生成高质量场景。

实验设计

采用DL3DV、Charge、Tanks and Temples等公开数据集,比较不同视角数(3、6、9、12)下的重建效果。指标包括PSNR、SSIM和LPIPS,模型与PixelSplat、Voxel-Gaussian等基线对比。通过消融实验验证多密度机制和子像素检测的贡献。训练细节包括使用单GPU,采样线性帧,调节超参数以平衡细节与效率。模型在极端视角下表现优越,细节丰富,伪影少,验证了其优越性。

结果分析

在12视图条件下,模型PSNR达21.21,SSIM为0.647,LPIPS为0.353,明显优于PixelSplat(17.71/0.507/0.393)和Voxel-Gaussian(16.28/0.4177/0.3028)。原语数量仅为像素数的7分之一,细节还原更细腻,伪影明显减少。多密度机制有效提升复杂区域的表达能力,模型在极端视角下依然保持清晰几何和逼真渲染。消融实验显示,子像素检测和动态分配机制是性能提升的关键。

应用场景

该方法适用于虚拟现实、影视特效、场景理解等领域,能在无姿态信息下快速生成高质量场景模型。只需输入多视角图像,无需3D标注或相机参数,便可实现实时交互和场景重建。未来可结合动态场景和实时交互,推动神经渲染在虚拟环境中的应用普及。

局限与展望

模型依赖预训练几何模型,可能在极端复杂场景中表现不佳,存在泛化风险。多密度机制在极高密度场景下仍可能引入冗余或计算瓶颈,需进一步优化。当前主要适用于静态场景,动态场景和实时交互仍需扩展和改进。

通俗解读 非专业人士也能看懂

想象你在画一幅画,但画布上没有固定的格子,也没有预先划好的线条。你用笔在画布上随意点点,但每个点都代表一个场景中的重要部分。传统方法就像用格子铺满整个画布,每个格子对应一个点,虽然简单,但细节可能不够丰富。而这次的方法像是用一只聪明的手,能在画布上找到最合适的点,点得更精细、更贴近真实。它还能根据画面内容,自己决定在哪些地方多点一些笔触,哪些地方少点,确保画面既细腻又不繁琐。这样一来,画出来的场景既真实又高效,能在几秒钟内完成一幅逼真的画作。这就像用一只特别聪明的画笔,知道哪里需要更多细节,哪里可以少一些,最终让整个画面看起来既自然又细腻。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的拼图游戏,但拼图块没有固定的格子,也没有提前划好的线。你用一只神奇的手指,在空中找到拼图的关键点,然后把它们放到最合适的位置。以前的方法就像用格子铺满整个桌子,每个格子都装一个拼图块,虽然简单,但拼出来的图可能不够细腻。而这个新方法就像那只神奇的手,能在空中找到最重要的点,把拼图块放得特别精准。它还能根据图片的复杂程度,自己决定在哪些地方放多一点拼图块,在哪些地方放少一些。这样,拼出来的场景既细腻又快,几秒钟就能完成一幅逼真的画面。就像用一支特别聪明的画笔,知道哪里需要更多细节,哪里可以少一些,最终让画面看起来既自然又漂亮。

原文摘要

Feed-forward 3D Gaussian Splatting (3DGS) models enable real-time scene generation but are hindered by suboptimal pixel-aligned primitive placement, which relies on a dense, rigid grid that limits both quality and efficiency. We introduce a new feed-forward architecture that detects 3D Gaussian primitives at a sub-pixel level, replacing the pixel grid with an adaptive, ``Off-The-Grid" distribution. Inspired by keypoint detection, our decoder learns to locally distribute primitives across image patches. We also provide an Adaptive Density mechanism by assigning varying number of primitives per patch based on Shannon entropy. We combine the proposed decoder with a pre-trained 3D reconstruction backbone and train them end-to-end using photometric supervision without any 3D annotation. The resulting pose-free model generates photorealistic 3DGS scenes in seconds, achieving state-of-the-art novel view synthesis for feed-forward models. It outperforms competitors while using far fewer primitives, demonstrating a more accurate and efficient allocation that captures fine details and reduces artifacts. Project page: https://arthurmoreau.github.io/OffTheGrid/.

cs.CV