ZipSplat: Fewer Gaussians, Better Splats

TL;DR

ZipSplat通过解耦高斯分布与像素网格,使用场景令牌实现高质量低成本的3D重建,减少6倍高斯数。

cs.CV 🔴 高级 2026-06-04 38 次浏览
Alexander Veicht Sunghwan Hong Dániel Baráth Marc Pollefeys
3D重建 神经辐射场 高斯散点 无姿态估计 高效算法

核心发现

方法论

ZipSplat采用基于多视图基础模型提取密集视觉令牌,通过k-means聚类压缩为场景令牌,利用交叉与自注意力机制优化令牌特征,并由轻量MLP解码为自由位置的高斯分布。该模型在推理阶段通过调节聚类比实现不同质量与效率的平衡,避免像素对齐带来的冗余。训练中引入几何监督和逐步调度,确保高斯合理分布于场景表面。该架构无需真实姿态或内参,便在DL3DV和RealEstate10K数据集上实现优异性能,显著减少高斯数(约6倍),并超越现有无姿态方法2.1dB PSNR。

关键结果

  • ZipSplat在DL3DV上用15K高斯达到与像素对齐方法380K相同甚至更优的质量(PSNR提升2.1dB),在RealEstate10K上也实现了相似的性能提升,且模型在视角数增加时表现稳定。通过推理时调节聚类比,模型在不同质量-效率折中点均有良好表现,超越了YoNoSplat和C3G等方法。
  • 在无姿态条件下,ZipSplat以较少高斯实现了最优的视图合成效果,且在跨数据集和零样本泛化任务中表现优异,超越所有比较基线。测试中调节聚类比还能在保持高质量的同时显著降低计算成本。
  • 在测试阶段,结合少量优化步骤,模型性能进一步提升,PSNR提升约5dB,LPIPS指标下降一半,验证了令牌表示的潜力和模型的可调性。

研究意义

该研究突破了高斯散点预测与像素网格的耦合限制,实现了场景表达的高度压缩与灵活性,极大提升了无姿态估计场景的重建效率与质量。其创新的令牌机制为未来大规模、实时3D场景重建提供了新思路,有望推动虚拟现实、增强现实和数字孪生等行业的快速发展。模型无需精确姿态或内参,降低了实际应用门槛,具有广泛的工业应用潜力。

技术贡献

ZipSplat引入基于视觉令牌的场景表示,打破像素对齐的束缚,结合k-means压缩和交叉自注意力机制,有效减少高斯数量同时提升细节表现。其核心创新在于推理时通过调节聚类比实现模型的连续质量调节,避免多次训练,极大提升了模型的适应性和实用性。训练中采用几何监督确保高斯合理分布于场景表面,结合逐步调度策略,增强模型稳定性。这些技术突破为无姿态场景重建提供了新范式。

新颖性

本研究首次提出将场景表示从像素网格解耦,利用场景令牌实现高斯分布的自由布局,显著减少高斯数同时保持甚至提升重建质量。与传统像素对齐方法相比,ZipSplat在模型灵活性和效率上具有突破性优势,特别是在无需真实姿态和内参的条件下实现高质量重建,填补了无姿态场景重建的技术空白。

局限性

  • 模型在极端稀疏视角或复杂场景中可能出现高斯分布偏离实际表面的问题,尤其在几何监督不足时表现不佳。
  • 训练过程中对几何监督的依赖可能限制模型在某些场景中的泛化能力,尤其是未提供准确深度信息时。
  • 推理时调节聚类比虽然提供灵活性,但在极端压缩比下可能导致细节丢失,影响最终效果。

未来方向

未来将探索更强的几何引导机制,提升模型在极端场景中的鲁棒性;同时结合动态令牌生成策略,进一步降低高斯数,提升实时性能。还计划扩展到动态场景和大规模场景的高效重建,推动其在虚拟现实和工业设计中的实际应用。

AI 总览摘要

随着虚拟现实和增强现实技术的快速发展,场景的高效、精确重建成为核心难题。传统的神经辐射场(NeRF)方法虽能实现逼真渲染,但训练耗时长、成本高,限制了其实际应用。近年来,基于高斯散点的3D重建方法(如3D Gaussian Splatting)因其渲染速度快、细节丰富而受到关注,但其普遍依赖像素对齐,导致高斯数量与像素数成正比,难以应对复杂场景和多视角冗余问题。为突破这一瓶颈,Veicht等提出了ZipSplat,一种基于场景令牌的无像素对齐模型,能在保证高质量的同时显著减少高斯数量。

ZipSplat通过多视图基础模型提取密集视觉令牌,利用k-means在特征空间压缩为场景令牌,然后通过交叉与自注意力机制优化这些令牌,最后由轻量MLP解码为自由布局的高斯分布。其核心创新在于推理阶段通过调节聚类比实现模型的连续质量调节,无需多次训练,极大增强了模型的适应性。训练中引入几何监督确保高斯合理分布于场景表面,结合逐步调度策略,提升训练稳定性。

实验结果显示,ZipSplat在DL3DV和RealEstate10K数据集上均超越现有无姿态方法,预测高斯数比像素对齐方法少6倍,PSNR提升2.1dB。模型在视角数增加时表现稳定,且能在推理时调节压缩比,实现不同质量与效率的折中。其零样本跨数据集泛化能力也优于所有对比方法,展现出极强的实用潜力。未来,该技术有望推动大规模实时场景重建、虚拟现实和工业设计的发展,成为场景表达的关键技术之一。

深度分析

研究背景

多视角场景重建技术经历了从经典多视图立体到神经辐射场(NeRF)等隐式表示的演变。NeRF通过连续体积函数实现高保真渲染,但训练耗时长,难以实时应用。高斯散点(3D Gaussian Splatting)作为显式几何原语,能在保持细节的同时实现实时渲染,已成为研究热点。近年来,基于像素对齐的预测方法(如DA3、YoNoSplat)提升了速度,但其依赖像素网格,导致高斯冗余,难以应对复杂场景。解决方案逐渐向场景令牌和无像素对齐方向发展,旨在实现更高效、更灵活的场景表达。

核心问题

现有feed-forward 3D高斯散点方法普遍将高斯预测绑定于像素射线,导致高斯数与像素数挂钩,不能根据场景复杂度动态调整。这造成在简单平面和复杂细节场景中高斯数量相同,浪费资源。此外,视角重叠时会产生大量冗余高斯,限制模型扩展到大规模或未观察区域。如何解耦高斯布局与像素网格,提升表达效率,成为关键难题。

核心创新

本研究提出场景令牌机制,将场景表示从像素网格转向稀疏令牌,显著减少高斯数量。引入k-means特征空间聚类,实现推理时的连续调节,避免多次训练。结合交叉与自注意力机制,增强令牌表达能力。通过几何监督引导高斯合理分布于场景表面,提升细节还原。整体架构实现了高效、灵活且无需姿态信息的场景重建,为无姿态场景理解提供新思路。

方法详解

  • �� 多视图基础模型提取密集视觉令牌,捕获局部细节与全局结构。• 在特征空间中应用k-means聚类,将大量冗余令牌压缩为K个场景令牌,K由推理调节比控制。• 令牌通过交叉与自注意力机制优化,融合多视角信息,增强表达能力。• 由轻量MLP解码每个令牌为G个自由布局的高斯分布,参数包括位置、尺度、旋转、透明度和颜色系数。• 训练中引入几何监督(Chamfer距离)确保高斯落在场景表面,结合逐步调度策略,提升训练稳定性。• 推理时调节聚类比实现不同质量折中,模型无需多次训练即可适应多场景需求。

实验设计

在DL3DV和RealEstate10K数据集上进行评估,比较基线包括YoNoSplat、C3G、DA3等。采用PSNR、SSIM、LPIPS作为性能指标,调节聚类比以观察质量-效率折中。模型参数G=32显著减少高斯数,训练采用AdamW优化,结合几何监督和逐步调度。测试中调节聚类比实现不同压缩比,验证模型在多视角和跨数据集场景中的表现。结果显示,ZipSplat在保持高质量的同时,大幅降低高斯数,优于所有对比方法。

结果分析

ZipSplat在DL3DV上用15K高斯达到与380K像素对齐方法相同或更优的PSNR(提升2.1dB),在视角数增加时保持性能稳定。跨数据集测试中,模型在Mip-NeRF360和ScanNet++上实现零样本泛化,超越所有基线。调节推理时聚类比能在保持高质量的同时显著降低计算成本,验证了令牌机制的有效性。结合少量优化步骤,性能进一步提升,验证模型的潜力和灵活性。

应用场景

该技术适用于虚拟现实、增强现实、数字孪生等场景的实时场景重建,尤其在缺乏精确姿态或内参的条件下表现优异。可用于大规模场景的快速建模、影视特效、工业设计等领域,降低硬件成本和数据采集难度。未来,结合动态场景和大规模数据,将推动行业实现更高效、更真实的虚拟环境。

局限与展望

模型在极端稀疏视角或复杂几何场景中可能出现高斯偏离实际表面的问题,几何监督不足时表现不佳。推理调节比在极端压缩下可能导致细节丢失。训练中对几何监督的依赖限制了泛化能力,未来需增强几何引导机制。模型在动态场景和大规模场景中的适应性仍需验证,存在一定的应用限制。

通俗解读 非专业人士也能看懂

想象你在画一幅复杂的画。传统方法就像用点点笔在画布上逐个点描绘场景,每个点都必须精准放在对应的像素位置。这样虽然可以画出细节,但非常耗时,而且每个点都要跟随像素的网格,不能灵活调整。ZipSplat则像用一组神奇的魔法棒,先从多幅照片中提取场景的整体“魔法令牌”,再用智能算法把相似的令牌合成一组,最后由一个小魔法师根据这些令牌自由地在空间中放置“魔法球”。这些魔法球可以集中在细节丰富的区域,也可以少一些在平坦的墙壁上。这样,不仅画得快,还能根据需要随时调整细节和质量。它就像用魔法让画变得既快又漂亮,省去了繁琐的点点描绘过程。

简单解释 像给14岁少年讲一样

你知道在玩拼图游戏吗?传统拼图就像每块拼图都必须拼在特定的地方,不能随意放。每块都代表一个像素点,拼得越多,画得越细。ZipSplat就像用一堆神奇的魔法块,它们可以自己决定放在哪里,重点放在复杂的细节上,平坦的墙壁就用少一些魔法块。这样一来,拼图既快又漂亮,不用每块都拼在固定位置。它还可以根据不同的需要调整魔法块的数量,既省时间,又能保证画面细节。这就像用魔法让拼图变得更聪明、更灵活,既节省时间,又能做出更漂亮的画。

原文摘要

Feed-forward 3D Gaussian Splatting methods reconstruct a scene from posed or pose-free images in a single forward pass, yet current approaches predict one Gaussian per input pixel, tying the representation budget to camera resolution rather than scene complexity. A flat wall and a richly textured object thus produce equally many Gaussians despite very different geometric needs. We propose ZipSplat, a token-based feed-forward model that decouples Gaussian placement from the pixel grid. A multi-view backbone extracts dense visual tokens, and k-means clustering compresses them into a compact set of scene tokens. Cross- and self-attention refine these tokens, and a lightweight MLP decodes each into a group of Gaussians with unconstrained 3D positions. Because clustering is applied at inference, a single trained model spans the quality-efficiency curve without retraining. ZipSplat operates without ground-truth poses or intrinsics, yet sets a new state of the art on DL3DV and RealEstate10K with ${\sim}6{\times}$ fewer Gaussians than pixel-aligned methods, surpassing the best pose-free baseline by 2.1dB and 1.2dB PSNR, respectively. It further generalizes zero-shot to Mip-NeRF360 and ScanNet++, outperforming all comparable baselines. Our project page is at https://veichta.com/zipsplat.

cs.CV