SubSplat: High-Resolution Pixel-aligned 3DGS via Sub-pixel Gaussian Reparameterization

TL;DR

SubSplat用SPGR在低分辨率输入下实现高分辨率3DGS,RealEstate10K达25.52dB。

cs.CV 🔴 高级 2026-07-23 41 次浏览
Jiun Lee Jaekwang Kim Sangmin Lee
3DGS 像素对齐 高分辨率重建 多视图注意力 高效渲染

核心发现

方法论

SubSplat在MVSplat式像素对齐框架上加入SPGR:先用三阶段Deformable Attention聚合多视图几何/外观特征,再将每个主高斯ap=[μp,sp,qp,αp]细分为K个子像素primitive。几何头预测位置、深度、尺度、旋转残差;外观头预测分配logits与颜色增益,并用footprint-aware重分配保持∑kαk=αp。

关键结果

  • 在RealEstate10K上,256×256输入渲染到512×512时,SubSplat取得25.52 PSNR / 0.850 SSIM / 0.167 LPIPS,明显优于HiSplat的23.26 / 0.803 / 0.207,也优于PixelSplat的23.44 / 0.789 / 0.227。
  • 在RealEstate10K ×4(1024×1024)上,SubSplat达到22.65 / 0.781 / 0.268,优于HiSplat的22.05 / 0.779 / 0.309与PixelSplat的21.44 / 0.767 / 0.323;在ACID ×2上为26.03 / 0.775 / 0.216。
  • ACID ×4上,SubSplat获得23.35 / 0.674 / 0.330,LPIPS显著低于HiSplat的0.388,且与其SSIM 0.674持平,说明子像素重参数化在大尺度输出下仍能稳住结构与感知质量。

研究意义

这项工作把像素对齐3DGS长期存在的“分辨率—算力”矛盾拆开了:不再靠把输入网格越做越密来换细节,而是用低分辨率输入保持网络前向成本稳定,再在高斯层面补密度。对于AR/VR、远程看房、移动端NVS等场景,这意味着更可预测的延迟、更低内存压力,以及在高分辨率屏幕上的更强可部署性。

技术贡献

技术上,SubSplat的关键不是简单“后处理放大”,而是把细节生成前移到3D primitive 重参数化阶段。SPGR把单个主高斯拆成K个子像素primitive,并通过深度残差tanh约束、log-scale残差exp参数化、四元数复合与Amin抗混叠保持数值稳定。再结合Deformable Attention和三阶段聚合,模型把多视图一致性、几何密度与外观细节统一到同一套可微渲染管线中。

新颖性

新颖性在于:它不是在图像空间做超分,也不是传统的scene-specific densification,而是首个明确把“子像素级高斯重参数化”用于通用像素对齐3DGS高分辨率渲染的框架之一。核心创新是将输出primitive密度与backbone输入分辨率解耦,并用面积感知的opacity分配保证细分后仍保持原始高斯的整体能量。

局限性

  • 方法依赖多视图特征与相机标定;若输入视角极少、遮挡复杂或标定误差较大,Deformable Attention与SPGR都可能难以稳定恢复正确的子像素几何。
  • 论文主要验证2×与4×整数倍率放大,且训练/测试采用特定分辨率配置;对于非整数倍率、极端长宽比、动态场景或更强运动模糊的泛化能力,文中尚未充分展示。
  • 虽然相较全分辨率基线显著更省算力,但SPGR本身仍引入额外的子primitive生成与注意力聚合开销,极端资源受限设备上的实时性仍需进一步量化。

未来方向

未来可探索更灵活的任意倍率重参数化、面向动态场景的时序一致SPGR,以及更轻量的注意力/细分策略。另一个方向是结合更强的深度先验或显式不确定性建模,提升在稀疏视角、强反射和细薄结构上的鲁棒性,并进一步报告端侧延迟与内存上界。

AI 总览摘要

SubSplat试图解决一个看似简单、实则卡住了许多像素对齐3DGS方法的难题:想把画面做得更清晰,最直接的办法是把输入分辨率抬高,但这会让网络计算量按面积平方增长;若坚持低分辨率输入,输出又会因为高斯密度不足而出现模糊、光晕和结构断裂。作者指出,这种“要么快、要么清晰”的二选一,已经成为高分辨率新视角合成的核心瓶颈。

为此,SubSplat提出Sub-pixel Gaussian Reparameterizer(SPGR)。它先沿用MVSplat式像素对齐主干,从低分辨率特征中预测主高斯ap=[μp,sp,qp,αp]与SH颜色,再用三阶段Deformable Attention聚合多视图几何与外观信息,生成更丰富的描述符。随后,SPGR把每个主高斯细分成K个子像素primitive,分别预测位置、深度、尺度、旋转、颜色和opacity分配,并用footprint-aware重分配确保总透明度守恒。

实验显示,这种“在3D里先补密度、再渲染”的策略确实有效。在RealEstate10K上,256×256输入渲染到512×512时,SubSplat达到25.52 PSNR、0.850 SSIM和0.167 LPIPS;在1024×1024输出时仍有22.65 / 0.781 / 0.268。ACID上对应结果为26.03 / 0.775 / 0.216与23.35 / 0.674 / 0.330,均优于PixelSplat、MVSplat、TranSplat、DepthSplat和HiSplat。更重要的是,它宣称相较全分辨率基线可带来超过3×的时延下降,说明高分辨率渲染不必再被输入网格绑死。

深度分析

研究背景

3D Gaussian Splatting以可学习的各向异性高斯和可微光栅器实现了实时新视角合成,后续又有Mip-Splatting、Multi-Scale 3DGS、Analytic-Splatting和Anti-Aliased 2DGS等工作缓解混叠。另一方面,PixelSplat、MVSplat、HiSplat、TranSplat、DepthSplat等像素对齐方法把多场景泛化做得更好,但其高斯数量被输入网格锁死。分辨率一升,前向计算和显存就迅速膨胀;分辨率一降,细节就开始塌陷。SubSplat正是针对这个结构性矛盾提出的。

核心问题

问题的核心不是“能不能渲染”,而是“如何在固定算力下渲染得足够细”。在像素对齐框架里,每个输出像素附近可用的高斯数量直接受输入网格约束,导致高分辨率输出要么依赖更大的输入分辨率,要么接受稀疏高斯引发的模糊与伪影。前者使backbone前向复杂度近似按像素数平方上升,后者则无法表达边缘、纹理和细薄结构。这个瓶颈同时限制了速度、清晰度和设备可部署性。

核心创新

SubSplat的创新可以概括为三层:第一,把细节补偿从输入网格升级为子像素primitive层,真正解耦输出密度与backbone分辨率;第二,引入SPGR,对每个主高斯进行几何与外观的独立重参数化,预测K个子primitive的偏移、深度、尺度、旋转、颜色与opacity;第三,用三阶段Deformable Attention做多视图特征聚合,让几何决定“看哪里”,外观决定“放大什么”。再加上面积感知的opacity重分配与Amin抗混叠,细分后仍保持稳定与守恒。

方法详解

  • �� 初始化:采用MVSplat相同输入结构,从骨干网络得到N个主高斯A={μp,sp,qp,αp}与SH颜色Hp,并保留相机内外参。

  • �� 几何聚合:将主高斯属性编码为几何查询zgp,经过三阶段Deformable Attention从多视图特征F中提取一致的几何描述fgp。

  • �� 外观聚合:将SH系数映射为外观查询,再以fgp为条件做第二次Deformable Attention,得到外观描述fap。

  • �� SPGR几何头:输出每个子像素primitive的[Δuk,Δvk,Δzk,Δlog sk,Δrk],其中Δzk经tanh约束,尺度用sp⊙exp(Δlog sk),旋转用四元数复合。

  • �� SPGR外观头:输出分配logits lk与颜色增益γk;opacity按wk=softmax(lk)、~ wk=wkAk+ε、αk=αp·~ wk/Σj~ wj重分配。

  • �� 渲染与稳态:对子primitive执行3DGS光栅化;当投影面积Ak过小则施加Amin下限,抑制闪烁和混叠。

实验设计

作者在RealEstate10K与ACID上做了跨尺度评估,全部遵循PixelSplat挖掘流程,并使用仅两张输入视图、45–192帧间隔的稀疏视角设置。训练集包括RealEstate10K 720p的64,002个场景;测试在7,064个720p场景上评估×2,另用3,703个1080p场景评估×4。ACID上则在2,026个场景做×2,在1,622个1080p场景做×4。指标为PSNR、SSIM和LPIPS;基线包括PixelSplat、MVSplat、TranSplat、DepthSplat、HiSplat,以及bilinear和HiT-SR等图像空间上采样器。模型以Adam、2×10^-4学习率、OneCycleLR和2K warm-up训练300K步,单卡A100 80GB。

结果分析

定量结果非常明确:在RealEstate10K ×2上,SubSplat从25.52/0.850/0.167领先HiSplat的23.26/0.803/0.207,也大幅高于PixelSplat的23.44/0.789/0.227。×4时仍保持22.65/0.781/0.268,说明高分辨率输出并未因放大而崩坏。ACID上,SubSplat在×2达到26.03/0.775/0.216,×4达到23.35/0.674/0.330,LPIPS明显优于HiSplat的0.273和0.388。论文还报告其相较全分辨率基线有超过3×时延降低,并且在1024×1024设置下,很多基线因显存压力无法直接评测。

应用场景

SubSplat适合需要“高分辨率、低延迟、跨场景泛化”的任务。短期内,它可用于AR/VR远程看景、房地产虚拟漫游、文旅展示和机器人环境感知中的高保真新视角合成。由于保持低分辨率输入,系统更容易部署在显存受限的工作站、边缘设备和交互式内容平台上。只要具备少量标定相机视图,它就能在保持速度的同时输出更细腻的画面。

局限与展望

SubSplat的效果建立在多视图特征质量和准确标定之上;一旦视角过少、遮挡严重或外参不稳,SPGR生成的子像素结构就可能出现漂移。另一个限制是其主要验证整数倍上采样和静态场景,尚未展示对任意倍率、动态物体或反光/透明材质的系统性鲁棒性。未来若能把子像素重参数化与时序建模、轻量化注意力以及更强的不确定性估计结合,适用面会更广。

通俗解读 非专业人士也能看懂

你可以把这篇工作想成“把一张小照片放大成一面很大的海报”,但不是直接硬拉大,而是先在后台偷偷补上更多小零件。以前的方法像是:底子只有一块小拼图,想做大海报只能把底板也做得很大,于是机器就要更忙、更慢。SubSplat换了思路:先用比较小的底板快速看清大概轮廓,再在需要精细的地方把每个小块拆成更细的小块。这样,边缘会更清楚,纹理会更细,画面也不容易糊成一团。它还会参考多个角度的信息,像是让几位朋友一起看同一张图,再把大家看到的细节拼起来,所以最后出来的画面更稳、更像真的。最重要的是,这种做法不用把整台机器都升级得很重,速度和清晰度终于不用只能选一个。

简单解释 像给14岁少年讲一样

想象你在玩一款超高清建造游戏。以前有些系统想让画面更清楚,办法很笨:把整张地图都变得更大、更细。结果呢?电脑直接开始喘气,卡顿、发热、占内存,像开了十个大型程序一样!但如果地图太粗糙,远处的楼房就会像积木,边缘还会糊掉。SubSplat的聪明之处在于:它不把整张地图一口气放大,而是先看大框架,再把最需要细节的地方“拆小格子”补细节。就像你做手账时,不会把整页都画到爆炸精细,而是只在人物眼睛、头发、背景边缘这些地方认真描。这样既省时间,又更好看!

它还会从不同角度收集信息。你可以把这理解成:同学A看到门牌号,同学B看到窗户反光,同学C看到墙上的海报,最后把这些线索拼起来。于是,SubSplat不只是把东西“变多”,而是把每个小格子的位置、大小、颜色都安排得更合理。这样渲染出来的图,清晰度更高,但机器不需要疯狂加算力。对于看房、虚拟旅游、VR视频这些应用,这真的很香!

最厉害的是,它在大图上也没掉太多分。比如在RealEstate10K上,512×512时拿到25.52分,1024×1024时还有22.65分;在ACID上,512×512是26.03分,1024×1024也有23.35分。也就是说,图片越大,它也没有突然崩掉。你可以把它理解成:不是把“细节”硬塞进大图里,而是学会了更聪明地分配细节。这样一来,高画质和高速度终于不再是死对头了。

术语表

3D Gaussian Splatting (3DGS)

一种把场景表示成许多可学习的三维高斯椭球,并通过可微光栅器进行快速渲染的方法。它兼顾了质量与速度,是本文的基础表示。

SubSplat在3DGS框架上做子像素级重参数化。

Pixel-aligned Gaussian

把高斯参数预测绑定到固定图像网格上的表示方式。每个网格位置对应一组primitive,因此输出密度与输入分辨率紧密耦合。

MVSplat、PixelSplat、HiSplat等基线都属于这一类。

Deformable Attention

一种只在少量可学习采样点上聚合多视图特征的注意力机制。它比全局注意力更省算力,也更适合跨视图对齐。

本文用三阶段Deformable Attention分别做几何与外观聚合。

Sub-pixel Gaussian Reparameterizer (SPGR)

本文的核心模块,把一个主高斯拆成多个子像素primitive,并分别预测其几何与外观修正。它的目标是在不提高backbone输入分辨率的前提下增加输出密度。

用于把低分辨率特征恢复成高分辨率可渲染结构。

Footprint-aware opacity redistribution

依据每个子primitive的屏幕空间投影面积来分配透明度的方法。面积越小的primitive通常获得更高权重,从而增强边界清晰度,同时保持总opacity不变。

对应公式(15)–(17),用于细分后仍满足Σk αk = αp。

Spherical Harmonics (SH)

一种用系数表示视角相关颜色变化的紧凑基函数展开。它能高效编码高斯在不同观察方向上的颜色表现。

论文用4阶SH(C=3, Dsh=25)表示颜色。

开放问题 这项研究留下的未解疑问

  • 1 论文展示了2×和4×整数倍率的高分辨率重建,但没有系统回答:如果目标分辨率不是整数倍,或者需要连续缩放,SPGR该如何定义K和重参数化规则?这决定了它在真实显示设备上的灵活性。
  • 2 方法依赖多视图一致性与准确相机参数,但对动态场景、透明/反射材质、强遮挡与低纹理区域的鲁棒性尚未充分展开。现有结果主要来自静态室内/街景数据,离更复杂世界仍有距离。

应用场景

近期应用

高分辨率虚拟看房

房地产和文旅平台可用少量校准照片生成更清晰的可交互视角。SubSplat在RealEstate10K上对512×512和1024×1024输出都保持高质量,适合需要高清展示但又不能接受高算力开销的在线浏览。

边缘端AR/VR内容生成

在显存和功耗受限的设备上,保留低分辨率输入可稳定推理成本,再通过SPGR补足细节。对于头显、移动端和远程协作系统,这种设计更容易实现实时或准实时体验。

远期愿景

任意尺度的通用场景渲染引擎

若未来支持非整数倍率、动态场景与更强的时序一致性,SubSplat式重参数化可发展为跨设备、跨分辨率的统一渲染层,让同一套模型适配手机、电视墙和沉浸式显示。

原文摘要

Pixel-aligned Gaussian splatting enables efficient and generalizable novel-view synthesis. However, high-resolution rendering faces a critical trade-off where increasing input resolution improves detail at the expense of quadratically rising network computational cost. Conversely, maintaining low-resolution inputs stabilizes this cost but results in insufficient Gaussian density and artifacts. To address this, we propose SubSplat, which introduces Sub-pixel Gaussian Reparameterizer(SPGR) to subdivide primary Gaussians into fine-grained primitives, restoring structural density directly from low-resolution features. We further enhance the reparameterization quality through feature aggregation, which effectively captures high-frequency details across multiple views. Experiments on RealEstate10K and ACID demonstrate that SubSplat achieves high-fidelity rendering with superior efficiency. Our results validate that the proposed framework successfully resolves the trade-off between reparameterization fidelity and network computational cost inherent in pixel-aligned Gaussian Splatting.

cs.CV