Learning to Render Novel Views from Wide-Baseline Stereo Pairs

TL;DR

提出基于多视图Transformer的宽基线立体图像单帧新视角合成方法,显著提升稀疏观察下的重建质量。

cs.CV 🔴 高级 2023-04-18 44 次浏览
Yilun Du Cameron Smith Ayush Tewari Vincent Sitzmann
深度学习 神经渲染 多视图几何 Transformer 稀疏观察

核心发现

方法论

本文提出结合多视图Transformer编码器与图像空间极线采样方案的创新框架。利用相机姿态信息引导Transformer自注意力机制,融合多视图特征,构建像素对齐的场景几何先验。通过在极线上采样点,结合视角变换实现高效、稀疏的特征采样,避免传统体积渲染的高成本。采用轻量级交叉注意力解码器,将采样特征映射为目标视角的像素颜色。训练过程中引入多视图一致性正则与数据增强,提升模型泛化能力。

关键结果

  • 在RealEstate10k和ACID两个真实场景数据集上,本文方法在LPIPS、PSNR、SSIM指标均优于PixelNeRF、IBRNet和GPNR,LPIPS平均降低至0.262,PSNR提升至21.38,显示出在稀疏输入条件下的优越性能。实验还表明,该方法在复杂室内外场景中能准确重建几何结构,且渲染速度较传统体积渲染方法提升3倍以上。
  • 在大尺度场景中,模型无需场景优化,便能实现多视角一致的高质量新视图合成,极大降低训练成本。 Ablation研究验证了多视图编码器、极线采样策略和交叉注意力机制的关键作用,显著提升了几何重建和渲染效果。
  • 该技术突破在于实现宽基线场景的高效几何推断与稀疏特征采样,为未来大规模场景的实时虚拟重建提供了可能。

研究意义

本研究解决了单帧宽基线立体图像下的场景几何与新视角合成难题,突破了多视图几何推断的瓶颈。通过引入Transformer架构与极线采样策略,有效应对稀疏观察带来的几何不准确问题,推动神经渲染技术向大规模、真实场景应用迈进。其高效的训练流程和优异的重建质量,为虚拟现实、增强现实、影视特效等行业提供了新的技术支撑,具有重要的学术和产业价值。

技术贡献

本文提出多视图Transformer编码器结合极线采样的创新架构,显著降低了稀疏观察条件下的几何重建难度。引入像素空间极线采样方案,优化特征采样效率,避免传统体积渲染的高计算成本。采用轻量级交叉注意力解码器,实现高效、多视角一致的场景重建。训练过程中引入多视图正则化与数据增强,增强模型泛化能力。这些技术创新共同推动稀疏观察下的高质量新视角合成成为可能。

新颖性

本研究首次将多视图Transformer编码器应用于宽基线场景的稀疏观察新视角合成,突破了以往多视图几何依赖于多输入图像的限制。极线采样策略在稀疏特征采样中展现出优越性能,显著提升几何推断的准确性。相比传统体积渲染,提出的轻量级交叉注意力解码器大幅降低计算成本,兼顾速度与质量。这些创新使得单帧宽基线场景的神经渲染成为可能,填补了相关领域的空白。

局限性

  • 模型对极端遮挡和极端光照变化仍存在一定的鲁棒性不足,尤其在复杂场景中可能出现几何重建偏差。
  • 训练依赖大量标注相机姿态信息,若姿态估计不准,可能影响最终效果。
  • 在超大规模场景中,模型仍需优化以实现实时渲染,当前速度尚未达到工业级应用要求。

未来方向

未来将探索无监督或弱监督的几何先验学习,减少对精确相机参数的依赖。同时,结合动态场景建模与时序信息,拓展到视频和动态场景的高质量新视角合成。此外,优化模型架构以实现更高的渲染速度和更低的计算成本,推动技术向工业应用落地。

AI 总览摘要

随着虚拟现实和增强现实技术的快速发展,场景的高质量新视角合成成为核心技术之一。传统方法依赖大量图像采集和复杂的几何重建,成本高且难以扩展。本文提出一种基于多视图Transformer编码器与极线采样的创新框架,专为宽基线场景设计,能在仅有单对宽基线立体图像的条件下实现高质量新视角合成。该方法通过引入像素空间极线采样策略,有效利用稀疏特征信息,避免传统体积渲染的高昂计算成本。结合轻量级交叉注意力解码器,模型在多个真实场景数据集上表现出优越的几何重建和渲染效果,显著优于现有的稀疏观察方法。实验结果显示,LPIPS指标降低至0.262,PSNR提升至21.38,验证了其在复杂室内外场景中的适用性和优越性。这一技术突破不仅推动了神经渲染的应用边界,也为未来大规模、实时场景重建提供了新的可能。尽管如此,模型在极端遮挡和超大场景中的表现仍有提升空间,未来将朝无监督学习和动态场景建模方向发展,期待其在虚拟现实、影视制作等行业的广泛应用。

深度解读

原文摘要

We introduce a method for novel view synthesis given only a single wide-baseline stereo image pair. In this challenging regime, 3D scene points are regularly observed only once, requiring prior-based reconstruction of scene geometry and appearance. We find that existing approaches to novel view synthesis from sparse observations fail due to recovering incorrect 3D geometry and due to the high cost of differentiable rendering that precludes their scaling to large-scale training. We take a step towards resolving these shortcomings by formulating a multi-view transformer encoder, proposing an efficient, image-space epipolar line sampling scheme to assemble image features for a target ray, and a lightweight cross-attention-based renderer. Our contributions enable training of our method on a large-scale real-world dataset of indoor and outdoor scenes. We demonstrate that our method learns powerful multi-view geometry priors while reducing the rendering time. We conduct extensive comparisons on held-out test scenes across two real-world datasets, significantly outperforming prior work on novel view synthesis from sparse image observations and achieving multi-view-consistent novel view synthesis.

cs.CV cs.AI