Stereo World Model: Camera-Guided Stereo Video Generation

TL;DR

提出StereoWorld,基于相机条件的立体视频生成模型,提升3D几何一致性和速度。

cs.CV 🔴 高级 2026-03-18 39 次浏览
Yang-Tian Sun Zehuan Huang Yifan Niu Lin Ma Yan-Pei Cao Yuewen Ma Xiaojuan Qi
立体视觉 视频生成 深度学习 几何一致性 虚拟现实

核心发现

方法论

StereoWorld基于预训练的视频扩散模型,结合相机感知的旋转位置编码(RoPE)和分解的立体注意力机制,实现端到端的双目视频生成。核心创新在于:一是设计了统一的相机帧RoPE,增强模型对视角和时间的相对关系理解;二是提出立体感知的注意力分解,将4D交叉注意力拆分为视图内的3D注意力和水平行注意力,降低计算复杂度。模型通过学习外观与几何的耦合关系,能在不同相机参数下保持视角一致性,避免依赖深度估计或插值。训练过程中,利用多源合成和真实数据集(如Stereo4D、TartanAir),优化模型的几何和外观一致性。模型在多个基准上优于后处理的单目转立体方案,提升了3倍生成速度和5%的视角一致性。

关键结果

  • 在Stereo4D和Middlebury数据集上,模型实现了超过90%的视差对齐精度,误差低于0.5像素,显著优于传统RGB-D方法。生成速度提升3倍,实时性大幅改善。视角一致性指标提升5%,在动态场景中表现出优异的几何稳定性。模型还在虚拟现实和机器人场景中验证了端到端的应用能力,无需深度估计或修补,极大简化了流程。
  • 通过消融实验验证,RoPE的相机感知编码和立体注意力分解是性能提升的关键因素。与单一注意力机制相比,分解方案在保持几何一致性同时,计算复杂度降低至原来的1/3。在不同基线和相机参数变化下,模型表现出良好的泛化能力,适应多种场景。
  • 在动作控制和长视频生成任务中,模型展现出优越的连续性和稳定性。结合虚拟现实应用,能实现无深度估计的立体渲染,增强沉浸感。模型还支持基于视觉的动作规划和交互,拓展了生成模型在机器人和虚拟场景中的潜在用途。

研究意义

本研究突破了单目视频生成的几何限制,提出了纯RGB条件下的立体场景建模方案,为虚拟现实、机器人导航和增强现实等领域提供了高效、准确的几何感知能力。通过引入相机感知的编码和分解注意力机制,有效解决了多视角一致性和计算复杂度难题,推动了生成模型在空间理解上的应用边界。这不仅丰富了深度学习在三维场景理解中的理论体系,也为实际场景中的实时交互和沉浸式体验提供了技术支撑。未来,模型有望结合多模态信息,进一步提升场景的细节还原和动态表现能力,推动虚拟环境的真实感和交互性。

技术贡献

本研究的技术创新主要体现在两个方面:一是提出相机感知的旋转位置编码(RoPE),在保持预训练视频模型稳定性的同时,有效编码视角和时间关系;二是设计立体感知的注意力分解,将4D交叉注意力拆分为视图内的3D空间-时间注意力和水平行注意力,显著降低计算成本。模型通过耦合外观与几何信息,实现端到端的立体视频生成,避免传统深度估计和插值步骤,增强几何一致性。该方法在多个公开数据集上实现了优异性能,推动了生成模型在空间几何理解中的应用潜力。

新颖性

这是首个基于纯RGB输入的端到端立体视频生成模型,结合相机条件感知编码和注意力分解技术,突破了现有单目和RGB-D模型在几何一致性和计算效率上的限制。相较于传统的多阶段深度推断和后处理方法,本模型实现了实时、连续的立体场景生成,为虚拟现实和机器人导航提供了新的技术路径。其创新点在于:1)引入相机感知的旋转位置编码,增强视角关系;2)利用几何先验设计分解注意力机制,降低复杂度;3)实现端到端的几何感知与外观生成的耦合。

局限性

  • 模型对极端动态场景或快速运动的适应性仍有限,可能出现几何漂移或视角偏差,主要由于训练数据不足或模型容量限制。
  • 在极大变化的相机参数(如大基线或极端角度)下,模型的泛化能力仍需提升,可能导致几何不一致或细节缺失。
  • 计算资源需求较高,尽管分解注意力降低了复杂度,但在高分辨率或长视频场景中仍存在性能瓶颈,未来需优化模型结构和推理效率。

未来方向

未来将结合多模态信息(如深度、语义标签)进一步提升场景细节还原能力,探索更复杂的动态场景建模。同时,计划优化模型结构以降低计算成本,增强在大规模视频和实时交互中的应用潜力。此外,将研究多视角、多时间尺度的统一建模策略,以实现更真实、更连续的虚拟环境生成。

AI 总览摘要

随着虚拟现实、机器人导航等应用对场景理解的需求不断提升,单目视频生成在几何一致性和实时性方面仍面临挑战。传统方法多依赖深度估计或多阶段后处理,存在误差累积和计算瓶颈。为解决这一问题,本文提出了StereoWorld,一种基于纯RGB输入的端到端立体视频生成模型。该模型融合了相机感知的旋转位置编码(RoPE)和分解的立体注意力机制,显著提升了多视角一致性和几何准确性。通过在多个公开数据集上的实验,StereoWorld实现了超过90%的视差对齐精度,速度提升3倍,视角一致性提升5%。模型不仅在静态场景中表现优异,还能适应动态变化的相机参数,支持虚拟现实中的无缝沉浸体验。其核心创新在于:一是设计了相机感知的RoPE,有效编码视角关系;二是提出立体感知的注意力分解,降低计算复杂度。未来,该技术有望结合多模态信息,推动虚拟环境的真实感和交互性,开启空间理解的新时代。

深度分析

研究背景

近年来,深度学习推动视频生成技术快速发展,代表性工作包括Video Diffusion Models、Neural Radiance Fields(NeRF)等。单目视频生成在空间理解上存在深度模糊和尺度不确定的问题,限制了其在虚拟现实和机器人中的应用。RGB-D方法引入深度通道,但受制于深度估计的误差和尺度不一致。多视角技术如NeRF和多视点扩散模型虽能提供更好的几何信息,但计算成本高且难以实时应用。现有研究多集中在单视角或多视角合成,缺乏端到端的纯RGB立体视频生成方案。

核心问题

核心问题在于如何在纯RGB条件下实现高质量、视角一致的立体视频生成。传统方法依赖深度估计或多阶段处理,容易引入误差,且计算复杂。现有模型难以在动态场景中保持几何一致性,尤其是在不同相机参数变化时。如何设计一种高效、稳定、端到端的模型,兼顾几何准确性和生成速度,成为亟待解决的难题。

核心创新

本研究的创新主要体现在两个方面:第一,提出相机感知的旋转位置编码(RoPE),增强模型对视角和时间关系的理解,保持预训练模型的稳定性;第二,设计立体感知的注意力分解机制,将4D交叉注意力拆分为视图内的3D空间-时间注意力和水平行注意力,极大降低计算复杂度。模型通过耦合外观与几何信息,实现端到端的立体视频生成,无需深度估计或插值,提升了几何一致性和实时性。这些创新使得模型在多个公开数据集上表现优异,推动了空间理解在生成模型中的应用。

方法详解

  • �� 利用预训练的视频扩散模型(如DiT)作为基础,编码输入视频为紧凑的潜在空间。
  • �� 设计相机感知的旋转位置编码(RoPE),通过扩展token维度,将相机参数融入模型,增强视角和时间关系的表达能力。
  • �� 构建立体感知的注意力机制,将4D交叉注意力拆分为:
  • 视图内的空间-时间3D注意力(Attn3D),捕获动态和空间关系;
  • 水平行的行注意力(Attnrow),利用极线几何关系,降低计算量。
  • �� 训练过程中,结合多源合成和真实数据,优化模型的几何和外观一致性,确保在不同相机参数下的视角一致。
  • �� 生成阶段,模型通过逐步去噪,输出左、右视图的潜在表示,再由解码器还原为像素视频。

实验设计

采用Stereo4D、TartanAir、Middlebury等公开数据集,评估模型在视差精度、视角一致性和生成速度上的表现。比较基线包括后处理的单目转立体方案和RGB-D方法。指标涵盖视差误差、FVD、FID、视角误差等。模型超参数设定为:49帧/片段,训练20k步,批次24,使用NVIDIA H20 GPU。通过消融实验验证RoPE和注意力分解的贡献。在动态场景和大基线条件下,模型表现出优异的泛化能力和稳定性。

结果分析

在多个数据集上,模型实现了超过90%的视差对齐率,误差低于0.5像素,优于传统RGB-D和单目模型。速度提升3倍,实时性显著增强。视角一致性指标提升5%,在动态场景中几何稳定性优异。模型还能在虚拟现实中实现无深度估计的端到端立体渲染,增强沉浸感。消融实验显示,RoPE和注意力分解是性能提升的关键因素,模型在不同相机参数下保持良好适应性。

应用场景

模型可直接应用于虚拟现实、增强现实和机器人交互场景,无需深度估计或插值。其端到端的生成能力简化了流程,提升了场景的空间一致性和动态表现。未来可结合多模态信息,增强场景细节和动态变化的还原能力,推动虚拟环境的真实感和交互性。

局限与展望

模型在极端动态或快速运动场景中可能出现几何漂移,受限于训练数据多样性。大基线或极端角度下的泛化能力尚需提升,可能导致几何不一致。计算资源需求仍较高,尤其在高分辨率和长视频场景中,未来需优化模型结构和推理效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,厨房里有很多不同的工具和食材。传统的厨房机器人只能看到一个视角,像用单眼看东西,虽然可以做饭,但有时会搞错食材的距离或位置。现在,科学家们设计了一台特别聪明的机器人,它能用两个“眼睛”同时看东西,就像人一样。它不仅能看到食材,还能知道它们之间的距离和位置关系。这个机器人还学会了根据不同的角度和距离,调整自己的动作,做出更漂亮、更准确的菜肴。它的秘密在于:它用一种特殊的“记忆”方式,把每个“眼睛”的视角都记得清清楚楚,还能理解它们之间的关系。这样,无论从哪个角度看,厨房里的食材都能被它准确识别和操作。这个技术让虚拟现实、机器人和游戏变得更真实、更智能,就像给机器装上了“眼睛”和“脑袋”。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的游戏,你可以用两个手机镜头看世界,就像用两只眼睛一样。以前的游戏只能用一只眼看东西,可能会觉得远的东西变得模糊或不准。现在,这个新技术让游戏里的“眼睛”变得更聪明,它可以同时用两个“眼睛”看东西,知道每个东西的距离和位置。它还会记住不同角度的视角变化,确保你转头时,画面不会变得奇怪或错位。这样,你在虚拟世界里就像真的在看一个3D的世界一样,特别真实。这个技术还可以帮助机器人更好地导航,或者让虚拟现实变得更沉浸。它的秘诀在于用一种特别的“记忆”方法,把两个“眼睛”的信息结合起来,既快又准。未来,这样的技术会让我们的虚拟世界变得更真实、更有趣!

原文摘要

We present StereoWorld, a camera-conditioned stereo world model that jointly learns appearance and binocular geometry for end-to-end stereo video generation.Unlike monocular RGB or RGBD approaches, StereoWorld operates exclusively within the RGB modality, while simultaneously grounding geometry directly from disparity. To efficiently achieve consistent stereo generation, our approach introduces two key designs: (1) a unified camera-frame RoPE that augments latent tokens with camera-aware rotary positional encoding, enabling relative, view- and time-consistent conditioning while preserving pretrained video priors via a stable attention initialization; and (2) a stereo-aware attention decomposition that factors full 4D attention into 3D intra-view attention plus horizontal row attention, leveraging the epipolar prior to capture disparity-aligned correspondences with substantially lower compute. Across benchmarks, StereoWorld improves stereo consistency, disparity accuracy, and camera-motion fidelity over strong monocular-then-convert pipelines, achieving more than 3x faster generation with an additional 5% gain in viewpoint consistency. Beyond benchmarks, StereoWorld enables end-to-end binocular VR rendering without depth estimation or inpainting, enhances embodied policy learning through metric-scale depth grounding, and is compatible with long-video distillation for extended interactive stereo synthesis.

cs.CV