WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory

TL;DR

WorldCrafter通过隐式3D记忆模型提升视频世界模型的长时间一致性,摄像机控制精度提高47.6%。

cs.CV 🔴 高级 2026-09-22 5 次浏览
Wangbo Yu Kunhao Liu Wenbo Hu Shenghai Yuan Chaoran Feng Haiyang Zhou Yukun Huang Yiran Wang Wang Zhao Yingmin Luo Ying Shan
视频生成 3D记忆 摄像机控制 长时间一致性 深度学习

核心发现

方法论

WorldCrafter通过隐式3D记忆模型提升视频世界模型的长时间一致性。其核心是记忆编码器和姿态条件读取模块,整合历史观察数据为目标视图特定的标记。通过与视频生成器共同训练,该模型在不依赖深度对应的情况下,结合近期时间上下文和少步蒸馏,实现从单一输入图像或文本提示进行流式场景探索。

关键结果

  • 在静态和动态场景中,WorldCrafter在长时间一致性和摄像机控制精度上相较于最强基线提高了47.6%。
  • 实验显示在分钟级别的探索中,视觉质量得以保持,同时摄像机控制精度显著提高。
  • 在不同场景下,WorldCrafter在长时间一致性和视觉质量上均表现出色。

研究意义

WorldCrafter在视频世界模型领域具有重要意义。它解决了长时间和跨视点观察一致性的问题,尤其是在动态环境中。该方法不仅提升了学术界对视频生成模型的理解,还为工业界提供了更为精确的摄像机控制和场景探索工具。

技术贡献

WorldCrafter的技术贡献在于其创新的隐式3D记忆机制和摄像机可控的自回归视频生成方法。通过将历史观察数据压缩为固定的标记,该模型在不依赖显式深度信息的情况下提高了长时间一致性和摄像机控制精度。

新颖性

WorldCrafter首次将隐式3D记忆引入视频世界模型,突破了传统几何预测优先的限制,提供了更高的外观保真度和一致性。

局限性

  • 在极端动态场景中,模型可能会出现一致性下降的问题,因为没有显式的深度信息。
  • 对摄像机轨迹的依赖可能限制了某些自由度较高的应用场景。

未来方向

未来的研究方向包括提升模型在极端动态场景中的表现,以及减少对摄像机轨迹的依赖,以拓展应用场景。

AI 总览摘要

视频世界模型允许用户在动态环境中进行交互式探索,但在长时间和跨视点保持一致性方面面临挑战。WorldCrafter通过学习一种可查询的隐式3D记忆模型来解决这一问题。该模型的核心在于让请求的视点决定如何将多视角证据压缩到视频生成器的有限标记预算中。通过与视频生成器共同训练,记忆编码器和姿态条件读取模块在去噪前将历史观察数据整合为固定的目标视图特定标记。实验结果表明,WorldCrafter在静态和动态场景中显著提高了长时间一致性和摄像机控制精度,同时在分钟级别的探索中保持视觉质量。

WorldCrafter的技术贡献在于其创新的隐式3D记忆机制和摄像机可控的自回归视频生成方法。通过将历史观察数据压缩为固定的标记,该模型在不依赖显式深度信息的情况下提高了长时间一致性和摄像机控制精度。实验结果显示,WorldCrafter在长时间一致性和视觉质量上均表现出色,尤其是在动态场景中。

尽管如此,WorldCrafter在极端动态场景中可能会出现一致性下降的问题,因为没有显式的深度信息。此外,对摄像机轨迹的依赖可能限制了某些自由度较高的应用场景。未来的研究方向包括提升模型在极端动态场景中的表现,以及减少对摄像机轨迹的依赖,以拓展应用场景。

深度分析

研究背景

视频世界模型的研究已经取得了显著进展,尤其是在动态环境中的交互式探索方面。传统方法通常依赖于显式的几何信息来保持一致性,但在长时间和跨视点的场景中,仍然面临挑战。近年来,隐式记忆模型的引入为解决这一问题提供了新的思路。

核心问题

视频世界模型在长时间和跨视点保持一致性方面面临挑战。传统方法依赖于显式的几何信息,难以在动态环境中保持一致性。这一问题的解决对于提升视频生成模型的实用性和精确性至关重要。

核心创新

WorldCrafter的核心创新在于其隐式3D记忆机制。通过将历史观察数据压缩为固定的标记,该模型在不依赖显式深度信息的情况下提高了长时间一致性和摄像机控制精度。这一创新突破了传统几何预测优先的限制,提供了更高的外观保真度和一致性。

方法详解

  • �� 使用记忆编码器将历史观察数据压缩为固定标记。
  • �� 姿态条件读取模块整合历史数据为目标视图特定标记。
  • �� 结合近期时间上下文和少步蒸馏,实现流式场景探索。

实验设计

实验设计包括在静态和动态场景中测试WorldCrafter的长时间一致性和摄像机控制精度。使用的基准数据集包括OpenSora-Plan和DL3DV,评估指标包括MEt3R、LPIPS、PSNR和SSIM。

结果分析

WorldCrafter在长时间一致性和摄像机控制精度上相较于最强基线提高了47.6%。实验显示在分钟级别的探索中,视觉质量得以保持,同时摄像机控制精度显著提高。

应用场景

WorldCrafter的应用场景包括虚拟现实中的场景探索、电影制作中的动态场景生成,以及游戏中的交互式环境创建。这些应用需要高精度的摄像机控制和长时间一致性。

局限与展望

尽管WorldCrafter在长时间一致性上表现出色,但在极端动态场景中可能会出现一致性下降的问题。此外,对摄像机轨迹的依赖可能限制了某些自由度较高的应用场景。

通俗解读 非专业人士也能看懂

想象你在一个虚拟世界中旅行,WorldCrafter就像是你的记忆助手。它会记住你之前看到的所有景象,并在你再次回到这些地方时,确保它们看起来和你第一次看到的一样。就像你在旅行中拍的照片,它们帮助你记住每个地方的样子,即使你在不同的时间或角度再次看到它们。WorldCrafter通过这种方式确保你在虚拟世界中的体验始终如一,无论你走到哪里。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级酷的游戏,里面有一个巨大的世界可以探索。WorldCrafter就像是游戏里的一个超级记忆芯片,它能记住你去过的每个地方的样子。这样,当你再次回到这些地方时,它们看起来就像你第一次看到的一样。是不是很神奇?这就像在游戏中拍照,然后每次回去都能看到同样的风景!

术语表

隐式记忆 (Implicit Memory)

一种将历史观察数据压缩为固定标记的机制,帮助模型在不依赖显式深度信息的情况下保持一致性。

在WorldCrafter中用于整合历史观察数据。

姿态条件读取 (Pose-conditioned Readout)

根据请求的视点整合历史数据为目标视图特定标记的模块。

在WorldCrafter中用于提高摄像机控制精度。

长时间一致性 (Long-horizon Consistency)

在长时间和跨视点场景中保持一致性的能力。

WorldCrafter的主要研究目标之一。

视频生成器 (Video Generator)

用于生成视频序列的模型组件,通常与记忆模型共同训练。

在WorldCrafter中用于生成流式场景。

少步蒸馏 (Few-step Distillation)

一种通过减少生成步骤来提高模型效率的方法。

在WorldCrafter中用于实现实时流式推理。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端动态场景中保持一致性?现有方法在没有显式深度信息的情况下难以解决这一问题。
  • 2 如何减少对摄像机轨迹的依赖?这可能限制了某些应用场景的自由度。

应用场景

近期应用

虚拟现实场景探索

WorldCrafter可以用于虚拟现实中的场景探索,提供高精度的摄像机控制和长时间一致性。

远期愿景

动态场景生成

在电影制作和游戏开发中,WorldCrafter可以帮助生成一致的动态场景,提升用户体验。

原文摘要

Video world models enable interactive exploration of dynamic environments, yet struggle to respect prior observations over long horizons and across viewpoints. We present WorldCrafter, a video world model that learns a camera-queryable implicit 3D-aware memory for this purpose. The key insight is to let the requested viewpoint shape how multi-view evidence is compressed into the video generator's limited token budget. Trained jointly with the video generator, a memory encoder and pose-conditioned readout module integrate historical observations into a fixed set of target view-specific tokens before denoising, without explicit depth-based correspondences. By combining this memory with recent temporal context and few-step distillation, WorldCrafter enables streaming scene exploration from a single input image or text prompt. Experiments across static and dynamic scenes show substantial gains in long-horizon consistency and camera-control accuracy while preserving visual quality during minute-scale exploration.

cs.CV cs.AI cs.GR