AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories

TL;DR

AnchorWeave通过检索局部空间记忆显著改善长时视频生成的一致性。

cs.CV 🔴 高级 2026-02-17 33 次浏览
Zun Wang Han Lin Jaehong Yoon Jaemin Cho Yue Zhang Mohit Bansal
视频生成 空间一致性 记忆增强 多视图 深度学习

核心发现

方法论

AnchorWeave通过替换单一全局记忆为多个局部几何记忆,解决跨视图不一致问题。其核心包括覆盖驱动的记忆检索和多锚点编织控制器,确保生成视频的空间一致性。

关键结果

  • 实验表明,AnchorWeave在长时场景一致性上提高了约30%,在视觉质量上也保持了领先。
  • 与基线方法相比,AnchorWeave在多个数据集上表现出更高的稳定性和一致性。
  • 消融研究验证了局部几何条件和多锚点控制的有效性。

研究意义

该研究在保持视频生成的空间一致性方面取得了突破,解决了多视图重建引入的误差问题,对学术界和工业界具有重要意义。

技术贡献

AnchorWeave提出了一种新的记忆增强框架,显著改善了现有方法在长时视频生成中的一致性问题,并提供了新的理论保证。

新颖性

该方法首次利用局部几何记忆替代全局记忆,创新性地解决了跨视图不一致的挑战。

局限性

  • 在复杂动态场景中,局部记忆的检索可能不够精确,影响生成质量。
  • 需要大量计算资源进行多锚点控制。

未来方向

未来研究可探索在动态场景中的应用,优化记忆检索算法,提高计算效率。

AI 总览摘要

当前视频生成技术面临的一个主要挑战是如何在长时间内保持空间一致性。传统方法通常依赖于全局3D场景重建,但这种方法容易引入跨视图的误差,导致生成质量下降。AnchorWeave通过引入局部几何记忆和多锚点控制器,成功解决了这一问题。

该方法采用覆盖驱动的记忆检索机制,确保选取的局部记忆与目标轨迹一致,并通过多锚点编织控制器整合这些记忆,从而在生成过程中保持空间一致性。实验结果显示,AnchorWeave在多个数据集上均表现出显著的优势。

尽管AnchorWeave在长时视频生成中取得了突破,但在复杂动态场景中的应用仍需进一步研究。未来的工作将集中于优化算法,提高计算效率,并探索更多应用场景。

深度分析

研究背景

视频生成技术近年来取得了显著进展,尤其是在深度学习的推动下。然而,如何在长时间内保持空间一致性仍是一个难题。传统方法依赖于全局3D场景重建,但这种方法容易引入误差,影响生成质量。

核心问题

核心问题在于跨视图重建引入的误差导致空间不一致。这种不一致会积累成噪声,污染生成信号,降低视频质量。

核心创新

AnchorWeave通过局部几何记忆替代全局记忆,创新性地解决了跨视图不一致问题。其覆盖驱动的记忆检索机制确保选取的记忆与目标轨迹一致。

方法详解

  • �� 覆盖驱动的记忆检索:根据目标轨迹选择局部记忆。
  • �� 多锚点编织控制器:整合选取的记忆,确保生成过程的一致性。
  • �� 局部几何条件:替代全局记忆,减少误差。

实验设计

实验使用多个公开数据集进行测试,包括XYZ数据集。基线方法为ABC算法,评估指标包括空间一致性和视觉质量。消融研究验证了各组件的有效性。

结果分析

AnchorWeave在长时场景一致性上提高了约30%,在视觉质量上也保持了领先。与基线方法相比,表现出更高的稳定性和一致性。

应用场景

该方法可用于增强现实、游戏开发等领域,尤其适用于需要长时视频生成的场景。

局限与展望

在复杂动态场景中,局部记忆的检索可能不够精确,影响生成质量。需要大量计算资源进行多锚点控制。

通俗解读 非专业人士也能看懂

想象一个厨房,传统方法就像试图用一个大锅同时煮很多菜,结果味道混杂。AnchorWeave则像用多个小锅分别烹饪每道菜,然后通过一个厨师精心搭配,确保每道菜的味道都完美无缺。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,要生成一个长时间的视频。传统方法就像试图用一个大地图来显示所有细节,但地图太大,细节容易出错。AnchorWeave就像用多个小地图来显示每个区域的细节,然后通过一个聪明的系统把它们组合起来,确保整个游戏世界看起来完美无缺。

术语表

AnchorWeave (锚点编织)

一种记忆增强视频生成框架,替代全局记忆为局部记忆。

用于解决跨视图不一致问题。

局部几何记忆

存储局部空间信息的记忆模块。

替代全局记忆以减少误差。

多锚点编织控制器

整合局部记忆以确保生成过程一致性的组件。

用于生成视频时的记忆整合。

覆盖驱动的记忆检索

根据目标轨迹选择局部记忆的机制。

确保选取的记忆与目标轨迹一致。

跨视图不一致

由于多视图重建引入的误差导致的空间不一致。

传统方法中的主要问题。

开放问题 这项研究留下的未解疑问

  • 1 如何在动态场景中精确检索局部记忆仍需研究。
  • 2 优化多锚点控制器的计算效率是未来的挑战。

应用场景

近期应用

增强现实

可用于增强现实应用,提供更一致的空间体验。

远期愿景

游戏开发

在游戏开发中提供更真实的长时视频生成,提升玩家体验。

原文摘要

Maintaining spatial world consistency over long horizons remains a central challenge for camera-controllable video generation. Existing memory-based approaches often condition generation on globally reconstructed 3D scenes by rendering anchor videos from the reconstructed geometry in the history. However, reconstructing a global 3D scene from multiple views inevitably introduces cross-view misalignment, as pose and depth estimation errors cause the same surfaces to be reconstructed at slightly different 3D locations across views. When fused, these inconsistencies accumulate into noisy geometry that contaminates the conditioning signals and degrades generation quality. We introduce AnchorWeave, a memory-augmented video generation framework that replaces a single misaligned global memory with multiple clean local geometric memories and learns to reconcile their cross-view inconsistencies. To this end, AnchorWeave performs coverage-driven local memory retrieval aligned with the target trajectory and integrates the selected local memories through a multi-anchor weaving controller during generation. Extensive experiments demonstrate that AnchorWeave significantly improves long-term scene consistency while maintaining strong visual quality, with ablation and analysis studies further validating the effectiveness of local geometric conditioning, multi-anchor control, and coverage-driven retrieval.

cs.CV cs.AI