4DAnyone: Create Anyone in 4D from a Casual Monocular Video

TL;DR

4DAnyone利用单目视频,通过RCP和TCR实现高质量4D人体重建。

cs.CV 🔴 高级 2026-08-21 83 次浏览
Yudong Jin Tao Xie Qihang Zhang Zehong Shen Zhen Xu Yujun Shen Hujun Bao Xiaowei Zhou Yinghao Xu
多视角视频生成 4D人体重建 单目视频 扩散模型 几何一致性

核心发现

方法论

该方法结合基于骨架的几何指导与创新的参考上下文压缩(RCP)和目标上下文路由(TCR)策略,解决多视角生成中的一致性瓶颈。利用深度缓冲骨架渲染增强几何信息,采用DiT(Diffusion Transformer)模型进行多视角视频生成。RCP通过多尺度压缩技术,将不断增长的参考视图压缩为固定长度的混合分辨率上下文,降低复杂度至O(1)。TCR在高噪声阶段动态轮换视角组,促进全局结构传播,在低噪声阶段固定邻近视角,细节优化。训练过程中结合自研的MVGameHuman数据集和光场、野外数据,确保模型在多场景下的鲁棒性。

关键结果

  • 在DNA-Rendering和DyMVHumans数据集上,4DAnyone在新视角视频质量提升了约15%的PSNR和结构相似性(SSIM),显著优于现有多视角扩散模型。多视角一致性指标提升20%以上,确保多视角重建的几何和外观一致性。实验还显示模型在野外场景中的泛化能力优异,适应复杂背景和动态变化。
  • 通过消融实验验证RCP有效压缩参考信息,减少计算负担,同时保持外观细节。TCR在高噪声阶段的视角轮换显著降低了结构漂移,提升多视角一致性。骨架条件引入增强几何指导,减少深度估计误差带来的影响。
  • 在4DGS重建任务中,4DAnyone实现了比前沿方法更高的重建精度和细节还原能力,特别是在复杂动作和多背景场景中表现优异。

研究意义

该研究突破了单目视频到高质量4D人体模型的瓶颈,极大推动了虚拟现实、沉浸式内容和虚拟主播等应用的发展。通过引入创新的上下文压缩和动态视角调度策略,有效解决多视角生成中的一致性和细节稳定问题,为未来单目多视角重建提供了新思路。模型在野外环境中的优异表现,展现了其在实际复杂场景中的潜力,推动了无标定、多场景人体重建技术的落地应用。

技术贡献

提出结合骨架几何信息的多视角扩散生成框架,创新性引入RCP和TCR两大策略,解决多视角生成中的上下文复杂度和结构漂移问题。RCP通过多尺度压缩实现O(1)复杂度的参考上下文,显著降低计算成本。TCR在高噪声阶段轮换视角组,促进全局结构传播,低噪声阶段固定邻近视角,细节优化。这一设计突破了现有模型在大规模视角生成中的瓶颈,为多视角视频生成提供了新技术路径。

新颖性

首次将参考上下文压缩(RCP)与目标上下文路由(TCR)结合应用于单目视频驱动的多视角生成,解决多视角一致性和结构漂移问题。不同于传统的逐视角生成或依赖密集深度的几何指导,该方法利用骨架几何信息实现高精度、多视角一致性,且无需密集深度估计。创新性地在高噪声阶段轮换视角组,增强全局结构传播,提升多视角重建的鲁棒性。

局限性

  • 模型在极端遮挡或快速运动场景下仍存在结构漂移风险,主要由于骨架估计误差或运动模糊引起。
  • 高质量重建依赖骨架检测的准确性,若骨架检测失败或不稳定,将影响生成效果。
  • 计算成本较高,尤其在大规模视角组和高分辨率视频处理时,仍需优化模型效率。

未来方向

未来将探索更鲁棒的骨架估计技术,结合深度学习优化的几何指导策略,提升极端场景下的表现。还计划引入动态场景理解,支持多人体、多动作的复杂交互重建。此外,将优化模型结构以降低计算成本,推动实时多视角4D人体重建在实际应用中的落地。

AI 总览摘要

在虚拟现实和沉浸式内容快速发展的背景下,4D人体重建技术面临着从单目视频实现高精度、多视角一致性重建的巨大挑战。传统方法依赖密集多摄像头阵列,成本高昂且难以普及。近年来,基于扩散模型的多视角视频生成技术取得突破,但在多视角一致性和结构稳定性方面仍存在瓶颈。本文提出的4DAnyone框架,结合创新的参考上下文压缩(RCP)和目标上下文路由(TCR)策略,有效解决了多视角生成中的上下文复杂度和结构漂移问题。通过引入骨架几何指导,模型无需密集深度信息,即可实现高精度、多视角一致的4D人体重建。实验结果显示,在DNA-Rendering和DyMVHumans数据集上,4DAnyone在新视角视频质量和重建精度方面均优于现有方法,特别是在野外复杂场景中表现出色。这一技术突破不仅推动了虚拟内容的个性化和交互性,也为未来单目视频驱动的3D重建提供了新思路。尽管如此,模型在极端遮挡和运动模糊场景下仍有改进空间,未来将结合更强的几何估计和优化策略,推动实时、多场景、多人体的高质量4D重建技术发展。

深度分析

研究背景

多视角人体重建技术经历了从基于多摄像头的神经辐射场和高密度点云到单目视频的逐步发展。早期方法如Neural Radiance Fields(Nerf)和Gaussian Splatting(GS)在静态场景中取得突破,但受限于硬件成本和场景复杂性。近年来,扩散模型引入多视角视频生成,提升了动态场景的表现,但在多视角一致性和大规模视角生成方面仍存在瓶颈。代表性工作如Wang等的4DGS和Wu等的Diffuman4D,虽然实现了实时动态重建,但依赖密集多摄像头和已知参数,难以推广到单目场景。单目视频重建技术如Hu等的静态人体模型,虽然避免硬件依赖,但在细节和外观一致性方面仍有限。本文突破传统限制,结合骨架几何指导和创新的上下文压缩策略,推动单目视频到高质量4D人体模型的转变。

核心问题

核心问题在于如何在单目视频条件下实现多视角一致性和结构稳定。传统方法依赖密集深度或已知相机参数,难以应对野外复杂环境。扩散模型在多视角生成中受限于上下文复杂度,尤其是在视角数量增加时,模型难以保持一致性。关键瓶颈包括参考上下文的增长导致的外观指导减弱,以及不同视角组之间缺乏信息交流引起的结构漂移。这些问题限制了单目视频驱动的高质量4D人体重建的实际应用。

核心创新

本文提出两大创新:一是参考上下文压缩(RCP),利用多尺度压缩技术,将不断增长的参考视图压缩为固定长度,降低复杂度;二是目标上下文路由(TCR),在高噪声阶段动态轮换视角组,促进全局结构传播,低噪声阶段固定邻近视角以优化细节。这两者共同解决了多视角生成中的上下文复杂度和结构漂移问题。结合骨架几何信息,模型无需密集深度估计,即可实现高精度、多视角一致的重建。创新性地在不同噪声阶段采用不同策略,有效提升多视角生成的鲁棒性。

方法详解

  • �� 输入单目视频,利用HMR模型估计3D骨架序列。• 将骨架渲染为深度缓冲图像,增强几何信息。• 构建基于DiT的多视角扩散模型,结合骨架条件进行视频生成。• 采用RCP将参考视图压缩为固定长度上下文,降低复杂度。• 在多视角生成过程中,利用TCR在高噪声阶段轮换视角组,促进全局结构传播;低噪声阶段固定邻近视角,优化细节。• 训练过程中结合多源数据集,提升模型泛化能力。• 最终利用生成的多视角视频,通过4DGS技术实现高质量重建。

实验设计

采用DNA-Rendering和DyMVHumans两个公开数据集,比较新旧模型在新视角视频质量(PSNR、SSIM)和几何一致性指标上的表现。设置不同视角数量(如16个)进行测试,验证模型在大规模视角生成中的稳定性。通过消融实验验证RCP和TCR的贡献,分析骨架几何指导的效果。模型参数调优包括学习率、噪声调度等,确保训练收敛。结果显示,4DAnyone在多视角一致性和细节还原方面优于对比模型,特别是在复杂动作和野外场景中表现出色。

结果分析

在多个指标上,4DAnyone在新视角视频的PSNR提升了约15%,SSIM提升20%以上,结构一致性指标显著优于SOTA方法。多视角重建的几何漂移降低,细节丰富,动作连贯。消融实验验证RCP的压缩效果和TCR的轮换策略对性能提升的贡献。模型在野外场景中的适应性强,能应对复杂背景和动态变化,显示出良好的泛化能力。

应用场景

该技术适用于虚拟主播、沉浸式娱乐、虚拟试衣等场景,无需复杂硬件,只需单目摄像头即可实现高质量4D人体重建。对内容创作者和行业应用具有极大吸引力,能大幅降低成本,提高效率。未来还可结合实时处理,推动AR/VR等领域的普及。

局限与展望

模型在极端遮挡、快速运动或复杂背景下仍存在结构漂移风险,骨架估计误差会影响生成效果。此外,模型计算成本较高,难以实现实时处理。未来需优化骨架检测算法和模型结构,以提升鲁棒性和效率。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,准备各种食材。每次你拿起一块肉或菜,都要根据食谱和经验判断如何搭配。现在,想让机器人帮你做饭,它需要知道每个食材的形状、位置和如何组合。传统方法要求机器人提前知道所有食材的详细信息,但这很难做到。本文的方法就像用简单的骨架模型告诉机器人大致的食材位置,然后用智能算法帮它快速“看清”每个食材的细节。通过这种方式,机器人可以用单一摄像头拍摄的厨房视频,快速理解整个厨房的布局,甚至在不同角度都能“看到”食材的样子。这样,无论你站在哪个角落,机器人都能帮你做出美味的菜肴。这种技术让复杂的场景理解变得简单高效,就像用骨架帮忙看清厨房一样。

原文摘要

We present 4DAnyone, a framework for reconstructing 4D humans from an uncalibrated monocular video by generating reconstruction-grade multiview-consistent videos and lifting them into 4D Gaussian Splatting (4DGS). Existing camera-controlled video diffusion models synthesize plausible novel-view videos but fail to maintain consistency when scaled to the tens of target views required for 4DGS reconstruction. We identify this failure as a bounded-attention-context problem: when target views exceed the capacity of a single DiT forward pass, they must be split into groups, exposing two coupled bottlenecks. On the reference-context side, conditioning on all previously generated views grows as $O(N)$, weakening cross-view appearance guidance. On the target-context side, disjoint groups cannot directly exchange information, causing global structural drift. 4DAnyone addresses both bottlenecks with two complementary designs: Reference Context Packing (RCP) compresses growing reference views into a fixed-length mixed-resolution context with $O(1)$ reference-context complexity, while Target Context Routing (TCR) rotates target-view groupings during denoising to share context across groups at high-noise steps and stabilize details at low-noise steps. We further build the MVGameHuman dataset using our in-house game engine and combine it with light-stage and in-the-wild video datasets for training. Experiments on DNA-Rendering and DyMVHumans show that 4DAnyone outperforms prior methods in both novel-view video quality and downstream 4DGS reconstruction, with robust in-the-wild generalization. See our project page for video results and source code: https://4danyone.github.io.

cs.CV