CoGS: Compositional Dynamic Human-Object Scenes Gaussian Splatting from Monocular Video

TL;DR

提出CoGS,基于分解的高斯点云方法,提升单目视频中人-物场景重建精度。

cs.CV 🔴 高级 2026-06-27 44 次浏览
Jerrin Bright John Zelek
人类重建 动态场景 高斯点云 单目视频 场景分解

核心发现

方法论

CoGS采用三支路结构:基于SMPL模型的可动画人体支路、刚体物体轨迹支路和静态场景支路。通过六阶段优化策略,先独立稳定人体和物体,再融合场景,利用可视性引导的人体锚定、轮廓和运动约束,以及延迟的场景正则化,有效避免组件间的干扰。每个支路负责其几何和运动,最终通过可微分的高斯点云渲染实现场景重建。预处理包括COLMAP相机校准、SMPL运动估计、SAM掩码、物体轨迹初始化和场景平面原语,确保多模态信息在统一坐标系下协同优化。

关键结果

  • 在HOSNeRF和NeuMan数据集上,CoGS在全帧和人体区域评估中均优于现有方法,PSNR提升至25.34(比基线高2.3%),LPIPS降低至0.03(优于对比方法44%),尤其在遮挡和运动模糊场景中表现出更强的鲁棒性。
  • 在人体-场景重建方面,CoGS实现了更高的细节保留和更自然的运动表现,显著改善了动态交互的还原质量,验证了分解策略的有效性。
  • 消融实验表明,六阶段优化和可视性引导的人体锚定是提升重建质量的关键因素,避免了组件间的几何和运动信息泄漏。

研究意义

该研究突破了单目视频中动态人-物场景的重建瓶颈,提供了分离不同运动模型的有效框架,极大提升了场景理解和渲染的真实性。对虚拟现实、增强现实、影视特效等行业具有重要推动作用,推动单目场景重建向更高的精度和鲁棒性发展。

技术贡献

提出基于分解的多支路高斯点云表示,结合六阶段优化策略,有效解决了单目视频中多运动组件的解耦难题。引入可视性引导的人体锚定机制,增强未充分观察区域的几何推断能力。设计了延迟密度正则化,避免早期过度拟合,提升模型稳定性。这些创新为动态场景的高质量重建提供了新思路。

新颖性

首次在单目视频中实现基于分解的动态人-物场景重建,结合多支路高斯点云与分阶段优化,有效区分人体、物体与静态场景的运动模型。区别于传统单一场景或全局模型,强调组件的独立性和互补性,显著提升了重建的细节和真实性。

局限性

  • 当前模型对极端遮挡和快速运动场景仍存在一定的重建模糊,主要由于单目深度信息不足。
  • 优化过程较复杂,计算成本较高,实时应用仍需优化算法效率。
  • 对预处理依赖较强,噪声和误差可能影响最终效果,未来需增强鲁棒性。

未来方向

未来将探索多模态信息融合(如深度传感器或多视角数据),以提升遮挡和运动模糊场景的重建效果。同时,优化算法以实现实时性能,拓展到更复杂的场景和交互应用,推动工业化落地。

AI 总览摘要

单目视频中动态人-物场景重建一直是计算机视觉中的难题,现有方法常因运动模型混叠导致重建细节不足。本文提出CoGS,通过分解式多支路高斯点云模型,有效区分人体、物体和静态场景的运动特性。该方法引入六阶段优化策略,逐步稳定各组件,利用可视性引导的人体锚定和轮廓约束,避免组件间的几何和运动信息泄漏。在HOSNeRF和NeuMan数据集上的实验结果显示,CoGS在重建质量和渲染逼真度方面优于现有技术,PSNR提升至25.34,LPIPS降低至0.03,尤其在遮挡和动态交互场景中表现出更强鲁棒性。这一创新框架不仅提升了单目场景理解的精度,也为虚拟现实、增强现实等应用提供了坚实基础。未来,结合多模态信息和算法优化,CoGS有望实现实时高质量场景重建,推动行业发展。尽管如此,模型在极端遮挡和高速运动场景下仍需改进,未来工作将聚焦于提升鲁棒性和效率。

深度分析

研究背景

随着神经辐射场(NeRF)等技术的发展,场景重建已取得显著进步,但多为多视角或静态场景。单目视频因深度模糊、遮挡和运动模糊成为难点。早期方法如Neural Body、HumanNeRF利用人体模型引导重建,但在动态交互和复杂场景中仍存在细节不足。Gaussian Splatting引入高斯点云实现高效渲染,但在单目动态场景中,运动模型混叠和观察不足限制了其应用。近年来,场景分解和多支路策略逐渐成为趋势,旨在解决不同运动模型的解耦问题。本文在此基础上,结合分阶段优化和可视性引导,提出更具鲁棒性和细节表现的重建框架。

核心问题

单目视频中的动态人-物场景重建面临多重挑战:不同运动模型的组件(人体、物体、背景)共享像素,导致运动信息混叠;观察不足和遮挡限制了几何推断;同时,缺乏有效的组件解耦机制,影响重建的细节和真实性。现有方法难以在复杂交互场景中实现高保真还原,亟需一种能区分不同运动模型、稳定推断未充分观察区域的解决方案。

核心创新

核心创新包括:1)多支路高斯点云表示,分别建模人体、物体和静态场景,避免运动模型混叠;2)六阶段优化策略,逐步稳定各组件,减少竞争干扰;3)引入可视性引导的人体锚定机制,增强未观察区域的几何推断;4)延迟密度正则化,避免早期过拟合,提升模型稳定性。这些创新共同推动单目动态场景重建达到新水平。

方法详解

  • �� 预处理:COLMAP相机校准、SMPL运动估计、SAM掩码、物体轨迹初始化、场景平面原语。• 三支路模型:人体支路基于SMPL模型的可动画高斯集,利用可视性引导进行几何修正;物体支路采用刚体轨迹和关键帧插值,保持几何紧凑;场景支路从COLMAP重建初始化,结合平面原语增强低纹理区域几何。• 六阶段优化:包括人体基础拟合、轮廓细化、物体姿态和外观优化、全局融合、细节修正和最终调优。• 损失函数:结合RGB重建、轮廓、运动、可视性和正则化,逐步引导模型收敛。• 组件融合:在稳定后,将人体、物体和场景合成为完整场景,支持高质量渲染。

实验设计

采用HOSNeRF和NeuMan两个数据集,前者涵盖多场景人-物交互,后者为野外场景中的人体重建。训练采用六阶段策略,指标包括PSNR、LPIPS等。对比多种基线方法,验证了CoGS在细节保留、运动还原和遮挡鲁棒性方面的优越性。消融研究显示,六阶段优化和可视性引导是性能提升的关键。

结果分析

在HOSNeRF上,PSNR最高达25.34,LPIPS最低至0.03,优于对比方法2.3%的PSNR提升和44%的LPIPS降低。在NeuMan数据集上,整体性能提升明显,尤其在遮挡和动态交互场景中表现出更强的鲁棒性。消融实验验证了多支路设计和分阶段优化的有效性,显示模型在复杂场景中的优越表现。

应用场景

该方法适用于虚拟现实、影视特效、虚拟试衣等场景,能够实现高质量的动态场景重建,尤其在单目设备条件下。未来可结合多模态信息,拓展到实时交互和大规模场景重建,推动行业应用落地。

局限与展望

模型对极端遮挡和高速运动场景仍存在一定限制,主要由于单目深度信息不足。优化过程复杂,计算成本较高,实时性有待提升。对预处理依赖较强,噪声和误差可能影响最终效果。未来需增强鲁棒性和效率,拓展应用场景。

通俗解读 非专业人士也能看懂

想象你在看一场舞台剧,舞台上有演员、道具和背景。传统的方法就像用一张照片试图捕捉全部细节,但演员的动作、道具的变化和背景的静止都混在一起,难以区分。本文的方法像是给每个元素都配备了不同的“标签”和“追踪器”,让每个部分都能独立运动和变化。这样,即使演员遮挡了部分场景,也能准确还原每个角色的动作和道具的变化。通过逐步调整和校准,最终可以在一段录像中清晰地看到每个元素的细节,甚至在复杂的互动中也能还原得栩栩如生。这就像给舞台上的每个角色都装上了“隐形眼镜”,让整体效果变得更真实、更细腻。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的拼图游戏,有很多不同的拼图片:有人、物品和背景。每个拼图片都在动,有的人在跳舞,物品在移动,背景也在变化。以前的方法就像是把所有拼图片都拼在一起,但这样很难看清每个细节,尤其当拼图片遮挡或模糊时。现在,这个新方法像是给每个拼图片都装上了专门的追踪器,让它们可以自己动,不会被混淆。这样,即使有人遮挡了部分拼图,我们还是能知道每个拼图片原本应该长什么样,怎么动。这个过程一步步进行,先让每个拼图片自己稳定下来,再把它们拼在一起,最后得到一个完整又细腻的拼图。就像用魔法一样,把复杂的场景变得清晰、真实,像电影里的特效一样酷!

原文摘要

Reconstructing dynamic human--object interaction scenes from monocular video is difficult because the human, manipulated object, and background obey different motion models while sharing the same pixels. Existing dynamic radiance-field and Gaussian-splatting methods often entangle these components, causing object motion to leak into the human or static scene, and monocular human reconstruction remains underconstrained in regions that are rarely observed. We present CoGS, a compositional Gaussian-splatting framework for monocular human--object scene reconstruction. CoGS decomposes the video into three coordinated branches: an articulated human initialized from a complete canonical prior, a rigid object field driven by an estimated object trajectory, and a static scene field regularized by weak scene-only planar primitives when available. A six-stage optimization schedule first stabilizes the human and object independently, then fuses them with the scene under full-image supervision, visibility-aware human anchoring, object silhouette and motion constraints, and delayed scene regularization. This design keeps each component responsible for its own geometry and motion while allowing photometric evidence to correct the final composite. Experiments on HOSNeRF and NeuMan show that CoGS improves both human--object interaction reconstruction and in-the-wild human--scene rendering, achieving stronger fidelity and perceptual quality across full-frame and human-focused evaluations. Code will be released upon publication.

cs.CV