Deformable Gaussian Occupancy: Decoupling Rigid and Nonrigid Motion with Factorized Distillation

TL;DR

DeGO框架通过解耦刚性和非刚性运动,实现13.5%的人体实例提升。

cs.CV 🔴 高级 2026-05-27 41 次浏览
Yang Gao Wuyang Li Po-Chien Luan Alexandre Alahi
3D场景理解 弱监督学习 高斯变形 时空一致性 自动驾驶

核心发现

方法论

DeGO框架结合解耦高斯变形和因子化4D蒸馏,分别处理刚性和非刚性运动。通过从VGGT基础模型中提取跨摄像头和跨帧知识,增强时空一致性。高斯原语通过变形和偏移更新,适应动态场景。

关键结果

  • 在Occ3D-NuScenes基准上,DeGO在弱监督下实现了13.5%的人体实例提升和10.9%的整体改进,显示了其在动态场景理解中的有效性。
  • 与现有方法相比,DeGO在人体相关mIoU上提升了13.5%,在整体mIoU上提升了10.9%。
  • 通过消融实验验证,DeGO的解耦变形模块显著提高了动态几何建模能力。

研究意义

DeGO框架在自动驾驶领域具有重要意义,尤其是在处理人类相关的非刚性运动时。它解决了现有方法在捕捉细粒度变形和保持时空一致性方面的不足,提供了一种高效的动态场景建模方法。

技术贡献

DeGO通过引入解耦高斯变形和因子化特征蒸馏,显著提升了动态场景的建模能力。与现有方法相比,DeGO能够更好地处理非刚性运动,并在弱监督条件下实现了更高的性能。

新颖性

DeGO首次将解耦高斯变形与因子化4D蒸馏结合,提供了一种新的动态场景建模方法。与传统的刚性运动假设不同,DeGO能够捕捉复杂的非刚性变形。

局限性

  • DeGO在处理极端复杂的动态场景时可能会遇到性能瓶颈,特别是在非刚性运动非常剧烈的情况下。
  • 在计算资源有限的环境中,DeGO的实时性可能受到限制。

未来方向

未来工作可以探索DeGO在其他动态场景中的应用,如机器人导航和虚拟现实。此外,可以进一步优化其计算效率,以提高实时性能。

AI 总览摘要

理解动态3D环境对于自动驾驶的安全至关重要,特别是在处理以人为中心的非刚性代理时。现有的弱监督占用预测框架主要假设刚体运动,依赖简单的帧间偏移,限制了其捕捉细粒度变形和保持时空一致性的能力。为了解决这个问题,我们提出了DeGO,一个可变形的高斯占用框架,将解耦的高斯变形与因子化的4D基础模型蒸馏结合在一起。DeGO解开了刚性和非刚性运动,使每个高斯原语能够通过变形和基于偏移的更新进行演化。同时,因子化的4D蒸馏策略从VGGT基础模型中转移跨摄像头和跨帧的知识,产生基础对齐的特征,增强了时空一致性。在Occ3D-NuScenes基准上的实验表明,我们的方法在弱监督下实现了最先进的性能,在以人为中心的实例上提升了13.5%,整体改进了10.9%。这些结果突出了变形感知和基础引导的占用建模在动态场景理解中的有效性。代码已公开:https://github.com/vita-epfl/DeGO。

深度分析

研究背景

随着自动驾驶技术的发展,动态3D场景的理解变得越来越重要。传统方法通常假设刚体运动,这限制了它们在处理复杂动态场景时的能力。近年来,弱监督学习方法逐渐兴起,试图减少对昂贵的手动体素标签的依赖。

核心问题

现有的占用预测方法在处理非刚性运动时存在显著不足,尤其是在捕捉细粒度变形和保持时空一致性方面。这对自动驾驶中的人类相关实例的准确建模提出了挑战。

核心创新

DeGO框架通过结合解耦高斯变形和因子化4D蒸馏,提供了一种新的动态场景建模方法。其创新之处在于能够分别处理刚性和非刚性运动,并通过从基础模型中提取知识增强时空一致性。

方法详解

  • �� DeGO框架结合解耦高斯变形和因子化4D蒸馏。
  • �� 解耦高斯变形模块分别处理刚性和非刚性运动。
  • �� 因子化4D蒸馏模块从VGGT基础模型中提取跨摄像头和跨帧知识。
  • �� 高斯原语通过变形和偏移更新,适应动态场景。

实验设计

在Occ3D-NuScenes基准上进行实验,使用40k帧数据,每帧包含六个摄像头视图。实验采用标准的IoU和mIoU指标进行评估,并引入人体相关mIoU以评估对非刚性类的建模能力。

结果分析

实验结果显示,DeGO在弱监督条件下实现了最先进的性能。在人体相关mIoU上提升了13.5%,整体mIoU上提升了10.9%。消融实验验证了解耦变形模块在动态几何建模中的有效性。

应用场景

DeGO框架可用于自动驾驶中的动态场景理解,尤其是在处理人类相关的非刚性运动时。其高效的动态建模能力也可应用于机器人导航和虚拟现实。

局限与展望

DeGO在处理极端复杂的动态场景时可能会遇到性能瓶颈。此外,在计算资源有限的环境中,其实时性可能受到限制。未来可通过优化计算效率来提高其实时性能。

通俗解读 非专业人士也能看懂

想象一下,你在一个充满各种移动物体的房间里,比如人、汽车和自行车。传统的方法就像用一张固定的照片来描述这个房间,无法捕捉到物体的运动。而DeGO就像是一部实时录像机,不仅能看到物体的位置,还能看到它们的运动轨迹。通过这种方式,DeGO能够更好地理解房间内的动态变化,尤其是那些复杂的非刚性运动,比如人走路时的身体变化。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下,你在玩一个超级酷的游戏,这个游戏里有很多移动的角色,比如人、车和自行车。传统的方法就像是给这些角色拍了一张静态照片,只能看到它们的样子,但看不到它们的动作。而DeGO就像是一台超级摄像机,不仅能看到角色的样子,还能看到它们的动作,就像在看一部动画片!这样一来,DeGO就能更好地理解游戏中的动态变化,尤其是那些复杂的动作,比如人走路时的身体变化。是不是很酷?

术语表

Deformable Gaussian Occupancy (可变形高斯占用)

一种结合解耦高斯变形和因子化4D蒸馏的框架,用于动态场景建模。

用于处理刚性和非刚性运动。

Factorized Distillation (因子化蒸馏)

从基础模型中提取跨摄像头和跨帧知识,以增强时空一致性。

用于提升动态场景理解的时空一致性。

Rigid and Nonrigid Motion (刚性和非刚性运动)

刚性运动指物体的整体移动,而非刚性运动涉及形状的变化。

DeGO框架通过解耦这两种运动来提高建模能力。

VGGT Foundation Model (VGGT基础模型)

用于提供跨摄像头和跨帧知识的基础模型。

为DeGO框架提供时空一致性指导。

Weak Supervision (弱监督)

一种减少对昂贵手动标签依赖的学习方法,通常使用伪标签。

用于在Occ3D-NuScenes基准上进行实验。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂的动态场景中提高DeGO的性能?
  • 2 如何优化DeGO的计算效率以提高实时性?

应用场景

近期应用

自动驾驶

DeGO可用于自动驾驶中的动态场景理解,尤其是在处理人类相关的非刚性运动时。

远期愿景

机器人导航

DeGO的高效动态建模能力可用于机器人导航中的动态场景理解。

原文摘要

Understanding dynamic 3D environments is essential for safe autonomous driving, particularly when reasoning about human-centric, nonrigid agents. However, existing weakly supervised occupancy prediction frameworks predominantly assume rigid-body motion and rely on simple frame-to-frame offsets, limiting their ability to capture fine-grained deformations and maintain temporal coherence. To address this issue, we propose DeGO, a deformable Gaussian occupancy framework that unifies decoupled Gaussian deformation with factorized 4D foundation-model distillation. DeGO disentangles rigid and nonrigid motion, enabling each Gaussian primitive to evolve through both deformation and offset-based updates. In parallel, a factorized 4D distillation strategy transfers cross-camera and cross-frame knowledge from the VGGT foundation model, producing foundation-aligned features that enhance temporal consistency. Experiments on the Occ3D-NuScenes benchmark demonstrate that our method achieves state-of-the-art performance under weak supervision, delivering 13.5% gains on human-centric instances and 10.9% overall improvements. These results highlight the effectiveness of deformation-aware and foundation-guided occupancy modeling for dynamic scene understanding. The code is publicly available: https://github.com/vita-epfl/DeGO

cs.CV