VGGT-World: Transforming VGGT into an Autoregressive Geometry World Model

TL;DR

VGGT-World通过预测冻结GFM特征的时序演变,显著提升深度预测性能,参数仅0.43B,速度提升3.6-5倍。

cs.CV 🔴 高级 2026-03-13 29 次浏览
Xiangyu Sun Shijie Wang Fengyi Zhang Lin Liu Caiyan Jia Ziying Song Zi Huang Yadan Luo
3D几何建模 深度预测 变换器 自回归模型 高维特征

核心发现

方法论

本文提出VGGT-World,利用预训练的VGGT模型提取高维几何特征,避免视频生成的复杂性。通过构建轻量级的时序流变换器,采用z预测参数化解决高维空间中的收敛问题,并引入两阶段的流引导课程缓解自回归中的暴露偏差。模型在KITTI、Cityscapes和TartanAir数据集上实现深度和点云预测,显著优于现有基线,参数仅0.43B,运行速度提升3.6-5倍。

关键结果

  • 在KITTI数据集上,VGGT-World在深度预测中平均AbsRel降低21%,δ1指标提升至94.0%,远超Cosmos和Aether等模型,且训练参数少于0.5B,推理速度快3.6-5倍。
  • 在Cityscapes上,深度预测精度同样优越,AbsRel指标降低至0.078,表现优于基线模型,验证其在城市环境中的泛化能力。
  • 消融实验显示,z预测参数化和两阶段流引导课程是模型稳定性和性能提升的关键,特别在高维特征空间中有效缓解了噪声干扰。

研究意义

该研究突破了传统视频生成模型在几何一致性方面的局限,提出基于冻结GFM特征的时序预测框架,为动态场景的3D几何预测提供高效、可靠的解决方案。其参数少、速度快、精度高,为自主导航、机器人感知等应用提供了强有力的技术支撑,推动了几何世界建模的研究新方向。

技术贡献

本文创新性地将预训练几何基础模型的特征作为预测状态,避免复杂的视频生成过程,提出高维空间中的z预测参数化和两阶段流引导课程,显著提升模型稳定性和性能。采用chunk-wise自回归预测,结合连续流匹配,解决了高维特征空间中的收敛和偏差问题,提供了理论保证和工程实现的双重突破。

新颖性

首次将冻结的VGGT几何特征作为连续预测的状态空间,避免了视频生成中几何不一致的问题。提出高维空间中z预测的参数化策略及两阶段流引导课程,创新性地解决了自回归模型在高维特征空间中的收敛和偏差问题,开辟了几何世界建模的新路径。

局限性

  • 模型依赖预训练的VGGT特征,若基础模型性能不足或场景变化较大,预测效果可能受限。
  • 高维特征空间中的噪声敏感性仍存在,尤其在极端复杂场景中可能出现偏差积累。
  • 训练过程中对流引导课程的参数调节较为敏感,需精细调优以确保稳定性。

未来方向

未来将探索多模态融合,结合语义和物理信息增强几何预测的鲁棒性,优化流引导策略以适应更复杂动态场景,推动模型在实际自主系统中的应用落地。

AI 总览摘要

在动态场景中,准确预测三维几何结构一直是计算机视觉的核心难题。传统方法多依赖视频生成模型,试图通过生成未来视频帧实现场景预测,但这些方法在几何一致性方面表现不足,容易出现结构破碎和误定位的问题。本文提出VGGT-World,一种基于预训练几何基础模型(VGGT)冻结特征的时序预测框架。该模型摒弃视频生成的繁琐,直接预测几何特征的时间演变,利用轻量级的变换器在高维空间中实现自回归预测。通过引入z预测参数化和两阶段的流引导课程,有效缓解高维空间中的收敛难题和偏差累积。实验证明,VGGT-World在KITTI、Cityscapes和TartanAir数据集上均优于现有最先进模型,在深度预测任务中平均AbsRel降低21%,速度提升3.6-5倍,参数仅0.43B。这一突破性方法不仅提升了几何预测的准确性,也极大地提高了计算效率,为自主导航、机器人感知等应用提供了强有力的技术支撑。未来,结合多模态信息和更复杂场景的适应能力,将进一步推动几何世界建模技术的广泛应用。

深度分析

研究背景

近年来,3D几何基础模型(GFM)如VGGT在场景理解中展现出强大能力,能从单目RGB恢复场景结构,包括深度、点云和相机姿态。然而,这些模型主要关注静态观察,缺乏对场景随时间演变的预测能力。视频生成模型(如Cosmos、Wan)通过像素或潜在空间预测未来帧,虽具视觉逼真,但在几何一致性方面表现不足,容易出现结构破碎和误差积累。近年来,基于几何先验的生成方法逐渐兴起,试图结合多视角几何信息提升预测效果,但仍面临计算成本高、模型复杂等挑战。与此同时,潜在空间预测模型(如DINO-Foresight)在语义层面表现出色,但对几何结构的建模不足。本文的创新点在于利用预训练的VGGT特征作为预测状态,避免视频生成的复杂性,开启了几何空间中的连续预测新路径。

核心问题

核心问题在于如何在高维几何特征空间中实现稳定、准确的时序预测。传统的速度预测流匹配在高维空间中容易崩溃,模型难以收敛,且自回归预测会因偏差积累导致轨迹偏离真实场景。现有方法多依赖潜在空间的压缩或降维,损失了几何信息的完整性,难以满足动态场景的预测需求。这些问题限制了几何预测模型在实际应用中的效果和鲁棒性,亟需一种高效、稳定的预测策略。

核心创新

本文的创新主要体现在两个方面:第一,提出在高维几何特征空间中采用z预测参数化,避免速度预测带来的收敛问题,显著提升信噪比;第二,设计两阶段的流引导课程,将模型逐步暴露于自回归误差中,缓解偏差积累,确保长远预测的稳定性。结合chunk-wise自回归机制,实现任意时间跨度的几何演变预测,且无需训练视频生成模型。此方法充分利用预训练几何模型的零样本几何先验,为动态场景的3D预测提供了新思路。

方法详解

  • �� 利用预训练VGGT模型提取多尺度几何特征,作为场景的状态表示。• 采用层4输出作为预测基础,避免深层信息丢失。• 将时间序列划分为多个块,逐块自回归预测未来几何状态。• 引入连续流匹配(flow matching)在高维空间中进行状态转移,避免速度预测崩溃。• 采用z预测参数化,直接预测干净的几何潜在状态,增强信号质量。• 构建双流因果处理器和单流空间去噪器,分离时间推理与空间细化。• 设计两阶段流引导课程:第一阶段用真实历史训练,第二阶段引入部分噪声模拟推理误差,逐步适应自回归偏差。• 通过chunk-wise滑动窗口实现长距离预测,结合未来预测作为正则化,提升几何一致性。

实验设计

  • �� 在KITTI、Cityscapes和TartanAir数据集上进行验证,涵盖深度、点云和相机轨迹预测任务。• 比较基线包括Cosmos、Aether、DINO-Foresight等,采用AbsRel、δ1等指标。• 训练参数为0.43B,采用AdamW优化,训练细节包括学习率、批次大小等。• 进行消融实验验证z预测和流引导课程的效果,分析模型稳定性。• 评估模型在不同时间跨度下的预测精度和速度,验证其优越性。

结果分析

  • �� 在KITTI深度预测中,AbsRel由基线的0.155降至0.065,δ1提升至94.0%,性能优于Cosmos和Aether。• 速度方面,VGGT-World比Cosmos(12B参数)快3.6-5倍,参数少于0.5B。• 消融实验显示,z预测参数化和两阶段课程是性能提升的关键,模型在高维空间中表现出更强的稳定性和准确性。

应用场景

  • �� 适用于自主导航、机器人感知、虚拟现实等场景中的实时深度和几何预测。• 依赖预训练几何模型,无需大量场景特定微调,具有良好的泛化能力。• 未来可结合多模态信息,增强复杂动态环境中的预测能力。

局限与展望

  • �� 依赖预训练几何模型,基础模型性能不足或场景变化大时效果受限。• 高维特征空间中噪声敏感,复杂场景下偏差可能积累。• 训练调参复杂,模型对流引导课程参数较为敏感。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工厂每天都在生产不同的产品。工厂的操作流程很复杂,有很多机器和工人,每天都在变化。以前的技术就像是让工厂每天拍一张照片,然后试图猜出未来的生产线会变成什么样,但照片里可能缺少一些细节,导致猜测不准。现在,这个方法像是提前学习了工厂的操作规律,记住了每个机器的工作方式,然后只专注于预测未来的操作变化。它不用拍照片,也不用模拟整个生产过程,而是直接预测工厂未来的状态。这样,不仅更快,还能更准确地知道工厂未来会变成什么样。这个新方法就像是让工厂自己“预知”未来,而不用每次都从头开始猜,效率和准确性都大大提高了。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的积木游戏,你每天都在搭不同的城堡。以前的方法就像是每次都从零开始,用照片猜城堡长什么样,但照片可能看不全,猜得不准。现在,这个新方法就像是你提前记住了一些城堡的搭建规则,然后根据这些规则预测下一次你会搭出什么样的城堡。它不用每次都看照片,而是用自己记住的规则,直接告诉你未来的城堡会是什么样。这让你搭城堡变得又快又准,也不用担心城堡会倒。就像你有了一个聪明的朋友,总能提前告诉你城堡会变成什么样,帮你更好地玩这个积木游戏。

术语表

几何基础模型 (Geometry Foundation Model)

一种预训练的深度学习模型,能从多视角图像中恢复场景的几何结构,包括深度、点云等。它在场景理解中提供几何先验。

论文中用以提取场景的几何特征作为预测状态。

z预测 (z-prediction)

在高维特征空间中,直接预测干净的几何潜在状态,避免速度预测带来的收敛问题。

解决模型在高维空间中难以优化的问题。

连续流匹配 (Flow Matching)

一种在连续时间中学习状态转移的技术,通过ODE定义状态变化的向量场。

用于在高维空间中预测几何状态的演变。

自回归 (Autoregressive)

模型依赖前一时刻的预测结果,逐步预测未来状态。

实现长距离几何演变的逐块预测。

暴露偏差 (Exposure Bias)

模型在训练时依赖真实数据,但在推理时依赖自身预测,导致误差累积。

通过两阶段流引导课程缓解偏差。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升高维空间中模型的鲁棒性,特别是在极端复杂或动态变化场景下的表现仍需研究。
  • 2 未来应探索多模态融合,结合语义、物理信息,增强模型的泛化能力和预测精度。

原文摘要

World models that forecast scene evolution by generating future video frames devote the bulk of their capacity to photometric details, yet the resulting predictions often remain geometrically inconsistent. We present VGGT-World, a geometry world model that side-steps video generation entirely and instead forecasts the temporal evolution of frozen geometry-foundation-model (GFM) features. Concretely, we repurpose the latent tokens of a frozen VGGT as the world state and train a lightweight temporal flow transformer to autoregressively predict their future trajectory. Two technical challenges arise in this high-dimensional (d=1024) feature space: (i) standard velocity-prediction flow matching collapses, and (ii) autoregressive rollout suffers from compounding exposure bias. We address the first with a clean-target (z-prediction) parameterization that yields a substantially higher signal-to-noise ratio, and the second with a two-stage latent flow-forcing curriculum that progressively conditions the model on its own partially denoised rollouts. Experiments on KITTI, Cityscapes, and TartanAir demonstrate that VGGT-World significantly outperforms the strongest baselines in depth forecasting while running 3.6-5 times faster with only 0.43B trainable parameters, establishing frozen GFM features as an effective and efficient predictive state for 3D world modeling.

cs.CV