核心发现
方法论
本文提出GeoWorldAD,将轨迹规划嵌入ego对齐的三维几何空间,通过多尺度现有几何和潜在未来几何令牌,逐步优化路径。模型由视频几何模型、几何世界模型和几何导向动作模型组成。视频几何模型利用StreamVGGT提取多尺度几何特征,结合深度预测实现场景的时空几何重建。几何世界模型通过学习潜在未来几何令牌,预测短期场景演变,辅以深度监督。动作模型融合当前和未来几何信息,逐步细化轨迹,兼顾安全与效率。训练采用多阶段策略,结合NAVSIM v1/v2数据,优化路径和几何重建性能。
关键结果
- 在NAVSIM v1和v2上,GeoWorldAD分别实现PDMS达91.0和89.1,超越所有对比方法。具体而言,模型在安全指标NC达99.0,TTC达95.8,EP达85.9(v1)和89.1(v2),显示出在保持安全的同时显著提升驾驶效率。相比基线模型,未来几何引导显著改善ego进展(提升3.3点),同时安全指标保持优越。
- 模型在不同场景中表现出优异的泛化能力,尤其在复杂交通环境中,显著减少过度保守决策,提升路径连续性和驾驶流畅性。 ablation研究显示,加入潜在未来几何令牌后,安全性和效率指标均有提升,验证了未来场景预测的有效性。
- 模型在多尺度几何融合和未来几何预测方面的创新,带来路径规划的显著改进,为自主驾驶系统提供了更具空间感和前瞻性的决策依据。
研究意义
本研究突破了传统视觉驱动路径规划的局限,将几何场景的显式建模与未来预测结合,显著提升自主驾驶的安全性与效率。通过明确的3D几何约束和未来场景演变的预估,有效缓解了环境不确定性带来的保守行为,推动自主驾驶向更智能、更安全的方向发展。这一方法不仅丰富了几何建模在路径规划中的应用,也为未来融合多模态信息的场景理解提供了新思路。其在实际复杂交通环境中的优越表现,展示了其在自动驾驶行业的广泛潜力。
技术贡献
本文提出的GeoWorldAD创新性地将轨迹规划嵌入ego对齐的3D几何空间,结合多尺度现有几何特征与潜在未来几何令牌,实现了场景的短期演变预测。模型利用StreamVGGT提取几何特征,结合深度预测进行场景重建,创新性地引入潜在未来几何令牌,增强模型对未来场景的预估能力。通过逐步融合当前与未来几何信息,模型实现了路径的逐次优化,显著优于仅依赖静态几何或像素空间的方案。这一框架为自主驾驶路径规划提供了空间感更强、预测更准确的解决方案。
新颖性
本研究首次将显式ego对齐的多尺度几何特征与潜在未来几何令牌结合,作为路径规划的核心表示。不同于以往仅依赖像素或深度图的未来预测方法,GeoWorldAD在几何空间中同时考虑场景的当前状态和未来演变,提供更具空间一致性和前瞻性的决策依据。这一创新突破了现有方法在未来场景预估中的局限,为自主驾驶路径规划带来全新思路。
局限性
- 模型对复杂交通场景中的动态变化仍存在一定的预测误差,尤其在极端天气或传感器噪声较大的环境下,几何重建和未来预测的准确性可能下降。
- 高精度几何特征提取和未来场景预测的计算成本较高,实时性仍需优化,特别是在资源受限的硬件平台上。
- 当前模型主要在模拟环境和有限真实场景中验证,泛化到更大规模、多样化的实际交通环境仍需进一步验证。
未来方向
未来将结合多模态信息(如雷达、激光点云)增强几何感知能力,提升模型在复杂环境中的鲁棒性。同时,优化模型结构以降低计算成本,实现更高效的实时路径规划。还计划扩展到长时序场景预测,增强模型对长远路径的前瞻能力,为自动驾驶系统提供更全面的场景理解与决策支持。
AI 总览摘要
自主驾驶技术正面临在复杂动态环境中实现安全与高效路径规划的挑战。传统方法多依赖模块化设计,容易受到误差累积影响,难以应对环境的不确定性。近年来,基于视觉的端到端模型取得一定突破,但缺乏明确的几何场景理解与未来场景预估,限制了其安全性和效率。
本文提出GeoWorldAD,一种结合显式3D几何与未来场景预测的路径规划模型。该模型由视频几何模型、几何世界模型和几何导向动作模型组成。视频几何模型利用StreamVGGT提取多尺度几何特征,结合深度预测实现场景的时空几何重建。几何世界模型通过学习潜在未来几何令牌,预测短期场景演变,为路径规划提供前瞻性信息。动作模型融合当前和未来几何信息,逐步优化轨迹,兼顾安全与效率。
在NAVSIM v1和v2数据集上的实验结果显示,GeoWorldAD在安全指标和驾驶效率方面均优于现有最先进方法。具体而言,模型在PDMS指标上达到了91.0和89.1,显著提升了路径连续性和安全性。ablation研究验证了未来几何预测对提升ego进展和安全的贡献。这一创新框架为自主驾驶系统提供了更具空间感和前瞻性的路径规划方案,推动行业向更智能、更安全的方向发展。
未来工作将结合多模态信息,优化模型的实时性和泛化能力,拓展长时序场景预测,为自动驾驶的广泛应用奠定基础。
深度解读
原文摘要
Autonomous driving requires both safe and efficient planning decisions in dynamic 3D environments. Although recent Vision/Video-Action models learn policies directly from visual observations and scale well with advances in vision transformers and large-scale training data, they often lack explicit geometric grounding and future-aware spatial guidance, limiting their ability to balance collision avoidance and driving progress. In this work, we propose GeoWorldAD, a geometry world action model that grounds trajectory planning in ego-aligned 3D space and anticipates short-horizon scene evolution with latent future geometry tokens. Present geometry provides essential spatial constraints for safe planning, while future geometry reveals how surrounding agents and ego-centric free space may evolve, reducing overly conservative decisions without sacrificing safety. To efficiently exploit these geometric cues, GeoWorldAD progressively aggregates multi-scale present geometry and latent future geometry through iterative trajectory refinement. Experiments on NAVSIM v1 and v2 demonstrate state-of-the-art performance, highlighting the effectiveness of explicit 3D geometry grounding and future geometry world modeling for safe and efficient autonomous driving.