GeoWAM: Visual Geometry World Action Models for Autonomous Driving

TL;DR

GeoWAM通过预测场景几何演变,显著提升自主驾驶中的路径规划性能。

cs.CV 🔴 高级 2026-08-25 90 次浏览
Yiren Lu Xin Ye Jiaming Liu Jin Yao Yi-chung Chen Liam Merino Dhruva Dixith Kurra Min Cai Tom Lampo Yu Yin Danhua Guo Burhan Yaman
自主驾驶 场景理解 几何建模 深度学习 动作预测

核心发现

方法论

GeoWAM采用基于点云的几何表示,预训练以预测未来场景几何,结合Transformer架构实现多层次空间-时间建模。模型由几何编码器(基于DVGT-2)提取多尺度几何和ego信息,通过未来几何解码器预测未来点云,利用几何条件的动作头推断未来轨迹。训练目标包括未来点云的欧几里得回归和置信度监督,确保几何预测的准确性。微调阶段引入逆动力学式的轨迹推断,将几何动态映射到ego路径,增强规划能力。

关键结果

  • 在nuScenes数据集上,GeoWAM在未来几何预测中实现平均绝对相对误差(Abs Rel)为0.257,优于Epona+DVGT的0.274,且在4秒预测时仍保持较高的δ<1.25指标(0.754对比0.655),显示其在长时序预测中的优越性。
  • 在NAVSIM的闭环路径规划中,GeoWAM获得EPDMS评分90.2,超越多种基线模型,尤其在复杂场景中表现出更强的鲁棒性和准确性。
  • 模型在多视角、多时间点的几何预测中表现出优异的泛化能力,验证了几何预训练在自主驾驶中的潜力。

研究意义

该研究突破了以像素为主的场景动态建模限制,提出以点云几何为基础的场景表示,显著提升路径规划的准确性和鲁棒性。通过明确捕获空间结构和刚性、非刚性变换,GeoWAM为自主驾驶提供了更为自然和高效的状态空间,有助于实现更安全、更智能的自动驾驶系统。这一方法不仅推动了场景理解的理论发展,也为实际应用中的路径规划、决策提供了坚实基础,具有广泛的产业推广潜力。

技术贡献

本研究提出了基于点云几何的世界动作模型,区别于传统像素空间的模型,利用多尺度几何编码和Transformer解码器实现未来场景几何的高精度预测。引入逆动力学式的轨迹推断机制,将几何演变直接映射到ego路径,增强模型的规划能力。预训练阶段采用密集点云预测目标,避免了对场景深度标注的依赖,提升了模型的泛化能力。整体架构实现了几何信息与动作决策的紧密结合,为自主驾驶中的场景理解和路径规划提供了新范式。

新颖性

本研究首次将点云几何作为自主驾驶场景动态建模的核心表示,突破了以像素为主的像素生成模型的局限。通过预训练未来几何预测,结合逆动力学式轨迹推断,实现了场景演变与路径规划的端到端融合。这一创新在精度和鲁棒性方面优于现有的图像或视频生成模型,为自主驾驶中的场景理解提供了全新的思路。

局限性

  • 模型对复杂非刚性变形和遮挡场景的适应性仍有限,未来需引入更丰富的几何表达和多模态信息以提升鲁棒性。
  • 几何预测依赖密集点云目标,可能在极端光照或传感器噪声条件下表现不佳,需增强模型的鲁棒性。
  • 训练和推理过程计算成本较高,未来需优化模型结构以实现实时应用。

未来方向

未来可结合多模态信息(如激光雷达、语义分割)提升几何预测的鲁棒性,探索更高效的模型架构实现实时路径规划。同时,结合强化学习优化决策策略,增强模型在复杂交通环境中的适应能力。进一步研究几何预测在多场景、多任务中的迁移能力,推动自主驾驶技术的商业化落地。

AI 总览摘要

自主驾驶作为智能交通的核心技术,面临场景理解与路径规划的双重挑战。传统方法多依赖像素级视频预测,难以准确捕获三维空间中的结构和运动变化,限制了路径规划的鲁棒性与精度。本文提出GeoWAM,一种基于点云几何的世界动作模型,通过预训练未来场景几何,显著改善了路径预测的准确性与稳定性。

GeoWAM的核心创新在于将场景表示从像素空间转向稠密点云几何,利用Transformer架构实现多尺度空间-时间建模。在预训练阶段,模型学习预测未来点云,避免了对深度标注的依赖,增强了泛化能力。微调阶段,模型引入逆动力学式的轨迹推断机制,将几何演变映射到ego路径,提升路径规划的效果。

实验结果显示,GeoWAM在nuScenes数据集上未来几何预测的平均绝对相对误差(Abs Rel)为0.257,优于现有的像素生成模型。同时,在NAVSIM路径规划任务中,模型获得了最高的EPDMS得分90.2,展现出在复杂环境中的优越性能。这些成果表明,几何导向的场景建模在自主驾驶中的潜力巨大,为未来智能交通系统提供了新的技术路径。

尽管如此,模型仍面临非刚性变形和遮挡场景的挑战,未来需结合多模态信息和优化算法以实现实时应用。总体而言,GeoWAM代表了场景理解与路径规划融合的重大突破,为自主驾驶的安全性和智能化迈出了关键一步。

深度分析

研究背景

自主驾驶的发展经历了从基于规则的系统到深度学习的端到端模型的演变。早期依赖激光雷达和高清地图实现环境感知,随后引入深度神经网络进行场景理解与路径规划。近年来,预训练模型如BERT、GPT在自然语言处理中的成功激发了视觉预训练的研究热潮,推动了视觉-语言-动作(VLA)模型的发展。然而,这些模型多依赖像素级的图像生成,难以直接反映场景的三维空间结构,限制了路径规划的准确性。场景几何建模技术如点云、体素等逐渐兴起,提供了更为自然的空间表征。代表性工作包括DVGT、VGGT等,它们通过多视角几何编码实现场景的稠密重建,为路径规划提供了更稳固的几何基础。

核心问题

现有的自主驾驶场景建模多集中于像素空间的未来帧预测,难以直接捕获场景中的空间结构和运动变换。这导致路径规划在复杂环境中表现不佳,尤其在长时序预测和遮挡场景中误差累积严重。像素表示的局限在于其对几何信息的间接编码,难以实现高精度的空间理解。此外,现有模型多依赖深度标注或稠密点云,增加了数据采集成本。如何利用场景的几何信息,建立更自然、更高效的场景表示,成为亟待解决的问题。

核心创新

本研究的核心创新在于引入点云几何作为场景的主要表示,突破像素空间的限制。通过预训练未来几何预测,模型学习场景的空间结构和动态变化,避免对深度标注的依赖。结合Transformer架构实现多尺度空间-时间建模,提升几何预测的精度。引入逆动力学式的轨迹推断,将场景几何演变映射到ego路径,增强路径规划的合理性。这一方法实现了几何信息与动作决策的端到端融合,为自主驾驶提供了更自然、更高效的场景理解框架。

方法详解

  • �� 采用多视角几何编码器(DVGT-2)提取多尺度几何和ego信息,形成历史几何记忆。• 设计未来几何解码器,利用Transformer模型预测未来点云,结合空间-时间自注意力机制,捕获场景演变。• 训练目标包括未来点云的欧几里得回归和置信度监督,确保几何预测的准确性。• 在微调阶段,引入逆动力学式的轨迹推断,将预测的几何动态映射到未来ego路径。• 训练过程中采用密集点云目标,避免深度标注依赖,提升泛化能力。• 最终模型融合几何预测与路径规划,实现端到端自主驾驶决策。

实验设计

在nuScenes数据集上,评估未来几何预测的准确性,采用Abs Rel误差和δ<1.25指标,验证模型在不同预测时长(1-4秒)内的性能。对比基线模型Epona+DVGT和VGGT-World,GeoWAM在所有时长段表现优异,尤其在4秒预测中保持较低误差(0.257)和高阈值准确率(0.754)。在NAVSIM路径规划任务中,采用闭环和两阶段评估,GeoWAM获得最高EPDMS(90.2),优于多种先进模型,显示其在复杂环境中的鲁棒性。模型训练细节包括Transformer层数、隐藏维度、学习率调度和多视角采样策略,确保模型性能和泛化能力。

结果分析

GeoWAM在未来几何预测中显著优于像素生成模型,尤其在长时预测中表现出更低的误差和更高的准确率。路径规划评估中,模型在复杂场景下保持高安全性和效率,EPDMS评分达90.2,优于现有方法。模型对遮挡和非刚性变形的适应性较强,验证了几何表示的优势。实验还揭示了预训练几何预测对提升路径规划鲁棒性的关键作用,为未来自主驾驶系统提供了坚实基础。

应用场景

该模型可直接应用于自动驾驶车辆的路径规划与决策系统,依赖多视角摄像头和点云数据,提升环境理解的空间精度。未来可结合激光雷达和语义信息,增强模型在复杂交通环境中的表现。长远来看,GeoWAM有望推动智能交通系统的自动化和安全性,减少交通事故,提升交通效率,为智慧城市建设提供技术支撑。

局限与展望

模型在极端光照、遮挡或非刚性变形场景下表现仍有限,需引入多模态信息和更鲁棒的几何表达。训练和推理成本较高,实时性有待优化。未来应结合强化学习和模型压缩技术,提升系统的实用性和普适性。

通俗解读 非专业人士也能看懂

想象你在看一场电影,电影里的场景不断变化,但你只需要看一些点点和线条,就能知道房子、树木和人们在移动。这个模型就像用点云来描述这个场景,而不是用彩色的画面。它通过观察一段时间内的点点变化,预测未来场景会变成什么样,就像提前知道下一幕会发生什么。这样,汽车就能根据这些点点的变化,提前规划出安全的行驶路线。它不用看彩色图片,只用几何信息,就能更准确地理解空间关系和运动变化,就像用地图和路线图代替照片一样。

简单解释 像给14岁少年讲一样

想象你在玩一个迷宫游戏,你可以看到墙壁、门和障碍物的轮廓,但没有颜色和细节。你用这些轮廓来判断下一步怎么走。这个模型就像用点点和线条画出场景的地图,然后预测未来迷宫会变成什么样。它不用看彩色图片,只用几何信息,能更清楚地知道空间的布局和运动的方向。这样,汽车就能提前知道前方会发生什么,提前做出反应,避免撞到障碍物。就像用地图提前规划路线一样,模型用几何点云帮汽车安全行驶。

术语表

Point Cloud(点云)

一种由空间中的大量点组成的三维数据结构,用于表示场景的几何形状。技术上,它是由激光雷达或深度相机采集的稠密空间点集合。

在论文中,点云作为场景几何的主要表示,用于预测未来场景的空间结构。

Transformer(变换器)

一种基于自注意力机制的深度学习架构,擅长建模序列中的长距离依赖关系。广泛应用于自然语言处理和视觉任务。

GeoWAM中的未来几何解码器采用Transformer实现多尺度空间-时间建模。

Inverse Dynamics(逆动力学)

通过观察运动结果反推作用力和运动状态的过程,常用于运动分析和控制。

模型中利用逆动力学思想,将场景几何演变映射到未来ego路径。

Dense Point Map(稠密点图)

在场景中每个像素对应的三维点的集合,表示场景的详细几何结构。

模型通过预测未来点云密集点图,实现场景几何的高精度预测。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂场景(如非刚性变形、遮挡严重)中保持几何预测的鲁棒性仍未充分解决,未来需结合多模态信息提升模型适应性。
  • 2 模型在实时性方面仍有挑战,尤其是在高密度点云和多视角融合的情况下,需优化算法以满足工业应用需求。

应用场景

近期应用

路径规划增强

利用几何预测结果,提升自动驾驶车辆在复杂环境中的路径规划准确性和安全性,适用于高精度自动驾驶系统。

环境感知优化

结合多视角传感器,增强场景几何理解,为感知系统提供更稳固的空间结构信息,提升整体感知性能。

远期愿景

智慧交通系统

未来将几何场景理解融入城市交通管理,实现自动驾驶车辆的协同与优化,推动智慧交通和自动驾驶普及。

原文摘要

World action models (WAMs) have recently gained increasing attention as a framework for jointly modeling scene evolution and ego actions in autonomous driving. Most existing WAMs learn scene dynamics in pixel space by combining a video-generation backbone for future-observation prediction with an action head for ego-trajectory prediction. Pixels, however, provide only an indirect representation of these dynamics: they entangle geometry and motion with appearance, texture, and illumination, forcing the model to infer three-dimensional transformations from two-dimensional observations. We argue that geometry, represented by point clouds, offers a more natural state space for driving because it explicitly captures spatial structure and the rigid and non-rigid transformations that govern scene evolution while directly aligning with the space in which driving actions are executed. Building on this insight, we introduce \textbf{GeoWAM}, a visual geometry world action model for autonomous driving. Rather than predicting future images, GeoWAM is pretrained to forecast future scene geometry, yielding representations that jointly encode spatial structure and temporal evolution. A geometry-conditioned action head then leverages these learned geometric dynamics to predict future ego trajectories. Extensive open-loop and closed-loop evaluations show that visual geometry world modeling yields substantially stronger driving policies than image-based alternatives, establishing future-geometry prediction as an effective pretraining objective for autonomous driving.

cs.CV cs.RO