核心发现
方法论
本文提出基于多模态序列的驾驶语言,将图像和动作离散化为交错的Token,利用类似Llama的Transformer模型,通过标准的下一Token预测实现世界建模与路径规划的融合。具体包括:使用预训练VQ-VAE将视频帧编码为离散Token,动作通过相对位姿离散化,构建统一的多模态词汇表。模型采用帧级旋转嵌入,训练目标为同时预测未来图像Token和动作Token,实现端到端的多任务学习。该架构在nuPlan和NAVSIM两个大规模数据集上,显著优于现有扩散模型和端到端方法,表现为更高的生成质量和规划性能。
关键结果
- 在视频生成任务中,DrivingGPT在nuPlan数据集上FID值为12.78,优于SVD的24.03,FVD值为278.11,优于SVD的418.93,显示出更好的视觉质量和时间一致性。
- 在路径规划方面,DrivingGPT在NAVSIM上实现了82.4%的PDMS得分,明显优于ResNet+MLP基线的77.8%,展现出端到端规划的优越性。
- 长序列视频生成中,DrivingGPT在64帧视频中FVD为506.95,优于SVD的1079.28,表明模型在长时间跨度内保持内容一致性和多样性。
研究意义
该研究突破了传统基于扩散模型的视觉生成局限,将多模态信息融入序列模型中,实现了驾驶场景的联合建模与路径规划,为自动驾驶的端到端系统提供了新的技术路径。其在大规模真实场景数据上的优异表现,推动了自主系统在复杂环境中的应用落地,具有重要的理论和工程意义。
技术贡献
提出多模态驾驶语言,将图像和动作离散化并交错编码,创新性地将世界建模与路径规划统一为序列预测任务。采用帧级旋转嵌入的Transformer架构,有效融合视觉与动作信息,提升模型的表达能力。实现端到端训练,兼顾视频生成和路径规划两大任务,超越传统扩散模型在连续性和多模态融合上的限制,为未来多模态自主系统奠定基础。
新颖性
首次将多模态驾驶场景建模和路径规划统一为序列预测问题,利用离散Token和Transformer实现端到端学习。不同于以往依赖扩散模型的视觉生成,创新性地采用自回归Transformer进行长序列预测,解决了多模态融合和时间一致性难题,开辟了自动驾驶多模态建模的新方向。
局限性
- 模型在极端复杂场景下仍存在生成内容不准确或不合理的问题,主要由于离散Token的表达能力有限。
- 训练依赖大量标注数据,数据偏差可能影响模型泛化能力,特别是在未见场景中的表现。
- 推理过程计算成本较高,长序列生成时存在效率瓶颈,未来需优化模型结构以提升实时性。
未来方向
未来将探索多模态Token的更高效编码策略,结合强化学习优化路径规划的鲁棒性,扩展模型对多传感器信息的融合能力,并在真实无人驾驶平台上验证系统的实用性与安全性。
AI 总览摘要
DrivingGPT创新性地将自动驾驶中的世界建模与路径规划统一为多模态序列预测任务,利用Transformer模型对离散化的图像和动作Token进行端到端学习。
传统方法多依赖扩散模型进行视觉生成,存在时间一致性差和多模态融合困难的问题。本文提出的多模态驾驶语言,将图像和动作交错编码,形成统一词汇表,利用帧级旋转嵌入增强模型表达能力。通过标准的下一Token预测训练,DrivingGPT不仅实现高质量的视频生成,还能进行精确的路径规划。
在nuPlan和NAVSIM两个大规模真实场景数据集上,DrivingGPT在视频生成指标(FID、FVD)和路径规划指标(PDMS)上均优于现有主流方法。长序列视频生成中,模型表现出更好的内容连续性和多样性,避免了传统扩散模型的内容重复和对象幻觉问题。这一突破为自动驾驶的端到端系统提供了新的技术路径,推动了多模态自主系统的研究与应用。
深度分析
研究背景
自动驾驶的发展经历了从规则驱动到学习驱动的转变。早期方法依赖手工设计的感知与规划模块,后续深度学习模型如Behavior Cloning、End-to-End学习逐渐兴起。近年来,世界模型(World Models)成为研究热点,代表性工作包括Video Prediction、3D空间建模等。扩散模型在视觉生成中表现优异,但在时间一致性和多模态融合方面存在局限。多模态学习结合视觉、动作、语义信息,提升场景理解能力,但多模态融合仍面临信息不一致和模型复杂度高的问题。本文在此背景下,提出将多模态信息离散化、统一编码,利用Transformer实现端到端的联合建模,填补了视觉生成与路径规划融合的空白。
核心问题
现有自动驾驶模型多依赖单一模态或分离的子系统,难以实现端到端的连续场景理解与路径规划。扩散模型虽能生成高质量视觉内容,但难以融合动作信息,且在长序列中表现出时间漂移和内容重复的问题。多模态信息的异质性和时间一致性是核心难题,限制了模型在复杂环境中的泛化能力和实时性。如何设计统一的序列模型,融合视觉与动作信息,实现高效、连续的场景建模与路径规划,是当前的研究瓶颈。
核心创新
本文提出多模态驾驶语言,将图像和动作离散化为交错Token,形成统一词汇表,创新性地将世界建模与路径规划融合为序列预测任务。采用帧级旋转嵌入的Transformer架构,增强模型对时间和空间信息的表达能力,突破了传统扩散模型在连续性和多模态融合上的限制。模型实现端到端训练,兼顾视频生成和路径规划,显著提升了多模态场景理解的效率和效果。这一创新为自动驾驶系统提供了全新的建模思路。
方法详解
- �� 图像编码:利用预训练VQ-VAE将连续视频帧转化为离散Token,减少信息损失。
- �� 动作离散化:将相对位姿(∆x, ∆y, ∆θ)通过分箱离散化,形成动作Token。
- �� 统一多模态词汇:将图像Token和动作Token交错编码,形成多模态驾驶语言。
- �� 模型架构:采用Llama-like的Transformer模型,加入帧级旋转嵌入,进行下一Token预测。
- �� 训练目标:同时预测未来图像Token和动作Token,实现世界建模与路径规划的联合学习。
- �� 推理过程:通过采样生成连续视频和路径,结合离散Token解码还原场景。
实验设计
使用nuPlan和NAVSIM两个大规模数据集,训练模型以最大化下一Token的预测概率。评估指标包括视频质量(FID、FVD)和路径规划(PDMS)。在视频生成中,模型在长序列中表现出更好的连续性和多样性。在路径规划方面,模型在复杂场景中实现了较高的安全性和效率。对比不同视觉Tokenizers,选择LlamaGen作为最优方案。还进行了消融实验验证多模态融合的有效性和模型的泛化能力。
结果分析
DrivingGPT在nuPlan上FID值为12.78,优于SVD的24.03,FVD值为278.11,优于418.93。在路径规划中,PDMS得分达82.4%,优于ResNet+MLP基线的77.8%。长视频生成中,64帧视频的FVD为506.95,明显优于SVD的1079.28,显示出更好的时间一致性和内容丰富性。模型还有效缓解了对象幻觉问题,表现出更强的场景连续性和多样性。
应用场景
该模型可应用于自动驾驶中的场景预测、路径规划和虚拟仿真,为未来自主系统提供端到端解决方案。其多模态建模能力也适用于智能交通、虚拟现实等领域,提升系统的场景理解和决策能力。未来结合多传感器信息,将进一步增强模型的鲁棒性和实用性。
局限与展望
模型在极端复杂或未见场景下仍存在生成偏差,离散Token表达能力有限,可能导致细节缺失。训练依赖大量标注数据,泛化能力受数据偏差影响。推理时计算成本较高,长序列生成存在效率瓶颈。未来需优化模型结构,提升实时性和泛化能力。
通俗解读 非专业人士也能看懂
想象你在玩一个超级复杂的拼图游戏,每一块拼图代表一个场景的画面,每一步移动代表你的驾驶动作。传统方法就像只用一块拼图拼图,难以看到全局,也难以规划下一步。DrivingGPT就像有一个聪明的拼图助手,它能同时记住每一块拼图的细节和你每次的移动,把所有信息都变成一种特殊的语言,然后用一个超级智能的机器人(Transformer)来预测下一块拼图应该放在哪里,以及你下一步该怎么走。这样,你不仅能拼出漂亮的画面,还能提前规划好未来的路径。它能在复杂的街景中,连续不断地拼出合理的场景和安全的路线,就像一个非常聪明的拼图大师一样。
原文摘要
World model-based searching and planning are widely recognized as a promising path toward human-level physical intelligence. However, current driving world models primarily rely on video diffusion models, which specialize in visual generation but lack the flexibility to incorporate other modalities like action. In contrast, autoregressive transformers have demonstrated exceptional capability in modeling multimodal data. Our work aims to unify both driving model simulation and trajectory planning into a single sequence modeling problem. We introduce a multimodal driving language based on interleaved image and action tokens, and develop DrivingGPT to learn joint world modeling and planning through standard next-token prediction. Our DrivingGPT demonstrates strong performance in both action-conditioned video generation and end-to-end planning, outperforming strong baselines on large-scale nuPlan and NAVSIM benchmarks.