核心发现
方法论
DriveFuture创新性地将未来潜在状态作为条件,显式引导当前决策。训练时,模型先预测未来潜在状态,再用交叉注意力对其进行校正,形成未来感知潜在表示。该表示作为扩散式轨迹规划器的条件,提升规划质量。推理时,模型利用预测的未来潜在状态,避免依赖真实未来信息,实现闭环规划。核心算法包括潜在动力学预测器、未来对齐适配器和扩散式轨迹解码器,结合训练中的潜在状态预测与校正机制,有效捕获未来信息对当前决策的引导作用。
关键结果
- 在NAVSIM-v2 navhard场景中,DriveFuture达到55.5的EPDMS,优于前沿方法DrivoR(54.6)和World4Drive(34.9),表现出显著的安全性和准确性提升。
- 在NAVSIM-v2 navtest中,DriveFuture获得89.9的EPDMS,超越DiffVLA(86.8)和DriveWorld-VLA(85.9),验证其在多样场景中的泛化能力。
- 在NAVSIM-v1 navtest中,DriveFuture实现90.7的PDMS,优于多项端到端和世界模型方法,显示其在长尾复杂场景中的鲁棒性。
研究意义
该研究突破了潜在世界模型仅作为未来状态预测的局限,将未来信息作为决策条件,极大改善自主驾驶的前瞻性和安全性。其创新框架为未来自主系统提供了新的思路,推动从被动模拟向主动规划的转变,具有深远的理论和应用价值。通过显式引入未来潜在状态,模型能更有效地进行长远规划,减少误差积累,提升整体性能,为自动驾驶行业带来更安全、更智能的解决方案。
技术贡献
DriveFuture提出了未来感知潜在状态条件化的统一训练-推理框架,结合潜在动力学预测器、未来对齐适配器和扩散式轨迹解码器,创新性地实现了未来信息的显式引导。该方法在潜在空间中实现未来状态的预测与校正,避免像像素空间那样的高成本重建,提升了模型的效率和鲁棒性。其引入的未来条件化机制,为潜在世界模型在自主驾驶中的应用提供了新范式,开启了未来感知决策的研究新方向。
新颖性
本研究首次将未来潜在状态作为显式条件引入潜在世界模型,突破了以往仅作为预测目标的限制。通过训练中利用真实未来潜在状态进行校正,并在推理中采用预测状态,显著增强了模型的前瞻性和决策导向能力。这一机制区别于传统的未来状态预测或后续轨迹评分方法,强调未来信息对当前决策的逆向引导,是潜在世界模型应用的关键创新。
局限性
- 模型在极端复杂场景或传感器噪声较大时,未来潜在状态预测可能不够准确,影响规划效果。
- 训练过程中对未来潜在状态的依赖增加了模型复杂度,计算成本较高,需优化效率。
- 当前方法主要在模拟环境中验证,实际部署中面临感知误差和环境变化的挑战,未来需结合真实场景进行适应性提升。
未来方向
未来将探索多模态未来潜在状态的联合建模,增强模型对复杂环境的适应能力。同时,结合多源传感信息和强化学习策略,提升模型的鲁棒性和泛化能力。此外,计划将DriveFuture应用于真实车辆系统,验证其在实际道路中的表现,推动自主驾驶技术的商业化落地。还将研究模型的可解释性,增强系统的安全性和用户信任。
AI 总览摘要
DriveFuture引入了一种创新的未来感知潜在世界模型框架,显式利用未来潜在状态作为决策条件,显著提升自主驾驶轨迹规划的性能。传统潜在世界模型多聚焦于未来状态的预测,未能充分利用未来信息引导当前决策。DriveFuture通过训练时预测未来潜在状态并用交叉注意力进行校正,将未来语义融入潜在空间,形成未来感知潜在表示。这一表示作为扩散模型的条件,有效引导多模态轨迹生成。
在训练阶段,模型利用真实未来潜在状态作为校正目标,确保未来信息的准确性。推理时,模型使用预测的未来潜在状态,避免依赖真实未来信息,实现闭环规划。实验在NAVSIM系列基准中表现优异,达成55.5 EPDMS(NAVSIM-v2 navhard)、89.9 EPDMS(NAVSIM-v2 navtest)和90.7 PDMS(NAVSIM-v1 navtest),超越多项SOTA方法。
这些结果表明,将未来潜在状态作为条件,不仅提升了整体性能,也增强了模型在安全和复杂场景中的鲁棒性。DriveFuture的设计理念为自主驾驶系统提供了新的决策范式,即将未来信息逆向引入当前决策,推动从反应式控制向前瞻性规划转变。未来工作将聚焦多模态未来状态建模、实际部署和系统解释性,期待其在自动驾驶行业的广泛应用。
深度分析
研究背景
近年来,潜在世界模型逐渐成为自主驾驶研究的核心方向之一。早期工作如World4Drive、Law等,主要关注在观察空间或稠密重建中模拟未来场景,强调高保真度和控制能力。随着潜在空间的引入,研究逐步转向在BEV(鸟瞰图)空间中进行结构化建模,提升长远规划能力。代表性工作包括DriveVLA、WorldRFT等,强调模型的可扩展性和决策导向。尽管取得一定成功,但大多模型仍偏重于未来状态的预测,缺乏对未来信息的逆向引导,限制了决策的前瞻性。
核心问题
现有潜在世界模型多将未来状态作为预测目标,未能充分利用未来信息作为决策条件,导致当前与未来特征在潜在空间中交织,影响规划的前瞻性和安全性。这种状态限制了模型在复杂场景中的表现,尤其在长尾和安全关键任务中表现不足。如何将未来潜在状态作为显式条件,逆向引导当前决策,成为亟需解决的问题。该问题的核心在于模型如何在训练中有效预测和校正未来潜在状态,并在推理中利用预测状态实现闭环控制。
核心创新
DriveFuture的创新点在于提出未来感知潜在状态条件化机制,将未来潜在状态作为显式条件引入潜在空间,打破传统仅预测未来的框架。其核心创新包括:• 训练中利用真实未来潜在状态进行校正,确保未来语义的准确性;• 在推理中用预测潜在状态替代真实信息,实现闭环规划;• 结合潜在动力学预测器、未来对齐适配器和扩散式轨迹解码器,形成端到端的未来感知决策体系。这种机制显著提升了模型的前瞻性和鲁棒性,推动潜在世界模型向主动决策方向发展。
方法详解
- �� 输入多视角感知信息,通过BEV编码器提取场景潜在表示;
- �� 训练潜在动力学预测器,结合轨迹信息预测未来潜在状态,并用交叉注意力进行校正;
- �� 在训练阶段,利用真实未来潜在状态作为校正目标,采用潜在对齐机制逐步引导预测;
- �� 在推理阶段,利用预测的未来潜在状态作为条件,结合扩散模型生成轨迹;
- �� 扩散模型通过条件噪声预测,结合场景和未来语义信息,生成多模态轨迹;
- �� 训练中同时优化轨迹和语义的重建损失,确保模型的表达能力和规划效果。
实验设计
在NAVSIM-v2 navhard、navtest和NAVSIM-v1 navtest数据集上评估,采用EPDMS和PDMS指标,比较多种端到端和潜在模型。模型超参数包括16×64的BEV网格、5层Transformer扩散头、100轨迹采样。训练使用8块NVIDIA 5090 GPU,学习率10^-4,损失加权λ=10。对比基线包括TransFuser、DiffusionDrive、DriveVLA等,进行消融验证未来条件化机制的贡献。评估内容涵盖安全性、鲁棒性和泛化能力。
结果分析
DriveFuture在NAVSIM-v2 navhard场景中达到55.5 EPDMS,优于前沿方法,表现出更强的安全性和规划质量。在navtest中,89.9的EPDMS超越DiffVLA(86.8)和DriveWorld-VLA(85.9),验证其泛化能力。在NAVSIM-v1中,90.7 PDMS表现优异,显示其在复杂场景中的鲁棒性。这些结果充分证明未来条件化潜在模型在提升自主驾驶性能方面的潜力,特别是在安全和长尾场景中。
应用场景
该模型可应用于自动驾驶车辆的路径规划与决策系统,尤其适合复杂交通环境和长远规划需求。通过显式引入未来潜在状态,系统能提前规避潜在风险,提升安全性。未来还可结合多源感知和强化学习,增强模型的适应性和鲁棒性,推动自动驾驶向商业化迈进。
局限与展望
模型在极端复杂或感知噪声较大的环境中,未来潜在状态预测可能失准,影响规划效果。训练成本较高,需大量标注数据和计算资源。实际部署面临环境变化和传感器误差的挑战,未来需结合真实场景进行优化。模型的泛化能力仍有待提升,尤其在未见场景中的表现。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,厨房里有许多不同的食材和工具。你不仅要知道现在的食材状态,还要提前想到未来的菜肴会变成什么样。DriveFuture就像一个聪明的厨师,不仅能观察当前的厨房情况,还能预测未来的菜肴变化,并用这些预测来决定下一步的动作。它会提前考虑未来的味道和摆盘,从而做出更好的菜肴。这个方法让厨房里的厨师变得更聪明,能提前准备,避免出错,也能做出更美味的菜。它用一种特殊的“厨艺书”记录未来的可能变化,帮助厨师在做饭时做出最聪明的决定。这样一来,厨房里的菜肴就能更快、更好地完成,味道也更棒了。
简单解释 像给14岁少年讲一样
想象你在玩一款超级酷的赛车游戏,你不仅要控制赛车跑得快,还要提前预料前面会遇到的障碍和弯道。DriveFuture就像一个聪明的赛车手,不仅知道现在的路况,还能预测未来几秒钟的路面变化,然后提前调整方向和速度。这让你在比赛中更有优势,不容易撞到障碍,也能跑得更快。它用一种特别的“未来地图”帮助你看到未来的路况,让你在比赛中变得更聪明、更有预见性。这样一来,你的赛车就能跑得更顺畅、更安全,赢得比赛也更有把握。这种提前预判的能力,是未来自动驾驶汽车变得更安全、更智能的关键。
原文摘要
Existing latent world models for autonomous driving have opened a promising path toward future-aware driving intelligence. However, they typically treat future latent states as prediction targets or auxiliary signals, rather than directly conditioning trajectory planning. This can entangle current and future features in latent space. In this work, we propose DriveFuture, a future-aware latent world modeling framework for autonomous driving that explicitly learns planning-oriented foresight by conditioning the current latent state modeling process on future world states. Specifically, during training, the model first predicts future latent world states from the current latent state and ego action, and then refines the prediction against the ground-truth future latent state via cross-attention. The resulting future-aware latent serves as an explicit condition for a diffusion-based trajectory planner. During inference, DriveFuture conditions on the predicted future latent state instead of the ground-truth future state. DriveFuture achieves SOTA performance on the public NAVSIM benchmarks, reaching \textbf{55.5} EPDMS on NAVSIM-v2 {\textcolor{blue}{\textit{navhard}}}, \textbf{89.9} EPDMS on NAVSIM-v2 {\textcolor{blue}{\textit{navtest}}}, and \textbf{90.7} PDMS on NAVSIM-v1 {\textcolor{blue}{\textit{navtest}}}, respectively. These results suggest that the key to latent world modeling lies not merely in simulating future states, but more importantly in conditioning current decision-making on future states. Notably, as of April 2026, DriveFuture ranks \textbf{1st} on the \href{https://huggingface.co/spaces/AGC2025/e2e-driving-navhard}{NAVSIM-v2 {\textcolor{blue}{\textit{navhard}}}} leaderboard and achieves SOTA performance on \href{https://huggingface.co/spaces/AGC2024-P/e2e-driving-navtest}{NAVSIM-v1 {\textcolor{blue}{\textit{navtest}}}}.