ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving
ForgeDrive通过视觉-动作双向交叉条件生成,在NAVSIM上实现90.3 EPDMS,统一驾驶模拟与规划。
核心发现
方法论
ForgeDrive采用自回归扩散框架,通过视觉与动作的双向交叉条件生成,结合UniDiffuser噪声调度器,逐步生成未来帧与动作,同时预测车辆状态。
关键结果
- 在NAVSIM v2上,ForgeDrive实现90.3 EPDMS,超越DreamAD和Latent-WAM,展现卓越的规划性能。
- 视频生成质量以69.2 FVD领先,支持120秒长时间滚动,远超其他方法。
- 在轨迹预测中,ADE达到0.11米,与专用视觉里程计DPVO的0.09米接近。
研究意义
该研究统一了驾驶模拟、规划和视觉里程计,解决了现有方法中视觉生成误差传递至动作规划的难题,为自动驾驶领域提供了更高效和鲁棒的解决方案。
技术贡献
ForgeDrive通过解耦扩散时间步和双向交叉条件生成,首次实现视觉与动作的深度耦合。其“先动作后想象”策略显著提高了生成质量。
新颖性
ForgeDrive首次提出“先动作后想象”生成范式,与传统的“先想象后动作”相比,显著减少了视觉误差对动作规划的影响。
局限性
- 模型对高动态场景的预测仍有局限,可能出现轨迹偏移。
- 需要较高计算资源,推理时间较长。
未来方向
未来可探索更高效的扩散模型架构,以及对复杂环境中动态目标的鲁棒预测。
AI 总览摘要
现有的自动驾驶方法通常采用“先想象后动作”的范式,但视觉生成阶段的误差会传递至动作规划,影响整体性能。ForgeDrive提出了一种统一的自回归扩散框架,通过视觉与动作的双向交叉条件生成,采用“先动作后想象”的策略逐步生成未来帧与动作,同时预测车辆状态。
在NAVSIM基准测试中,ForgeDrive实现了90.3的EPDMS,超越了多个强基线方法,包括DreamAD和Latent-WAM。此外,其视频生成质量以69.2的FVD领先,支持长达120秒的滚动生成,展现了卓越的长时间预测能力。
尽管ForgeDrive在性能上表现出色,但其对高动态场景的预测仍有局限,且推理时间较长。未来研究可探索更高效的模型架构以及对复杂环境的适应性提升。
深度分析
研究背景
自动驾驶领域近年来取得了显著进展,特别是在基于世界模型的方法中,这些方法通过预测未来场景来提高规划质量。然而,现有方法通常采用“先想象后动作”的范式,视觉生成阶段的误差会影响后续动作规划,导致性能下降。
核心问题
现有方法中视觉生成误差的累积是一个关键问题,特别是在长时间预测中,这种误差会显著影响轨迹规划的准确性和鲁棒性。
核心创新
ForgeDrive提出了“先动作后想象”的生成范式,通过解耦视觉与动作的扩散时间步,并引入UniDiffuser噪声调度器,实现视觉与动作的深度耦合,显著减少了误差传递。
方法详解
- �� 使用自回归扩散框架逐步生成未来帧与动作。
- �� 采用UniDiffuser噪声调度器实现视觉与动作的双向交叉条件生成。
- �� 在每个时间步预测车辆状态,确保物理一致性。
- �� 通过滑动窗口更新历史信息,逐步生成长时间轨迹。
实验设计
实验在NAVSIM基准测试上进行,采用PDMS和EPDMS作为主要评估指标,同时使用FVD评估视频生成质量,并比较与多种基线方法的性能。
结果分析
ForgeDrive在NAVSIM v2上实现了90.3 EPDMS,超越DreamAD和Latent-WAM;视频生成质量以69.2 FVD领先;轨迹预测的ADE达到0.11米,与DPVO接近。
应用场景
该方法可直接应用于自动驾驶系统的规划模块,同时适用于需要长时间预测的场景,如城市交通管理。
局限与展望
模型对高动态场景的预测仍有局限,可能出现轨迹偏移;计算资源需求较高,推理时间较长。
通俗解读 非专业人士也能看懂
想象你在厨房做饭。ForgeDrive就像一个智能助手,它先根据你的动作预测接下来需要的食材,然后根据这些食材调整下一步的动作。这种“先动作后想象”的方式避免了因为错误估计食材而导致的烹饪失败。
简单解释 像给14岁少年讲一样
想象你在玩赛车游戏。ForgeDrive就像一个超级AI队友,它先预测你要转弯,然后根据这个动作生成接下来的赛道画面。这种方式让它总能帮你跑出最好的成绩!
术语表
扩散模型 (Diffusion Model)
一种生成模型,通过逐步去噪生成目标数据。
用于生成未来帧和动作。
自回归 (Autoregressive)
一种逐步生成数据的方法,每一步依赖前一步的输出。
用于逐步生成帧与动作。
UniDiffuser
一种多模态扩散框架,支持跨模态条件生成。
用于视觉与动作的双向交叉条件生成。
EPDMS
一种评估自动驾驶规划性能的指标。
用于评估NAVSIM基准测试中的性能。
FVD
评估视频生成质量的指标,衡量生成视频的真实感。
用于比较视频生成质量。
开放问题 这项研究留下的未解疑问
- 1 如何在高动态场景中进一步提高预测鲁棒性?
- 2 是否可以降低计算资源需求以提高推理效率?
应用场景
近期应用
自动驾驶规划
通过视觉与动作的深度耦合,提高轨迹规划的准确性和鲁棒性。
城市交通管理
支持长时间预测,为交通流量优化提供数据支持。
远期愿景
全自动驾驶系统
实现端到端的驾驶模拟与规划,推动完全无人驾驶技术的落地。
原文摘要
World-model-based autonomous driving endows the model with the ability to understand scene evolution. Yet this promise is undermined by the prevailing imagine-then-act paradigm, which allows errors from the more challenging visual generation stage to cascade into action planning. We introduce ForgeDrive, a unified autoregressive diffusion framework with visual-action cross-conditioning that closes this gap through act-then-imagine paradigm. ForgeDrive factorizes the future as a sequence of per-timestep frame-action pairs, intertwining each action with its corresponding visual observation. During training, we decouple the diffusion timesteps of the two modalities and introduce a UniDiffuser-style noise scheduler to get the ability to infer either modality from its counterpart and deepen understanding of relationships between images and actions. At inference, we propose a novel act-then-imagine inference paradigm, and find that at each step, action generation is a capability internalized during training, requiring no clean future frame as a prerequisite at inference time; instead, the generated action can improve the accuracy of future frame generation, which in turn enhances the quality of the next action. Additionally, we augment each step with future ego-status prediction, further sharpening planning ability. Extensive experiments on NAVSIM demonstrate that ForgeDrive not only unifies driving simulation, planning, and visual odometry into a single model, but also outperforms existing strong planners without any post-training strategy.