ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

TL;DR

ForgeDrive通过视觉-动作双向交叉条件生成,在NAVSIM上实现90.3 EPDMS,统一驾驶模拟与规划。

cs.CV 🔴 高级 2026-06-30 38 次浏览
Xuchang Zhong He Zheng Chenxu Zhao Tianxiong Lv Hangqi Fan Bohua Wang Yushan Liu Li Gao Zhihao Liao Leigang Luo Congyang Zhao Yang Cai
自动驾驶 扩散模型 视觉生成 动作规划 跨模态学习

核心发现

方法论

ForgeDrive采用自回归扩散框架,通过视觉与动作的双向交叉条件生成,结合UniDiffuser噪声调度器,逐步生成未来帧与动作,同时预测车辆状态。

关键结果

  • 在NAVSIM v2上,ForgeDrive实现90.3 EPDMS,超越DreamAD和Latent-WAM,展现卓越的规划性能。
  • 视频生成质量以69.2 FVD领先,支持120秒长时间滚动,远超其他方法。
  • 在轨迹预测中,ADE达到0.11米,与专用视觉里程计DPVO的0.09米接近。

研究意义

该研究统一了驾驶模拟、规划和视觉里程计,解决了现有方法中视觉生成误差传递至动作规划的难题,为自动驾驶领域提供了更高效和鲁棒的解决方案。

技术贡献

ForgeDrive通过解耦扩散时间步和双向交叉条件生成,首次实现视觉与动作的深度耦合。其“先动作后想象”策略显著提高了生成质量。

新颖性

ForgeDrive首次提出“先动作后想象”生成范式,与传统的“先想象后动作”相比,显著减少了视觉误差对动作规划的影响。

局限性

  • 模型对高动态场景的预测仍有局限,可能出现轨迹偏移。
  • 需要较高计算资源,推理时间较长。

未来方向

未来可探索更高效的扩散模型架构,以及对复杂环境中动态目标的鲁棒预测。

AI 总览摘要

现有的自动驾驶方法通常采用“先想象后动作”的范式,但视觉生成阶段的误差会传递至动作规划,影响整体性能。ForgeDrive提出了一种统一的自回归扩散框架,通过视觉与动作的双向交叉条件生成,采用“先动作后想象”的策略逐步生成未来帧与动作,同时预测车辆状态。

在NAVSIM基准测试中,ForgeDrive实现了90.3的EPDMS,超越了多个强基线方法,包括DreamAD和Latent-WAM。此外,其视频生成质量以69.2的FVD领先,支持长达120秒的滚动生成,展现了卓越的长时间预测能力。

尽管ForgeDrive在性能上表现出色,但其对高动态场景的预测仍有局限,且推理时间较长。未来研究可探索更高效的模型架构以及对复杂环境的适应性提升。

深度分析

研究背景

自动驾驶领域近年来取得了显著进展,特别是在基于世界模型的方法中,这些方法通过预测未来场景来提高规划质量。然而,现有方法通常采用“先想象后动作”的范式,视觉生成阶段的误差会影响后续动作规划,导致性能下降。

核心问题

现有方法中视觉生成误差的累积是一个关键问题,特别是在长时间预测中,这种误差会显著影响轨迹规划的准确性和鲁棒性。

核心创新

ForgeDrive提出了“先动作后想象”的生成范式,通过解耦视觉与动作的扩散时间步,并引入UniDiffuser噪声调度器,实现视觉与动作的深度耦合,显著减少了误差传递。

方法详解

  • �� 使用自回归扩散框架逐步生成未来帧与动作。
  • �� 采用UniDiffuser噪声调度器实现视觉与动作的双向交叉条件生成。
  • �� 在每个时间步预测车辆状态,确保物理一致性。
  • �� 通过滑动窗口更新历史信息,逐步生成长时间轨迹。

实验设计

实验在NAVSIM基准测试上进行,采用PDMS和EPDMS作为主要评估指标,同时使用FVD评估视频生成质量,并比较与多种基线方法的性能。

结果分析

ForgeDrive在NAVSIM v2上实现了90.3 EPDMS,超越DreamAD和Latent-WAM;视频生成质量以69.2 FVD领先;轨迹预测的ADE达到0.11米,与DPVO接近。

应用场景

该方法可直接应用于自动驾驶系统的规划模块,同时适用于需要长时间预测的场景,如城市交通管理。

局限与展望

模型对高动态场景的预测仍有局限,可能出现轨迹偏移;计算资源需求较高,推理时间较长。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。ForgeDrive就像一个智能助手,它先根据你的动作预测接下来需要的食材,然后根据这些食材调整下一步的动作。这种“先动作后想象”的方式避免了因为错误估计食材而导致的烹饪失败。

简单解释 像给14岁少年讲一样

想象你在玩赛车游戏。ForgeDrive就像一个超级AI队友,它先预测你要转弯,然后根据这个动作生成接下来的赛道画面。这种方式让它总能帮你跑出最好的成绩!

术语表

扩散模型 (Diffusion Model)

一种生成模型,通过逐步去噪生成目标数据。

用于生成未来帧和动作。

自回归 (Autoregressive)

一种逐步生成数据的方法,每一步依赖前一步的输出。

用于逐步生成帧与动作。

UniDiffuser

一种多模态扩散框架,支持跨模态条件生成。

用于视觉与动作的双向交叉条件生成。

EPDMS

一种评估自动驾驶规划性能的指标。

用于评估NAVSIM基准测试中的性能。

FVD

评估视频生成质量的指标,衡量生成视频的真实感。

用于比较视频生成质量。

开放问题 这项研究留下的未解疑问

  • 1 如何在高动态场景中进一步提高预测鲁棒性?
  • 2 是否可以降低计算资源需求以提高推理效率?

应用场景

近期应用

自动驾驶规划

通过视觉与动作的深度耦合,提高轨迹规划的准确性和鲁棒性。

城市交通管理

支持长时间预测,为交通流量优化提供数据支持。

远期愿景

全自动驾驶系统

实现端到端的驾驶模拟与规划,推动完全无人驾驶技术的落地。

原文摘要

World-model-based autonomous driving endows the model with the ability to understand scene evolution. Yet this promise is undermined by the prevailing imagine-then-act paradigm, which allows errors from the more challenging visual generation stage to cascade into action planning. We introduce ForgeDrive, a unified autoregressive diffusion framework with visual-action cross-conditioning that closes this gap through act-then-imagine paradigm. ForgeDrive factorizes the future as a sequence of per-timestep frame-action pairs, intertwining each action with its corresponding visual observation. During training, we decouple the diffusion timesteps of the two modalities and introduce a UniDiffuser-style noise scheduler to get the ability to infer either modality from its counterpart and deepen understanding of relationships between images and actions. At inference, we propose a novel act-then-imagine inference paradigm, and find that at each step, action generation is a capability internalized during training, requiring no clean future frame as a prerequisite at inference time; instead, the generated action can improve the accuracy of future frame generation, which in turn enhances the quality of the next action. Additionally, we augment each step with future ego-status prediction, further sharpening planning ability. Extensive experiments on NAVSIM demonstrate that ForgeDrive not only unifies driving simulation, planning, and visual odometry into a single model, but also outperforms existing strong planners without any post-training strategy.

cs.CV