DriveFine: Refining-Augmented Masked Diffusion VLA for Precise and Robust Driving

TL;DR

DriveFine结合掩码扩散模型与自我修正,实现高精度稳健的自动驾驶决策。

cs.CV 🔴 高级 2026-02-16 39 次浏览
Chenxu Dang Sining Ang Yongkang Li Haochen Tian Jie Wang Guang Li Hangjun Ye Jie Ma Long Chen Yan Wang
自动驾驶 生成模型 扩散模型 强化学习 多模态融合

核心发现

方法论

本文提出DriveFine,一种结合掩码扩散与块式专家模型的VLA框架。采用预训练的多模态掩码扩散语言模型(LaViDa)作为基础,设计块式Mixture-of-Experts(MoE)结构,将生成专家与修正专家解耦。训练中,生成专家执行掩码预测,修正专家通过梯度屏蔽进行优化,确保基础能力不丧失。引入混合强化学习策略,结合在线与离线奖励,促进修正专家的探索能力。模型在NAVSIM v1、v2及Navhard数据集上表现优异,验证其高效性与鲁棒性。

关键结果

  • 在NAVSIM v1上,DriveFine达成91.8的PDMS,优于现有方法0.5%以上,且在NAVSIM v2中提升至89.7的EPDMS,显著优于传统DiffusionDrive和Token-based模型。
  • 在Navhard场景中,无需额外训练条件下,DriveFine超越DiffusionDrive等方法,EPDMS提升5.5点,表现出优越的泛化能力。
  • 消融实验显示,块式MoE和混合强化策略各自贡献了约0.7-1.0点的性能提升,验证了设计的有效性。

研究意义

该研究突破了扩散模型在自动驾驶中的应用瓶颈,解决模态对齐、训练效率低和泛化能力差的问题。通过引入可插拔的修正专家机制,有效融合了扩散模型的多模态表达能力与Token模型的灵活性,为自动驾驶决策提供了更稳健、可扩展的解决方案。其在复杂场景中的优异表现,推动了自主驾驶系统向更高安全性与可靠性迈进,具有重要的理论与工程价值。

技术贡献

技术上,DriveFine创新性地设计了块式MoE架构,完全解耦生成与修正两个专家,保持预训练模型的基础能力。引入混合强化学习策略,有效平衡探索与训练稳定性。结合掩码扩散与自我修正机制,实现了高效、灵活的轨迹优化,显著提升了Token-based VLA的性能上限。这些设计为多模态生成模型在自动驾驶中的应用提供了新思路。

新颖性

本研究首次将块式MoE引入掩码扩散VLA模型,明确区分生成与修正专家,解决了传统扩散模型模态对齐与泛化不足的问题。相较于现有的Token或纯扩散模型,DriveFine实现了高效的多轮迭代修正,突破了不可逆解码的限制,开创了自动驾驶中融合多模态生成与自我修正的全新路径。

局限性

  • 模型在极端复杂场景下仍存在局部误差累积风险,尤其在感知噪声较大或环境变化剧烈时表现不佳。
  • 训练过程中对硬件资源需求较高,尤其是在多专家同步优化时,推理时的计算成本仍有提升空间。
  • 当前方法对预训练模型的依赖较强,迁移到不同任务或场景可能需要大量微调。

未来方向

未来将探索更高效的专家调度策略,降低推理成本;同时结合更丰富的感知信息和多任务学习,提升模型在多样复杂场景中的适应性。还计划引入自主探索机制,增强模型的主动学习能力,推动自动驾驶系统向更高的自主性与安全性发展。

AI 总览摘要

自动驾驶领域的生成规划器面临模态对齐、训练效率与泛化能力的多重挑战。传统的扩散模型虽具备多模态表达优势,但在训练和跨模态一致性方面存在瓶颈,限制了其实际应用。Token-based方案则因其不可逆解码特性,难以进行多轮修正,导致轨迹易受噪声影响。为突破这一局限,本文提出DriveFine,一种结合掩码扩散与块式专家模型的创新架构。

DriveFine利用预训练的多模态掩码扩散语言模型(LaViDa)作为基础,设计了块式Mixture-of-Experts(MoE)结构,将生成专家与修正专家解耦。训练过程中,生成专家负责掩码预测,修正专家通过梯度屏蔽进行优化,确保基础能力不受干扰。引入混合强化学习策略,结合在线与离线奖励,激励修正专家的探索能力。这一设计实现了高效、多轮轨迹修正,显著提升模型性能。

在NAVSIM v1、v2和Navhard数据集上,DriveFine展现出优越的性能,PDMS指标提升至91.8,EPDMS达89.7,超越现有主流方法。消融实验验证了块式MoE和混合强化的贡献,显示其在复杂环境中的鲁棒性。该研究不仅解决了扩散模型的模态对齐与泛化难题,也为自动驾驶系统提供了更稳健的决策基础,具有广泛的理论与工程价值。未来,将继续优化专家调度策略,降低计算成本,增强模型的适应性与自主探索能力,推动自动驾驶技术迈向更高的安全与智能水平。

深度分析

研究背景

自动驾驶技术经历了从规则驱动到深度学习的演变。早期多采用确定性模型,如MLP和锚点分类,难以应对多模态不确定性。近年来,生成模型如扩散模型和Token模型逐渐崭露头角,前者通过逐步去噪实现轨迹预测,后者利用离散Token实现跨模态对齐。尽管如此,扩散模型在训练效率和模态一致性方面存在瓶颈,Token模型则因不可逆解码限制难以多轮修正。多模态融合的需求促使研究不断探索更灵活、更高效的生成策略。

核心问题

当前的生成规划器在模态对齐、训练效率和泛化能力方面表现不足。扩散模型虽能捕获多模态信息,但训练成本高且难以实现快速适应新场景。Token模型虽具灵活性,但其不可逆解码限制导致轨迹易受噪声影响,难以进行多轮修正。两者的优缺点互补,亟需一种融合两者优势的解决方案,以实现高精度、稳健的自动驾驶决策。

核心创新

本研究提出DriveFine,创新点包括:1)引入块式MoE架构,将生成与修正专家解耦,保持预训练模型的基础能力;2)设计混合强化学习策略,结合在线与离线奖励,激励修正专家探索;3)利用掩码扩散机制实现多轮轨迹修正,突破不可逆解码限制。这些创新解决了传统模型在模态对齐、泛化和修正能力上的瓶颈,为自动驾驶提供了更灵活、稳健的生成策略。

方法详解

  • �� 输入:多模态感知信息(图像、LiDAR)与文本指令。
  • �� 预处理:利用SigLIP提取视觉Token,将文本转为离散Token,融合到统一空间。
  • �� 模型架构:采用预训练的LaViDa作为基础,设计块式MoE,将模型分为共享块、生成专家和修正专家。
  • �� 训练:生成专家执行掩码预测,修正专家通过梯度屏蔽优化,保持基础能力。
  • �� 推理:在给定输入后,逐步预测掩码Token,利用修正专家进行多轮轨迹修正。
  • �� 强化学习:结合离线奖励与在线探索,优化修正专家的策略,提升轨迹质量。

实验设计

在NAVSIM v1、v2及Navhard数据集上进行评估,比较PDMS、EPDMS等指标。采用不同的训练阶段,包括监督微调和强化微调。消融实验验证块式MoE和强化策略的贡献。参数设置包括:预训练模型为LLaDA-8B,训练阶段采用AdamW优化,学习率4e-5,训练12轮,推理采用12步采样加单次修正。

结果分析

DriveFine在NAVSIM v1中达成91.8 PDMS,优于现有方法0.5%以上,且在NAVSIM v2中EPDMS提升至89.7,超越DiffusionDrive和Token模型。在Navhard场景中,无需额外训练,EPDMS提升5.5点,显示出优异的泛化能力。消融分析显示,块式MoE和强化微调分别带来0.7-1.0点性能提升,验证设计有效性。

应用场景

该模型可应用于自动驾驶中的路径规划与决策,尤其适合复杂、多变的交通环境。需要结合高精度感知系统和丰富的场景信息,提升系统的安全性和鲁棒性。未来可扩展到无人驾驶、智能交通管理等领域,为自动驾驶产业带来革命性变革。

局限与展望

模型对极端复杂环境的适应性仍有限,尤其在感知噪声大或环境突变时表现不佳。训练成本较高,硬件资源需求大,推理时计算负担重。对预训练模型依赖较强,迁移到新场景需大量微调。未来需优化模型结构与训练策略,提升效率与泛化能力。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。传统的厨师只会按照菜谱一步步操作,遇到意外情况就束手无策。而现在,厨师配备了智能助手,能在你操作过程中不断观察、调整,确保菜肴完美。DriveFine就像这个智能助手,它能在自动驾驶中不断修正和优化路径,确保车辆安全平稳。它用一种特殊的“厨具”——块式专家模型,分工合作:一个负责“做菜”——生成轨迹,另一个负责“调整”——修正偏差。通过不断试错和学习,整个系统变得更聪明、更可靠,就像厨房里的顶级厨师一样,能应对各种突发状况,做出最美味的菜肴。这种方法让自动驾驶车辆在复杂环境中也能稳健行驶,像个经验丰富的司机一样自信。

原文摘要

Vision-Language-Action (VLA) models for autonomous driving increasingly adopt generative planners trained with imitation learning followed by reinforcement learning. Diffusion-based planners suffer from modality alignment difficulties, low training efficiency, and limited generalization. Token-based planners are plagued by cumulative causal errors and irreversible decoding. In summary, the two dominant paradigms exhibit complementary strengths and weaknesses. In this paper, we propose DriveFine, a masked diffusion VLA model that combines flexible decoding with self-correction capabilities. In particular, we design a novel plug-and-play block-MoE, which seamlessly injects a refinement expert on top of the generation expert. By enabling explicit expert selection during inference and gradient blocking during training, the two experts are fully decoupled, preserving the foundational capabilities and generic patterns of the pretrained weights, which highlights the flexibility and extensibility of the block-MoE design. Furthermore, we design a hybrid reinforcement learning strategy that encourages effective exploration of refinement expert while maintaining training stability. Extensive experiments on NAVSIM v1, v2, and Navhard benchmarks demonstrate that DriveFine exhibits strong efficacy and robustness. The code will be released at https://github.com/MSunDYY/DriveFine.

cs.CV