CLEAR: Cognition and Latent Evaluation for Adaptive Routing in End-to-End Autonomous Driving

TL;DR

CLEAR框架结合Drive-JEPA和单步潜在空间漂移,实现高效多模态自主驾驶路径预测,PDMS达93.7。

cs.RO 🔴 高级 2026-06-04 47 次浏览
Yining Xing Zehong Ke Zhiyuan Liu Yanbo Jiang Wenhao Yu Jianqiang Wang
自主驾驶 生成模型 深度语义推理 路径规划 大模型

核心发现

方法论

该方法采用Drive-JEPA作为视觉编码器,利用VAE潜在空间中的单步条件漂移替代传统多步去噪链,结合Qwen 3.5 0.8B大模型提取场景语义状态。通过引入条件系数α调节多样性与专家精度,设计自适应调度器根据场景复杂度动态调整采样参数。利用交叉注意力评分器从候选路径中选择最优路径。整体架构实现了在无需密集几何标注和迭代采样的情况下,达到93.7的PDMS,且运行速度高达99FPS。

关键结果

  • 在NAVSIM v1基准测试中,CLEAR超越现有方法,PDMS达93.7,显著提升安全性指标如碰撞和车道偏离,优于DriveSuprim(93.5)和Drive-JEPA(93.3)。在v2协议中,EPDMS达88.6,表现优异。单步潜在漂移保证多模态覆盖,避免繁琐几何重建,验证了模型在复杂交通场景中的鲁棒性。
  • 通过消融实验,验证交叉注意力评分器和自适应调度器的贡献,前者提升PDMS从93.1到93.3,后者再提升至93.7,显示模块协同作用显著。训练过程中,模型在不同场景下的多样性调节效果良好,场景复杂度与漂移系数α的关系得到验证。
  • 在不同交通场景中,CLEAR展现了优异的多模态路径生成能力,尤其在复杂交叉口和高速公路场景中,路径多样性和安全性均优于基线,验证了其在实际应用中的潜力。

研究意义

该研究突破了传统基于密集几何标注和多步采样的路径规划瓶颈,提出高效、端到端的多模态生成方案,极大缩短推理时间,提升安全性。模型充分利用大模型的语义理解能力,将深层次交通语义融入路径生成,推动自主驾驶系统向更智能、更可靠方向发展。这一方法为未来实现低成本、高性能的自动驾驶提供了新思路,具有重要的学术价值和工业应用潜力。

技术贡献

创新点在于将单步潜在空间漂移引入路径预测,结合Drive-JEPA的几何特征和Qwen大模型的语义状态,构建高效的生成与评估机制。提出自适应调度器根据场景复杂度动态调节采样参数,显著降低计算成本。交叉注意力评分器替代传统启发式评价,利用深层语义信息提升路径选择精度。这些技术突破实现了在无需繁琐几何重建和多次采样的情况下,获得高质量多模态路径,推动生成模型在自主驾驶中的应用边界。

新颖性

本研究首次将单步潜在漂移机制应用于自主路径预测,结合大模型的深层语义状态,创新性地实现了高效、多模态路径生成。不同于传统扩散模型的多步去噪,采用单步漂移极大提升推理速度,且引入场景感知的自适应调度,增强模型对复杂交通场景的适应能力。这些创新在理论和工程层面均为自主驾驶路径规划提供了新思路。

局限性

  • 当前调度器采用离散预定义方案,可能无法捕捉场景中最优的连续调节参数,影响模型的细粒度调控能力。
  • 模型训练流程复杂,涉及多阶段预训练(VAE、PCA、LLM微调)和多任务优化,增加了系统复杂性和调试难度。
  • 在极端复杂或极端高速场景下,模型仍存在路径多样性不足或安全性不足的风险,需进一步优化场景理解和多模态融合机制。

未来方向

未来将探索连续或可微调的调度策略,提升参数调节的细粒度和灵活性。同时,计划实现端到端联合训练,简化训练流程,增强模型整体一致性。此外,将结合多模态感知和强化学习,提升模型在极端复杂交通环境中的表现,推动自主驾驶系统的实用化和安全性提升。

AI 总览摘要

自主驾驶路径规划一直是智能交通领域的核心难题。传统方法依赖繁琐的几何重建和多次采样,计算成本高且难以满足实时性要求。近年来,扩散模型在多模态路径生成中表现出色,但其多步去噪机制带来巨大延迟,限制了实际应用。为突破这一瓶颈,本文提出CLEAR框架,结合Drive-JEPA的几何特征和Qwen大模型的深层语义状态,采用单步潜在空间漂移技术,实现高效、多模态路径预测。该方法通过引入场景感知的自适应调度器,动态调节生成多样性,利用交叉注意力评分器评估候选路径的安全性和合理性。在NAVSIM基准测试中,CLEAR达到了93.7的PDMS,超越现有最优方法,且运行速度高达99FPS。这一创新架构显著降低了路径规划的计算成本,提升了安全性,为未来自动驾驶系统的实用化提供了新思路。未来工作将致力于调度参数的连续优化和端到端训练,以实现更高的场景适应性和系统稳定性。整体而言,CLEAR展示了深度生成模型在自主驾驶中的巨大潜力,推动智能交通向更安全、更高效的方向发展。

深度分析

研究背景

自主驾驶技术经历了从模块化到端到端的演变,深度学习推动了感知、规划和控制的融合。早期方法依赖激光雷达和高精度地图,计算成本高且依赖繁琐的几何重建。近年来,视觉感知和深度学习模型如Drive-JEPA、MAE等逐步简化感知流程,提升了系统的鲁棒性。路径规划方面,传统基于规则和优化的算法难以应对复杂多变的交通场景。扩散模型等生成方法逐渐被引入,展现出多模态路径的潜力,但多步采样带来的延迟成为瓶颈。现有研究多集中在提升生成质量,缺乏高效、实时的解决方案。本文在此背景下,结合深度语义理解和潜在空间单步漂移,提出了新颖的路径预测框架,旨在解决实时性和多模态性之间的矛盾。

核心问题

自主驾驶在复杂交通环境中面临多模态路径生成的挑战。传统方法多依赖多步采样和几何重建,计算成本高,难以满足实时控制需求。同时,单一路径预测无法充分表达交通场景的多样性,影响安全性。如何在保证多模态覆盖的同时,提升推理速度和路径质量,成为核心难题。此外,场景理解的深度和语义信息的融入不足,限制了路径的合理性和安全性。解决这些问题,需要创新的模型架构和高效的生成机制。

核心创新

主要创新在于引入单步潜在空间漂移机制,替代传统多步去噪,显著提升推理速度。结合Drive-JEPA提供的几何特征和Qwen大模型的深层语义状态,实现多模态路径的高效生成。提出自适应调度器,根据场景复杂度动态调节漂移系数α和采样数量N,增强模型的场景适应性。利用交叉注意力评分器,将深层语义信息融入路径评估,超越传统启发式方法。这些创新共同推动了自主路径规划的效率和安全性,为端到端自主驾驶提供了新思路。

方法详解

  • �� 视觉编码:采用Drive-JEPA作为视觉特征提取器,输出几何结构信息;
  • �� 语义特征:利用微调的Qwen 3.5 0.8B模型提取场景语义状态,作为路径生成的条件信息;
  • �� 潜在漂移:在VAE潜在空间中实现单步条件漂移,结合正向吸引和排斥机制,生成多模态路径候选;
  • �� 条件调节:引入系数α调控多样性与精度,利用PCA确保路径的运动学合理性;
  • �� 自适应调度:训练调度器,根据场景复杂度动态选择α和N,优化计算资源分配;
  • �� 路径评分:用交叉注意力机制,将深层语义状态与候选路径匹配,评估安全性和合理性;
  • �� 训练流程:多阶段预训练VAE、微调LLM、训练调度器和评分器,确保模型稳定性和性能。

实验设计

在NAVSIM数据集上进行评估,采用PDMS和EPDMS作为主要指标。训练过程中,利用130,000条轨迹预训练VAE,17,000场景的驾驶问答对微调LLM,合成对比数据训练调度器和评分器。模型在不同复杂度场景中进行多样性调节,验证α的动态调控效果。对比基线包括Drive-JEPA、DiffusionDrive等,进行消融实验验证模块贡献。测试中,模型以99FPS速度生成路径,显著优于传统多步扩散模型,PDMS达93.7,安全性指标优异。模型在复杂交叉口和高速公路场景中表现出良好的多模态覆盖和路径合理性。

结果分析

在NAVSIM v1中,CLEAR实现PDMS 93.7,优于DriveSuprim(93.5)和Drive-JEPA(93.3),安全指标如碰撞和车道偏离显著改善。在v2协议中,EPDMS达88.6,表现优异。消融实验显示,交叉注意力评分器和调度器的引入分别提升PDMS 0.2和0.4点,验证其有效性。路径多样性和安全性在复杂交通场景中得到充分体现,模型在高速公路和交叉口场景中表现出强鲁棒性。整体结果表明,该方法在保持高效率的同时,显著提升路径规划的安全性和多模态表达能力。

应用场景

该模型适用于自动驾驶车辆的路径规划系统,尤其在复杂交叉口和高速公路场景中。只需视觉感知和交通问答数据,无需繁琐几何重建,便可实现高效多模态路径生成。可应用于智能交通管理、自动驾驶辅助系统,提升车辆安全性和行驶效率。未来,结合感知融合和强化学习,有望实现更复杂环境下的自主决策,推动自动驾驶产业的商业化落地。

局限与展望

模型调度器采用离散预定义方案,可能无法捕捉连续参数空间中的最优配置,影响调节精细度。训练流程复杂,涉及多阶段预训练和多任务优化,增加系统复杂性。在极端复杂或高速场景中,路径多样性不足或安全性不足仍存在风险。未来需优化调度策略,简化训练流程,并增强模型在极端场景中的鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,要准备各种食材、调味料,然后按照不同的菜谱做出多样的菜肴。传统方法就像每次都用慢慢试错的方式,反复调整火候和调料,既费时又不一定能做出满意的菜。而这篇论文提出了一种新方法,就像用一个聪明的厨师助手,它能在一瞬间根据场景变化,快速生成多种菜谱方案,并根据你的偏好选择最合适的那一道。它还会根据厨房的情况(比如食材新鲜度、时间紧张)自动调节菜谱的复杂度和多样性。这样,不仅节省了时间,还能保证每次都做出既美味又安全的菜肴。这个“厨师助手”就是用深度学习和大模型技术打造的智能路径规划系统,能在复杂交通环境中快速、准确地帮车辆找到最优路线,就像厨房里的超级厨师一样聪明。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的游戏,你需要在很多不同的场景中找到最好的行动路线。有时候场景很简单,比如在家门口走路,就只需要直走;但有时候场景很复杂,比如在繁忙的街道交叉口,你可能要考虑很多因素,比如车流、行人、交通信号灯。以前的方法就像用一把尺子测量每一条可能的路线,然后反复试验,既慢又不够智能。而这篇论文介绍的系统,就像有个非常聪明的机器人助手,它可以在一瞬间根据场景的复杂程度,快速生成多种可能的路线方案,然后帮你挑选出最安全、最合适的那一条。它还会根据交通情况自动调节生成的方案多样性,确保在简单场景中快速完成,在复杂场景中考虑更多可能。这样,车辆就能像你有个聪明的助手一样,快速做出安全的决定,避免碰撞和迷路。这个技术就像你在游戏中拥有一个超级智能的伙伴,帮你轻松应对各种挑战,既快又安全!

原文摘要

End-to-end autonomous driving models often struggle to balance multi-modal maneuver generation with real-time inference constraints. While diffusion models successfully capture diverse driving behaviors, their iterative denoising process incurs unacceptable latency for safety-critical deployment. To address this, we propose CLEAR (Cognition and Latent Evaluation for Adaptive Routing), a framework that combines ultra-fast generative planning with deep semantic reasoning. CLEAR employs Drive-JEPA as the visual encoder and replaces the multi-step denoising chain with a single-step conditional drift in a VAE latent space, introducing a conditioning coefficient to balance diversity and expert precision. Meanwhile, we fully fine-tune Qwen~3.5~0.8B on driving QA pairs to extract scene-aware hidden states. These states guide both an Adaptive Scheduler, which selects the conditioning coefficient $α$ and sample count $N$ from a discrete set of predefined schemes, and a cross-attention scorer that selects the optimal trajectory from candidates. On the NAVSIM v1 benchmark, CLEAR achieves a state-of-the-art PDMS of 93.7. Our results demonstrate that high-fidelity, multi-modal planning can be executed efficiently without dense geometric annotations or iterative sampling.

cs.RO cs.AI