UniTeD: Unified Temporal Diffusion for Joint Perception and Planning in Autonomous Driving

TL;DR

UniTeD提出联合时间扩散模型,实现感知与规划的端到端融合,显著提升鲁棒性。

cs.CV 🔴 高级 2026-06-24 45 次浏览
Bo Zhao Xinting Zhao Naifan Li Erkang Cheng Haibin Ling
自主驾驶 扩散模型 多任务学习 时间建模 端到端系统

核心发现

方法论

UniTeD采用统一的时间扩散解码器,通过在共享生成空间中同时对感知(如动态目标、地图)和规划(轨迹预测)任务进行迭代去噪。引入Temporal Transition Module(TTM)解决历史与当前帧噪声水平不匹配问题,结合Anchor Refresh Strategy(ARS)缓解训练与推理分布偏移。模型利用多视角图像特征,结合多任务噪声条件训练,实现多模态、多任务的联合优化,增强模型的鲁棒性和泛化能力。

关键结果

  • 在NAVSIM v1和v2基准测试中,UniTeD分别取得90.24和90.13的PDMS和EPDMS指标,超越多项最新端到端方法。在Bench2Drive中,Driving Score达87.25,优于现有的DiffusionDrive和Discriminative模型。多任务联合训练显著降低感知误差传播,提升轨迹预测的多模态表现,验证了模型在复杂场景下的稳定性和准确性。
  • 通过引入Temporal Transition Module,有效缓解历史帧与当前帧噪声水平差异,提升时间连续性。ARS策略在训练推理中保持分布一致性,减少推理偏差。多视角特征融合和多任务噪声条件训练增强了模型的泛化能力,适应多样化驾驶环境。
  • 实验证明UniTeD在多个公开数据集上均优于现有的端到端感知-规划模型,特别是在多模态、多任务联合优化方面表现出色,展现了其在自动驾驶中的潜力。

研究意义

该研究突破了传统感知与规划的解耦限制,通过联合建模提升了系统整体鲁棒性和多模态表达能力。引入时间建模和噪声条件训练,有效缓解了多任务间的误差传播和训练-推理偏移问题,为自动驾驶的端到端系统提供了新思路。模型的高性能验证了扩散模型在复杂动态场景中的应用潜力,为未来实现更安全、更智能的自动驾驶奠定基础。

技术贡献

UniTeD创新性地将扩散模型应用于感知与规划的联合建模,突破了以往仅在规划模块使用扩散的限制。引入Temporal Transition Module和Anchor Refresh Strategy,解决时间连续性和训练偏移问题。模型采用多任务噪声条件训练,增强多模态鲁棒性,显著优于现有的端到端方法,为多任务多模态自动驾驶提供了全新技术框架。

新颖性

首次将时间连续性和多任务联合扩散建模引入自动驾驶,突破了传统单帧、单任务的限制。UniTeD通过共享生成空间实现感知与规划的深度交互,结合时间建模与训练偏移缓解策略,展现出在多模态、多任务场景中的优越性能。这在自动驾驶领域尚属首次,具有重要创新意义。

局限性

  • 模型在极端复杂场景下仍存在推理偏差,尤其在感知误差较大或环境变化剧烈时表现不佳。多任务联合训练对计算资源要求较高,训练时间长,模型复杂度较大。未来需优化模型结构以降低计算成本,同时增强对极端环境的适应能力。

未来方向

未来将探索更高效的时间建模机制,结合强化学习优化决策策略,提升模型在长时序和复杂场景中的表现。还将研究多模态信息融合的深度自适应策略,增强模型对环境变化的鲁棒性。此外,计划将模型部署于实际自动驾驶平台,验证其在真实道路环境中的实用性和安全性。

AI 总览摘要

随着自动驾驶技术的不断发展,端到端感知与规划的融合成为提升系统鲁棒性和效率的关键。传统方法多采用模块化设计,容易受到感知误差的影响,导致规划不稳定。近年来,扩散模型在多模态生成任务中展现出强大潜力,但多数学术工作仅将其应用于规划模块,忽视了感知任务的联合优化。为解决这一瓶颈,UniTeD提出了一种全新的联合时间扩散框架,通过在共享生成空间中同时对感知和规划任务进行迭代去噪,实现了深度交互和互相优化。模型引入Temporal Transition Module(TTM)解决历史与当前帧噪声水平不匹配的问题,结合Anchor Refresh Strategy(ARS)缓解训练与推理中的分布偏移。这一创新设计极大提升了多模态、多任务的鲁棒性和泛化能力,在多个公开数据集上均优于现有的端到端方法。实验证明,UniTeD在NAVSIM和Bench2Drive中取得了优异的性能,验证了其在复杂动态场景中的应用潜力。该研究不仅推动了扩散模型在自动驾驶中的应用边界,也为未来实现更安全、更智能的自动驾驶系统提供了坚实基础。未来工作将聚焦于模型的计算效率优化和实际部署验证,期待引领自动驾驶向更高水平迈进。

深度分析

研究背景

自动驾驶经历了从模块化到端到端的转变,早期依赖复杂的感知、预测和规划子系统。代表性工作如Apollo、Waymo采用分阶段设计,逐步实现感知到决策的自动化。近年来,深度学习推动了端到端系统的发展,如End-to-End Learning和Transformer架构,显著简化了流程。扩散模型作为生成式方法在图像、轨迹预测等任务中表现优异,但多数学术工作仅在规划阶段应用,忽视感知的联合优化。感知误差的传播、时间连续性不足、训练推理偏移成为主要瓶颈。当前研究正朝着多模态、多任务联合建模方向发展,试图解决感知与规划的深度融合问题,推动自动驾驶系统向更鲁棒、更智能的方向迈进。

核心问题

现有端到端方法多采用分离或有限交互的感知与规划模型,难以应对复杂多变的场景。感知误差在传递到规划时会放大,导致轨迹不稳定。时间连续性不足使得模型难以捕捉动态变化,训练过程中存在偏移问题,影响推理一致性。如何实现感知与规划的深度融合、增强时间建模能力、缓解训练推理偏差,成为亟待解决的核心问题。这些问题限制了模型在真实环境中的应用效果,亟需创新性解决方案。

核心创新

UniTeD的核心创新在于引入联合时间扩散模型,将感知和规划任务在共享生成空间中同时进行迭代去噪,打破传统的任务隔离。通过Temporal Transition Module(TTM)解决历史与当前帧噪声水平不匹配,确保时间连续性。Anchor Refresh Strategy(ARS)则缓解训练-推理中的分布偏移,保持模型稳定。模型采用多任务噪声条件训练,增强多模态鲁棒性。整体架构实现了多任务、多模态的深度交互,显著优于现有单一任务或分离模型,为自动驾驶提供了全新技术路径。

方法详解

  • �� 提取多视角图像特征作为输入。• 定义多任务锚点集(感知、地图、规划),在高斯噪声中采样。• 将锚点投影到共享潜空间,形成联合查询。• 构建统一扩散解码器,进行多轮去噪,逐步恢复任务状态。• 引入TTM,利用历史特征与当前噪声水平对齐。• 采用多任务噪声条件训练,增强模型鲁棒性。• 利用ARS在推理中动态刷新低置信度锚点,保持分布一致。• 最终通过任务特定头输出感知、轨迹和地图预测。

实验设计

模型在NAVSIM(v1和v2)和Bench2Drive数据集上进行评估。采用ResNet-34作为特征提取器,训练采用AdamW优化器,批次64,学习率4e-4。在推理中,采用2步去噪,结合置信度阈值筛选预测。对比多项最新端到端方法,UniTeD在PDMS、EPDMS、Driving Score等指标上均优越,验证其在多场景、多模态、多任务环境中的优越性能。还进行了消融实验,验证TTM和ARS的有效性。

结果分析

UniTeD在NAVSIMv1中PDMS达90.24,EPDMS为90.13,均优于DiffusionDrive和传统判别模型。在Bench2Drive中,Driving Score达87.25,成功应对复杂交互场景。引入时间建模和偏移缓解策略,显著提升多模态轨迹预测的稳定性和准确性。模型在多任务联合训练中表现出优异的泛化能力,验证了其在实际自动驾驶中的应用潜力。

应用场景

该模型适用于自动驾驶中的多模态感知与路径规划,特别是在复杂交通环境中。可部署于未来的智能汽车平台,提升自主系统的安全性和鲁棒性。长远来看,结合强化学习和在线适应,将推动自动驾驶技术的商业化和规模化应用。

局限与展望

模型在极端天气或感知严重受损时仍存在性能下降的问题。训练成本较高,模型复杂度大,部署难度较大。未来需优化模型结构,降低计算需求,并增强对极端环境的适应能力。

通俗解读 非专业人士也能看懂

想象你在厨房做饭。不同的厨具、食材和调料代表感知、地图和路径规划。传统方法像是先准备好所有食材,再逐步做菜,容易出错。现在,UniTeD像是用一个智能厨师,它可以同时考虑所有食材和菜谱,边做边调整,确保每一步都完美。它会记住之前的操作,知道什么时候需要多放点盐,什么时候要多搅拌。这样,做出来的菜既好吃又快,而且不会因为某个步骤出错而影响整体。这个“厨师”用一种特别的“思考方式”不断改进,确保每次都做得更好。就像自动驾驶中的感知和规划一样,系统在不断学习和调整,确保车辆在复杂环境中安全行驶。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的赛车游戏,你要控制赛车在各种不同的赛道上跑。以前的游戏里,你需要先看地图、知道前面有什么障碍,然后自己规划路线,最后开车。现在,这个新系统像是有个聪明的助手,它可以同时帮你看地图、预测前方的障碍,还能帮你规划最好的路线。这个助手会不断观察你的车子和路况,边跑边调整策略,确保你跑得又快又稳。它用一种特别的“智能思考”方式,把所有信息都结合起来,避免出错。这样,你就不用担心迷路或撞到东西,因为这个系统会一直帮你优化路线,确保你安全到达终点。就像你有个超级聪明的朋友在帮你开车一样!

原文摘要

Diffusion models have shown strong potential for multi-modal planning in end-to-end autonomous driving. However, most existing methods confine diffusion to the planning module, conditioning on fixed outputs from separate discriminative perception networks. This decoupled design propagates perception errors to the planner, increasing optimization difficulty and reducing robustness. To overcome these limitations, we propose UniTeD, a Unified Temporal Diffusion framework that jointly models perception and planning through iterative denoising in a shared generative space. By enabling bidirectional information exchange, the framework facilitates mutual refinement between tasks and improves robustness via noise-conditioned multi-task training. We further extend this unified diffusion paradigm to a streaming setting by incorporating temporal context. A Temporal Transition Module (TTM) is introduced to resolve the noise-level mismatch between historical and current frames. In addition, we propose an Anchor Refresh Strategy (ARS) to alleviate the training-inference distribution shift commonly observed in sparse diffusion-based end-to-end driving frameworks. Without bells and whistles, UniTeD achieves state-of-the-art performance across multiple benchmarks, surpassing both recent discriminative end-to-end methods and diffusion-based planning approaches.

cs.CV