CAT: Closed-loop Adversarial Training for Safe End-to-End Driving

TL;DR

提出CAT框架,通过环境增强和概率分解实现安全端到端驾驶的闭环对抗训练,提升安全性。

cs.LG 🔴 高级 2023-10-19 37 次浏览
Linrui Zhang Zhenghao Peng Quanyi Li Bolei Zhou
自动驾驶 对抗训练 环境增强 场景生成 深度学习

核心发现

方法论

本文提出的CAT框架结合了环境增强与概率分解技术,通过在真实驾驶日志基础上动态生成安全关键场景,利用贝叶斯概率分解将交通场景分解为交通预测、驾驶行为和碰撞概率三部分。采用DenseTNT模型预测交通轨迹,利用场景重采样实现高效对抗场景生成。训练过程中,利用闭环优化不断提升驾驶策略的鲁棒性,兼容强化学习、模仿学习等多种端到端方法。

关键结果

  • 在MetaDrive模拟器中,CAT生成的对抗场景成功率达91%,显著优于STRIVE的85%,且计算时间仅为0.66秒/场景,远低于后者的153秒。训练后,RL代理在真实和对抗场景中表现出更低的碰撞率(降低15%),并提升了路径完成率(提升4%),验证了方法的有效性和效率。
  • 在500个真实场景中,经过CAT训练的驾驶策略在测试集上,碰撞率降低了约15%,路径完成率提升至72.5%,优于非对抗训练的策略,显示出环境对抗训练对提升安全性的显著作用。
  • 对比多种场景生成方法,CAT在保持高逼真度的同时,显著降低了生成时间,证明其在大规模闭环训练中的实用性和优越性。

研究意义

该研究突破了传统静态场景训练的局限,通过动态生成安全关键场景,有效提升自动驾驶系统在未知和极端环境下的鲁棒性。其环境增强与概率分解的结合,为自动驾驶安全保障提供了新的技术路径,有望推动行业向更安全、更智能的方向发展。此方法可广泛应用于自动驾驶系统的安全验证、风险评估及真实场景模拟,为未来自主驾驶的普及奠定基础。

技术贡献

提出基于贝叶斯概率分解的高效安全关键场景生成技术,结合深度交通预测模型实现逼真、多样的对抗场景。创新性地将环境增强与闭环对抗训练结合,显著降低了计算成本,提升了场景生成的效率和多样性。该框架兼容多种端到端学习策略,为自动驾驶安全训练提供了通用平台。通过在MetaDrive中的验证,展示了其在复杂交通环境中的优越性能,为行业提供了可行的技术方案。

新颖性

首次将贝叶斯概率分解应用于交通场景的对抗生成,结合深度交通预测模型实现高效逼真的环境增强。不同于现有的梯度优化或静态场景采样方法,CAT实现了实时、可扩展的安全场景生成,极大提升了闭环训练的实用性和效率。这一创新突破为自动驾驶安全训练提供了全新的思路,填补了大规模动态场景生成的技术空白。

局限性

  • 当前方法依赖预训练交通预测模型,其在极端或异常交通行为下的表现仍有限,可能影响对抗场景的真实性和多样性。
  • 对抗场景生成主要针对两车碰撞,未充分考虑多车复杂交互场景,未来需扩展多主体对抗能力。
  • 在极端复杂环境中,贝叶斯分解的近似可能导致生成场景的偏差,影响训练效果。

未来方向

未来将结合多模态传感器信息,提升场景生成的多样性与真实性;探索多车、多目标的对抗策略,以应对更复杂的交通场景;同时优化算法以支持更大规模的实时闭环训练,推动自动驾驶系统的安全性和鲁棒性持续提升。

AI 总览摘要

自动驾驶技术的安全性一直是行业关注的焦点。尽管端到端学习方法在城市驾驶和赛道竞速中表现出色,但在极端和事故易发场景下的鲁棒性仍待提升。传统的训练方法依赖于大量真实数据,难以覆盖罕见的危险场景,导致模型在未知环境中表现不足。为此,本文提出了CAT(Closed-loop Adversarial Training)框架,结合环境增强和概率分解技术,动态生成安全关键场景,从而在训练中不断挑战和提升驾驶策略的鲁棒性。该方法利用深度交通预测模型预测交通轨迹,通过贝叶斯分解将场景生成任务拆分为交通预测、驾驶行为和碰撞概率三部分,极大提高了生成效率和逼真度。实验在MetaDrive模拟器中验证,CAT生成的对抗场景成功率达91%,显著优于传统方法,且计算时间大幅缩短。训练后,RL代理在真实和对抗场景中表现出更低的碰撞率和更高的路径完成率,验证了其提升安全性的有效性。这一技术突破为自动驾驶系统的安全验证提供了新思路,有望推动行业实现更安全、更智能的自动驾驶。未来,研究将扩展多车交互场景,提升生成多样性,并支持大规模实时闭环训练,推动自动驾驶安全技术的持续发展。

深度分析

研究背景

自动驾驶技术经历了从感知到决策的逐步演进,深度学习在感知、路径规划等方面取得突破。代表性工作如Waymo、Tesla的自动驾驶系统,强调感知准确性和决策鲁棒性。然而,极端或罕见的交通场景仍难以充分训练,导致系统在实际应用中存在安全隐患。近年来,环境增强和场景生成成为研究热点,诸如CausalAF、STRIVE等方法试图通过场景模拟提升模型鲁棒性,但多面临计算成本高、泛化能力不足等问题。

核心问题

自动驾驶系统在应对未知或极端场景时表现不足,主要源于训练数据的有限性和场景多样性不足。现有方法多依赖静态场景或有限的模拟环境,难以动态生成具有挑战性的对抗场景,导致模型在实际中易发生碰撞。如何高效、逼真地生成多样化的安全关键场景,成为提升自动驾驶安全的关键瓶颈。传统场景生成方法存在计算成本高、泛化差、难以扩展的问题,亟需一种兼具效率和逼真度的解决方案。

核心创新

本文提出的核心创新包括:1)基于贝叶斯概率分解的环境增强技术,将复杂交通场景拆解为交通预测、驾驶行为和碰撞概率三部分,提升生成效率;2)利用深度交通预测模型(DenseTNT)实现高逼真、多样的交通轨迹预测;3)引入闭环对抗训练机制,使模型在训练过程中不断生成具有挑战性的场景,提升策略鲁棒性。该框架兼容多种端到端学习方法,突破了传统场景生成的计算瓶颈,为自动驾驶安全训练提供了新路径。

方法详解

  • �� 采集真实驾驶日志作为基础场景;
  • �� 利用预训练的DenseTNT模型预测交通轨迹,构建交通预测场景;
  • �� 通过贝叶斯分解,将交通场景拆解为交通预测、驾驶行为和碰撞概率三部分;
  • �� 在每次训练迭代中,采样多个候选交通轨迹,选择最具潜在碰撞风险的场景作为对抗环境;
  • �� 在模拟器中重置场景,利用强化学习或模仿学习不断优化驾驶策略;
  • �� 通过闭环机制,持续生成具有挑战性的场景,提升策略鲁棒性。

实验设计

使用Waymo开放运动数据集中的500个复杂交通场景,导入MetaDrive模拟器进行训练和测试。采用不同的训练策略(无对抗、规则对抗、开环对抗、闭环对抗)进行对比。指标包括路径完成率、碰撞率和生成场景的计算时间。参数设置如:场景持续9秒,预测8秒交通轨迹,生成候选轨迹数为32,采用α=0.99的碰撞惩罚系数。通过 ablation 研究验证贝叶斯分解和环境增强的贡献。

结果分析

CAT在对抗场景中的成功率达91%,明显优于STRIVE的85%,且每场景生成时间仅0.66秒,远低于后者的153秒。在训练后,RL策略在真实和对抗场景中,碰撞率降低15%,路径完成率提升至72.5%,显示出显著的安全性能提升。对比其他方法,CAT在保持高逼真度的同时,极大降低了计算成本,验证了其在大规模闭环训练中的实用性。

应用场景

该技术适用于自动驾驶系统的安全验证、风险评估和场景模拟。可在自动驾驶测试平台中集成,用于生成多样化的极端场景,提升系统鲁棒性。未来还可扩展到多车、多目标交互环境,为自动驾驶的普及提供安全保障。

局限与展望

目前依赖预训练交通预测模型,可能在极端或异常交通行为下表现不足。场景生成主要针对两车碰撞,未充分考虑多车复杂交互。贝叶斯分解的近似在极端复杂环境中可能偏差,未来需优化模型泛化能力和多主体场景生成能力。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,厨房里有很多食材和工具。每次你做菜时,会根据食谱和经验选择食材、调料,然后按照步骤操作。有时候,厨房里会突然出现一些意外,比如调料用完了或食材变质。这时,你需要快速调整做法,确保菜能顺利完成。自动驾驶系统也是这样,它需要在复杂的交通环境中“做菜”,面对各种突发情况。本文提出的方法就像给厨师准备了多种应对突发状况的方案,让自动驾驶车在遇到危险时,能像厨师一样灵活应变,保证安全。

简单解释 像给14岁少年讲一样

想象你在玩一款赛车游戏,你的目标是跑得快又不撞车。但是,有时候游戏里会突然出现障碍物或者其他赛车变得很难预测。这就像现实中开车遇到突发情况一样。科学家们想让自动驾驶车也能像你一样聪明,能在危险出现前提前准备。于是,他们设计了一套特别的方法,像给车装了“预警系统”,让车在模拟的虚拟世界里不断练习应对各种突发状况。这样,当真正的车在路上遇到危险时,它就能像训练有素的赛车手一样,避开障碍,安全到达目的地。这项技术让自动驾驶变得更安全、更可靠,就像你在游戏中变得更厉害一样!

原文摘要

Driving safety is a top priority for autonomous vehicles. Orthogonal to prior work handling accident-prone traffic events by algorithm designs at the policy level, we investigate a Closed-loop Adversarial Training (CAT) framework for safe end-to-end driving in this paper through the lens of environment augmentation. CAT aims to continuously improve the safety of driving agents by training the agent on safety-critical scenarios that are dynamically generated over time. A novel resampling technique is developed to turn log-replay real-world driving scenarios into safety-critical ones via probabilistic factorization, where the adversarial traffic generation is modeled as the multiplication of standard motion prediction sub-problems. Consequently, CAT can launch more efficient physical attacks compared to existing safety-critical scenario generation methods and yields a significantly less computational cost in the iterative learning pipeline. We incorporate CAT into the MetaDrive simulator and validate our approach on hundreds of driving scenarios imported from real-world driving datasets. Experimental results demonstrate that CAT can effectively generate adversarial scenarios countering the agent being trained. After training, the agent can achieve superior driving safety in both log-replay and safety-critical traffic scenarios on the held-out test set. Code and data are available at https://metadriverse.github.io/cat.

cs.LG