End-to-End Urban Driving by Imitating a Reinforcement Learning Coach

TL;DR

提出基于强化学习的自动驾驶专家“Roach”,在CARLA中超越Autopilot,提升端到端模仿学习性能。

cs.CV 🔴 高级 2021-08-19 50 次浏览
Zhejun Zhang Alexander Liniger Dengxin Dai Fisher Yu Luc Van Gool
自动驾驶 强化学习 模仿学习 CARLA仿真 端到端方法

核心发现

方法论

本文训练了一个基于深度强化学习的专家“Roach”,利用鸟瞰图像映射到连续低层动作。采用PPO算法,结合Beta分布和探索损失,提升样本效率。输入为BEV语义分割图和传感器测量,输出连续动作分布。通过在CARLA中训练10M步,超越Autopilot性能,提供丰富监督信号供模仿学习。利用3D检测合成BEV,缓解现实中的数据稀缺问题。IL代理在“Roach”监督下,达到了专家水平,表现出良好的泛化能力。

关键结果

  • 在CARLA的NoCrash-dense基准中,端到端IL代理成功率达78%,在新城和新天气条件下表现优异,超越先前方法。Roach在CARLA LeaderBoard公共路线中实现了最先进的性能,显著优于传统Autopilot。训练过程中,Beta分布和探索损失显著提升样本利用率,训练时间约为一周。
  • “Roach”在CARLA中设置了性能上限,超越Autopilot,且作为模仿学习的监督源,提供动作分布、价值估计和潜在特征等多维监督信号,显著改善IL代理的学习效率和泛化能力。
  • 通过结合3D检测和合成BEV,减少对昂贵传感器的依赖,增强模型的现实适应性。实验验证了“Roach”在多场景、多天气条件下的鲁棒性,显示出其在自动驾驶中的潜力。

研究意义

该研究突破了自动驾驶专家的性能瓶颈,利用强化学习训练高效、泛化能力强的专家模型,为端到端模仿学习提供了丰富的监督信号。相比传统规则驱动的专家,基于深度强化学习的“Roach”能更好地应对复杂交通环境,推动自动驾驶技术向更高的自主水平发展。这不仅提升了仿真环境中的性能,也为未来现实系统的迁移奠定基础,具有重要的学术和工业价值。

技术贡献

本文提出了结合Beta分布和探索损失的PPO训练策略,有效提升样本效率和训练稳定性。创新性地利用鸟瞰图像和合成BEV作为输入,减少感知误差影响。通过多维监督信号(动作分布、价值、潜在特征),丰富了模仿学习的目标,显著优于传统专家规则。此外,提出的自动化专家在CARLA中设定了性能新高,为端到端自动驾驶提供了强有力的训练基础。

新颖性

首次在城市驾驶场景中训练基于深度强化学习的自动专家“Roach”,超越基于规则的Autopilot,利用多维监督信号丰富IL训练目标。创新性地结合Beta分布和探索机制,有效解决样本效率和探索不足问题,为自动驾驶专家训练提供新思路。

局限性

  • 模型依赖仿真环境,现实迁移仍面临感知误差和传感器限制,实际部署还需域适应技术。
  • 训练过程耗时较长,需大量计算资源,未来需优化算法以提升效率。
  • 在极端交通场景或复杂交互中表现尚待验证,鲁棒性有待增强。

未来方向

未来将结合多模态传感器和域适应技术,提升模型在真实环境中的表现。探索多智能体协作和长时序决策,增强系统的复杂交互能力。同时,优化训练流程,缩短训练时间,推动从仿真到实际车辆的迁移应用。

AI 总览摘要

自动驾驶技术的快速发展带来了端到端学习的巨大潜力,但受限于专家示范的质量和效率,难以实现真正的自主。传统规则驱动的专家在复杂环境中表现有限,且难以提供丰富的监督信号。为此,本文提出了“Roach”,一种基于深度强化学习的自动驾驶专家,利用鸟瞰图像映射到连续动作空间,超越了CARLA中的Autopilot。通过结合Beta分布和探索损失,显著提升训练样本效率,训练时间控制在一周内。训练完成后,“Roach”在CARLA的NoCrash-dense基准中达到了78%的成功率,并在新城和新天气条件下表现出优异的泛化能力。作为模仿学习的监督源,“Roach”提供了丰富的动作分布、价值估计和潜在特征,极大改善了IL代理的学习效果。实验结果显示,端到端IL代理在“Roach”监督下,不仅达到了专家水平,还在CARLA LeaderBoard中实现了最先进的性能。这一创新方法为自动驾驶专家的训练提供了新思路,突破了传统基于规则专家的瓶颈,推动了自动驾驶技术向更高自主水平迈进。未来,结合多模态传感器和域适应技术,将进一步增强模型在真实环境中的应用能力,缩短从仿真到实际部署的路径。整体来看,该研究不仅在学术上具有重要意义,也为工业界提供了可行的自动驾驶训练方案,开启了端到端自主驾驶的新时代。

深度分析

研究背景

自动驾驶技术经历了从模块化到端到端的演变。早期依赖手工设计规则和模块化感知、规划、控制体系,存在复杂调试和鲁棒性不足的问题。深度学习的引入推动了端到端方法的发展,如Behavior Cloning和逆强化学习,显著提升了感知与决策的整合能力。CARLA仿真平台成为研究的主要场景,许多工作在其上验证算法性能。尽管如此,现有方法多依赖人工示范或规则专家,受限于示范质量和数据稀缺,难以实现真正的自主。强化学习的引入提供了新的可能,但训练效率和安全性仍是挑战。

核心问题

核心问题在于如何训练一个高性能、泛化能力强的自动驾驶专家,既能在仿真中超越规则基方法,又能为模仿学习提供丰富的监督信号。传统专家如Autopilot虽具备一定水平,但受限于手工规则,表现不稳定且缺乏多样性。人类驾驶示范难以大规模采集,且标注成本高。现有自动专家多依赖昂贵传感器或ground-truth信息,难以在实际中部署。如何利用深度强化学习训练出既高效又具有丰富监督信息的专家,是当前的关键难题。

核心创新

本研究的创新点包括:1)提出“Roach”,基于深度强化学习的自动专家,利用鸟瞰图像映射连续动作空间,超越传统规则专家;2)引入Beta分布和探索损失,提升样本利用率和训练稳定性;3)利用合成BEV缓解现实中的数据稀缺问题,增强模型的迁移能力;4)丰富监督信号,包括动作分布、价值估计和潜在特征,显著改善模仿学习效果。这些创新结合,使得专家模型在仿真中达到了新的性能高点,为端到端自动驾驶提供了强有力的训练基础。

方法详解

  • �� 输入:鸟瞰图像(BEV语义分割图)和传感器测量;• 网络:基于ResNet-34的卷积编码器,结合全连接层生成潜在特征;• 输出:连续动作分布(Beta分布)和价值估计;• 训练:采用PPO算法,结合策略剪裁、最大熵和探索损失,优化动作分布和价值函数;• 监督:多维信号(动作分布、潜在特征、价值)指导模仿学习;• 3D检测合成BEV,缓解现实数据稀缺问题。

实验设计

在CARLA平台上,使用六个不同地图进行训练和测试,评估指标包括成功率和驾驶得分。训练过程中,调整Beta分布和探索损失参数,显著提升样本效率。通过对比不同专家模型,验证“Roach”的优越性。在NoCrash-dense和LeaderBoard公共路线中,模型表现优异,成功率达78%以上。还进行了泛化测试,验证在新城和新天气条件下的鲁棒性。实验还包括消融分析,展示不同机制对性能的贡献。

结果分析

  • ��Roach”在CARLA中的成功率达78%,在新环境中保持优异表现,超越基准Autopilot。结合丰富的监督信号,IL代理在多个场景中实现专家级性能,显著优于传统方法。训练效率高,约一周完成,验证了方法的实用性。多场景、多天气的测试证明其鲁棒性和泛化能力,展示了深度强化学习在自动驾驶中的潜力。

应用场景

该方法可应用于自动驾驶系统的专家训练,特别适合在仿真中快速生成高质量训练数据。未来可结合真实传感器和域适应技术,迁移到实际车辆中。还可用于多智能体协作、复杂交互场景的决策训练,推动自动驾驶的商业化和普及。

局限与展望

模型主要在仿真环境中验证,实际部署仍需解决感知误差和域适应问题。训练时间较长,计算资源消耗大。在极端交通场景和复杂交互中表现尚待验证,鲁棒性有待增强。未来需优化算法以实现更高的效率和更强的泛化能力。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂里工作,工厂里有很多不同的机器和工人。你需要让这些机器和工人合作完成任务,但每个人都不知道其他人的具体操作,只能根据观察到的情况做出反应。传统的方法是让每个人严格按照预先设定的规则行动,比如“如果遇到障碍就停下来”。但这样很容易出错,不能应对突发情况。现在,工厂引入了一位聪明的“教练”,他通过观察整个工厂的情况,学习如何灵活应对各种突发事件。这个“教练”不断尝试不同的操作策略,学会了在复杂环境中快速反应。然后,他把这些经验告诉工人们,让他们在实际工作中模仿。这样,工人们不仅学会了基本操作,还能应对各种突发状况。这个“教练”就像论文中的“Roach”,用深度强化学习训练出来,能在复杂交通环境中自主驾驶,超越传统规则,提供丰富的指导信号,帮助其他车辆学习更聪明的驾驶方式。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的赛车游戏,里面的赛车要在繁忙的城市道路上跑,还要避开红绿灯、行人和其他车辆。以前的赛车助手就像是一个会按照固定规则行动的机器人,比如“遇到红灯就停”,但它有时候会太慢,甚至错过绿灯。现在,有一个特别厉害的“教练”机器人,学会了用观察周围环境的图片,决定怎么开车。它像是一个聪明的司机,不仅知道什么时候转弯、刹车,还能在紧急情况下做出快速反应。这个“教练”经过很多练习,学会了在各种天气和道路条件下都能开得很好。它还会告诉其他小车怎么开,让它们也变得更聪明。这样一来,整个城市的交通就会变得更安全、更顺畅。这个“教练”就像论文里的“Roach”,用一种特别的学习方法,教会自己在复杂的交通环境中自主驾驶,比以前的规则机器人聪明多了!

原文摘要

End-to-end approaches to autonomous driving commonly rely on expert demonstrations. Although humans are good drivers, they are not good coaches for end-to-end algorithms that demand dense on-policy supervision. On the contrary, automated experts that leverage privileged information can efficiently generate large scale on-policy and off-policy demonstrations. However, existing automated experts for urban driving make heavy use of hand-crafted rules and perform suboptimally even on driving simulators, where ground-truth information is available. To address these issues, we train a reinforcement learning expert that maps bird's-eye view images to continuous low-level actions. While setting a new performance upper-bound on CARLA, our expert is also a better coach that provides informative supervision signals for imitation learning agents to learn from. Supervised by our reinforcement learning coach, a baseline end-to-end agent with monocular camera-input achieves expert-level performance. Our end-to-end agent achieves a 78% success rate while generalizing to a new town and new weather on the NoCrash-dense benchmark and state-of-the-art performance on the challenging public routes of the CARLA LeaderBoard.

cs.CV cs.RO