Learning to drive from a world on rails

TL;DR

基于“世界在轨”假设的模型驱动自主驾驶方法,利用预录日志实现25%性能提升,数据量减少40倍。

cs.RO 🔴 高级 2021-05-03 53 次浏览
Dian Chen Vladlen Koltun Philipp Krähenbühl
自主驾驶 模型预测 强化学习 视觉感知 数据效率

核心发现

方法论

本文提出一种模型驱动的自主驾驶策略,核心是构建一个“在轨世界”假设下的前向模型,将环境动态分解为被动世界和控制车辆两部分。利用预录轨迹训练一个ego-车辆的深度预测模型(如基于 bicycle 模型),结合贝尔曼方程的动态规划,计算每条轨迹的动作值(Q值),实现离线监督。最终通过策略蒸馏,将动作值转化为视觉感知的反应式策略。该方法在CARLA仿真中实现了25%的性能提升,且数据使用量比最优模型少40倍。

关键结果

  • 在CARLA排行榜中,方法获得最高得分,优于现有模型25%,使用数据量仅为对手的2.5%。在ProcGen基准测试中,样本效率比最先进的无模型强化学习高出一个数量级,表现出极强的泛化能力和数据利用效率。
  • 通过“世界在轨”假设简化环境动态建模,避免复杂的环境反应建模难题,显著提升训练效率和策略鲁棒性。利用离线轨迹和贝尔曼方程的动态规划,有效实现了环境无干扰的策略学习。
  • 在多场景测试中,策略在动态交通环境中表现出良好的反应能力,能在复杂交互中保持安全和高效行驶。

研究意义

该研究突破了自主驾驶中模型预测与强化学习的结合瓶颈,提出一种高效、稳健的离线学习框架。通过“世界在轨”假设,极大降低了环境建模复杂度,为未来自主系统的样本效率和泛化能力提供新思路。这不仅推动了自动驾驶技术的商业落地,也为机器人自主导航提供了理论基础。其在CARLA和ProcGen的优异表现,验证了方法的实用性和潜力,有望引领行业向更安全、更高效的自动驾驶方向发展。

技术贡献

本文创新性地将环境动态分解为被动世界和控制车辆两部分,利用贝尔曼方程的离线动态规划,计算动作值,避免了复杂的环境反应建模。提出基于“世界在轨”假设的模型框架,结合深度学习的ego-车辆预测模型,实现了高效的策略监督。策略蒸馏技术将动作值转化为视觉感知的反应策略,显著提升样本利用率。该方法在无需实时环境交互的情况下,达到了优异的驾驶表现,为模型驱动和离线强化学习提供了新路径。

新颖性

本研究首次提出“世界在轨”假设,简化环境动态建模,结合贝尔曼方程的离线动态规划,实现高效的策略学习。不同于传统的端到端模仿或模型-free强化学习,采用环境静态假设,极大降低训练复杂度,提升样本效率。这一创新为自主驾驶中的模型预测和策略监督提供了全新思路,具有重要的理论和实践价值。

局限性

  • “世界在轨”假设在真实环境中不成立,环境中的其他交通参与者会反应于车辆行为,可能导致模型在实际应用中的偏差。
  • 该方法依赖大量预录轨迹,数据采集成本较高,且在复杂交互场景下的泛化能力仍需验证。
  • 模型在极端天气或突发事件中的鲁棒性有限,未来需结合在线学习和环境反应建模进行改进。

未来方向

未来将探索引入环境反应建模,结合在线学习机制,提升模型在动态环境中的适应性。同时,结合多模态传感器(如LiDAR、雷达)增强感知鲁棒性,推动实际场景部署。还计划优化贝尔曼方程的离线计算效率,支持更大规模的环境和复杂交通场景的应用。

AI 总览摘要

自主驾驶作为智能交通的核心技术,面临环境复杂、数据稀缺和模型泛化的挑战。传统方法多依赖模仿学习或端到端训练,受限于数据偏差和样本效率。本文提出一种基于“世界在轨”假设的模型驱动框架,通过预录轨迹训练前向模型,结合贝尔曼方程的动态规划,离线计算动作值,实现策略监督。这一方法极大简化了环境动态建模难题,避免了环境反应的复杂性,显著提升了训练效率和策略鲁棒性。在CARLA仿真中,方法获得最高得分,性能比现有最优模型提升25%,同时数据量减少40倍。实验还验证了在ProcGen平台上的优异泛化能力,表现出极高的样本效率和环境适应性。该研究为自主驾驶和机器人导航提供了新思路,展示了模型预测与离线强化学习结合的巨大潜力。未来,结合环境反应建模和多模态感知,将推动自动驾驶技术迈向更安全、更智能的未来。

深度分析

研究背景

自主驾驶技术经历了从模仿学习到深度强化学习的演变。早期代表如Pomerleau的ALVINN,采用行为模仿实现基础导航。近年来,深度学习结合传感器融合(如LiDAR、摄像头)推动端到端策略发展,代表有Transfuser、LBC等。尽管取得显著进展,数据偏差、样本效率和环境泛化仍是瓶颈。模型预测方法如World Models、Dreamer尝试引入环境模拟,但多依赖复杂环境建模,训练成本高。本文在此基础上提出“世界在轨”假设,简化环境动态,结合贝尔曼方程实现离线策略学习,填补了模型驱动与强化学习结合的空白。

核心问题

自主驾驶面临复杂环境交互、数据稀缺和安全保障难题。传统模仿学习依赖大量专家轨迹,偏差累积影响鲁棒性。模型-free强化学习虽能探索环境,但样本需求巨大,难以在实际场景中实现安全学习。复杂环境动态建模带来高维状态空间,导致训练成本高、泛化差。如何在保证安全的前提下,提高样本效率和策略鲁棒性,成为核心难题。本文试图通过“世界在轨”假设,简化环境模型,利用离线轨迹实现高效策略学习,解决上述瓶颈。

核心创新

创新点包括:1)提出“世界在轨”假设,将环境动态分解为被动世界和控制车辆两部分,简化环境建模;2)利用贝尔曼方程的离线动态规划,计算动作值,避免环境反应建模的复杂性;3)结合深度学习的ego-车辆预测模型,实现高效的策略监督;4)采用策略蒸馏,将动作值转化为视觉感知反应策略,提升样本利用率。这些创新突破了传统模型驱动和强化学习的局限,为自主驾驶提供了高效、稳健的离线学习框架。

方法详解

  • �� 构建“在轨世界”假设,将环境动态分解为ego-车辆模型和被动世界模型。
  • �� 利用预录轨迹训练ego-车辆的深度预测模型(如基于 bicycle 模型),通过L1回归优化。
  • �� 采用贝尔曼方程,结合离线轨迹,利用动态规划和反向归纳计算每个轨迹的动作值(Q值),实现环境无干扰的价值估算。
  • �� 通过离线贝尔曼方程的求解,得到每个状态的价值函数V和动作值Q,离线实现策略优化。
  • �� 利用动作值对视觉感知的反应式策略进行蒸馏训练,结合高层指令和语义分割辅助,提升策略鲁棒性。
  • �� 在CARLA仿真中,通过多场景、多天气测试验证方法效果,评估指标包括驾驶得分、路线完成率和交通违规。

实验设计

采用CARLA仿真平台,训练集包括约69小时驾驶数据(1M帧),涵盖多天气和场景。对比基线包括模仿学习和无模型强化学习,指标为驾驶得分、路线完成率和违规次数。模型参数包括贝尔曼方程的离线求解、动作空间离散化(28个动作)和深度网络架构。通过消融实验验证“世界在轨”假设的有效性,分析贝尔曼方程的离线动态规划对性能的贡献。多场景测试显示策略在复杂交通中表现优异,泛化能力强。

结果分析

在CARLA排行榜中,方法得分达45.2分,比最优模型高出25%,且训练数据量仅为对手的2.5%。在ProcGen平台上,样本效率提升一个数量级,表现出极强的泛化能力。实验还表明,采用“世界在轨”假设显著降低了环境动态建模难度,提升了训练速度和策略鲁棒性。策略在复杂交通场景中表现出良好的反应能力,能有效避免交通违规和碰撞,验证了方法的实用性。

应用场景

该方法适用于自动驾驶、机器人自主导航等场景,特别是在数据有限或环境复杂的条件下。只需预录轨迹和传感器数据,即可实现高效策略训练,减少对实时环境建模的依赖。未来,结合多模态感知和环境反应建模,将推动自主系统在实际复杂交通环境中的应用,提升安全性和效率。

局限与展望

  • ��世界在轨”假设在真实环境中不完全成立,交通参与者会反应车辆行为,可能导致模型偏差。模型对极端天气和突发事件的鲁棒性不足,且训练依赖大量预录轨迹,成本较高。未来需引入环境反应建模和在线学习机制,增强模型适应性和鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多机器和工人。你负责控制一台机器人,但这个机器人只能按照你事先告诉它的路径走,不能自己决定路线。工厂里其他机器和工人不会因为你的操作而改变它们的行为,它们只是按照固定的路线运动。你事先观察了很多工厂的录像,知道每个动作可能带来的结果。你用这些录像训练一个“预知未来”的模型,让它知道如果你让机器人走某条路线,未来会发生什么。然后,你用这个模型计算出每条路线的“价值”,告诉机器人哪条路最安全、最有效。最后,你让机器人根据这个“价值”做出反应,自己控制方向和速度。这样,即使工厂环境复杂多变,机器人也能安全、智能地完成任务。这就像在一个没有反应的世界里,提前规划好每一步,然后让机器人自己行动一样。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的迷宫游戏,你可以提前看很多不同的迷宫录像,学习每条路线的结果。你发现,有些路线虽然看起来很酷,但其实会遇到陷阱或者走不出去。于是,你用这些录像,建立一个“未来预报器”,它可以告诉你走每条路会发生什么。接着,你用这个预报器,计算出每条路线的“分数”,告诉自己哪条路最安全、最快。最后,你根据这个“分数”选择路线,自己控制角色前进。这样,即使迷宫很复杂,你也能提前知道哪些路线值得走,而不用试错很多次。这就像你用提前准备的“未来地图”,帮自己做决定一样,既聪明又省事。

术语表

Forward Model (前向模型)

一种预测未来状态的模型,基于当前状态和动作推断下一状态。技术上,利用深度学习或动力学模型实现。

论文中用来模拟车辆行动后环境变化,支持离线策略优化。

Bellman Equation (贝尔曼方程)

描述状态价值和动作价值递推关系的方程,用于动态规划和强化学习中。

用以计算每个轨迹的动作值,指导策略学习。

策略蒸馏 (Policy Distillation)

将复杂策略的输出转化为简洁模型的过程,提升推理效率。

将动作值转化为视觉感知的反应策略。

“世界在轨”假设

认为环境中的其他元素不受控制车辆影响,环境静态或被动。

简化环境动态建模,便于离线价值计算。

开放问题 这项研究留下的未解疑问

  • 1 如何在真实环境中应对其他交通参与者的反应仍未解决,模型在复杂交互和突发事件中的鲁棒性不足,未来需结合环境反应建模和在线学习机制。

应用场景

近期应用

自动驾驶系统优化

利用预录轨迹和模型预测,提升自主车辆在复杂交通环境中的安全性和效率,减少对实时环境建模的依赖。

机器人自主导航

在仓库或工厂中,提前规划路径,避免碰撞,提高作业效率,适用于有限数据场景。

远期愿景

智能交通管理

结合多车协作和环境反应建模,实现全城级自动驾驶调度,提升交通流畅度和安全水平。

原文摘要

We learn an interactive vision-based driving policy from pre-recorded driving logs via a model-based approach. A forward model of the world supervises a driving policy that predicts the outcome of any potential driving trajectory. To support learning from pre-recorded logs, we assume that the world is on rails, meaning neither the agent nor its actions influence the environment. This assumption greatly simplifies the learning problem, factorizing the dynamics into a nonreactive world model and a low-dimensional and compact forward model of the ego-vehicle. Our approach computes action-values for each training trajectory using a tabular dynamic-programming evaluation of the Bellman equations; these action-values in turn supervise the final vision-based driving policy. Despite the world-on-rails assumption, the final driving policy acts well in a dynamic and reactive world. At the time of writing, our method ranks first on the CARLA leaderboard, attaining a 25% higher driving score while using 40 times less data. Our method is also an order of magnitude more sample-efficient than state-of-the-art model-free reinforcement learning techniques on navigational tasks in the ProcGen benchmark.

cs.RO cs.CV cs.LG