MILER: Semantic Mid-Level Representation for Sim-to-Real Reinforcement Learning in Unstructured Autonomous Driving

TL;DR

MILER通过语义中层表示实现无结构环境下的零样本模拟到现实强化学习。

cs.RO 🔴 高级 2026-09-18 13 次浏览
Thomas Steinecker Denis Trescher Alexander Bienemann Thorsten Luettel Mirko Maehlisch
强化学习 自动驾驶 模拟到现实 语义表示 无人驾驶

核心发现

方法论

MILER框架利用语义中层表示(MLR)模拟器进行离线训练,使用PPO算法优化策略网络。部署时,采用BEVFusion处理摄像头和LiDAR数据,生成与MLR模拟器一致的语义鸟瞰图。策略网络生成的动作通过轨迹对齐策略应用于真实车辆。

关键结果

  • 在多样测试轨道上,车辆以最高33.6 km/h速度行驶,成功应对各种障碍和急转弯,总行驶17.3 km,无需人工干预。
  • 在两辆不同的车辆上测试,展示了方法的普适性和鲁棒性。
  • 通过轨迹对齐策略实现了感知和控制的零样本模拟到现实转移。

研究意义

MILER框架为无结构环境下的自动驾驶提供了新的解决方案,解决了模拟到现实转移中的关键挑战。其零样本转移能力在学术界和工业界具有重要意义,尤其是在无人驾驶汽车的安全性和鲁棒性方面。

技术贡献

提出了基于语义中层表示的模拟器,减少了建模复杂度。通过轨迹对齐策略实现了感知和控制的无缝转移,显著提高了模拟到现实的适用性。

新颖性

首次在无结构环境中使用语义中层表示进行强化学习,解决了传统高保真模拟器的复杂性问题,提供了一种更简化的模拟到现实转移方法。

局限性

  • 在低光和雨天条件下,车辆表现出过于保守的障碍预测,导致停止。
  • 需要进一步优化以提高在不同天气条件下的鲁棒性。

未来方向

未来工作将集中在提高系统在不同环境条件下的鲁棒性,并探索更多的应用场景,如城市驾驶和复杂交互环境。

AI 总览摘要

在无结构环境中实现自动驾驶一直是一个挑战,现有方法在模拟到现实的转移上存在困难。MILER框架通过语义中层表示(MLR)模拟器进行离线训练,使用PPO算法优化策略网络。部署时,采用BEVFusion处理摄像头和LiDAR数据,生成与MLR模拟器一致的语义鸟瞰图。策略网络生成的动作通过轨迹对齐策略应用于真实车辆,成功实现了零样本模拟到现实转移。实验结果表明,MILER在多样测试轨道上表现出色,车辆以最高33.6 km/h速度行驶,总行驶17.3 km,无需人工干预。这一框架为无结构环境下的自动驾驶提供了新的解决方案,解决了模拟到现实转移中的关键挑战,具有重要的学术和工业意义。未来工作将集中在提高系统在不同环境条件下的鲁棒性,并探索更多的应用场景,如城市驾驶和复杂交互环境。

深度分析

研究背景

强化学习近年来在多个领域取得了显著进展,尤其是在游戏和机器人领域。然而,在自动驾驶,特别是无结构环境中,模拟到现实的转移仍然是一个未解决的难题。传统方法依赖高保真模拟器,这些模拟器复杂且难以扩展。

核心问题

在无结构环境中实现自动驾驶的核心问题在于模拟到现实的转移。由于环境的多样性和复杂性,传统的高保真模拟器难以有效地模拟现实世界的动态变化。

核心创新

MILER的核心创新在于使用语义中层表示(MLR)模拟器进行训练,简化了环境建模的复杂性。通过轨迹对齐策略,实现了感知和控制的无缝转移,避免了直接应用策略网络输出到真实车辆所带来的不安全驾驶行为。

方法详解

  • �� 使用MLR模拟器进行离线训练,生成语义鸟瞰图。
  • �� 使用PPO算法优化策略网络。
  • �� 部署时,采用BEVFusion处理摄像头和LiDAR数据。
  • �� 通过轨迹对齐策略应用策略网络生成的动作。

实验设计

实验在两个不同的车辆上进行,测试轨道包括各种障碍和急转弯。使用的主要指标包括最大速度、行驶距离和车辆稳定性。通过对比不同条件下的表现,验证了方法的鲁棒性。

结果分析

实验结果表明,MILER在多样测试轨道上表现出色,车辆以最高33.6 km/h速度行驶,总行驶17.3 km,无需人工干预。通过轨迹对齐策略实现了感知和控制的零样本模拟到现实转移。

应用场景

MILER框架可直接应用于无人驾驶汽车的开发,特别是在无结构环境中。其零样本转移能力使其在无人驾驶汽车的安全性和鲁棒性方面具有重要意义。

局限与展望

在低光和雨天条件下,车辆表现出过于保守的障碍预测,导致停止。需要进一步优化以提高在不同天气条件下的鲁棒性。

通俗解读 非专业人士也能看懂

想象你在玩一个复杂的赛车游戏。游戏中有很多不同的赛道,有的平坦,有的崎岖不平。你需要在游戏中训练你的驾驶技巧,然后在现实中驾驶真正的赛车。MILER就像是一个超级智能的游戏教练,它能让你在游戏中学到的技巧直接应用到现实中,而不需要重新学习。通过使用一种叫做语义中层表示的方法,MILER能让游戏中的赛道和现实中的路况看起来几乎一样,这样你就能在现实中自信地驾驶。

简单解释 像给14岁少年讲一样

想象一下你在玩一个赛车游戏,游戏里有各种各样的赛道,有的很简单,有的很复杂。你在游戏里练习驾驶技巧,然后希望在现实中也能开得很好。MILER就像是一个超级聪明的游戏教练,它能让你在游戏中学到的东西直接用到现实中。它通过一种叫做语义中层表示的方法,把游戏里的路和现实中的路变得很相似,这样你就能在现实中轻松驾驶啦!

术语表

语义中层表示 (Semantic Mid-Level Representation)

一种简化环境建模的方法,通过抽象的语义信息表示复杂环境。

用于MILER框架中,简化模拟环境的复杂性。

轨迹对齐策略 (Trajectory Alignment Strategy)

一种将模拟环境中的策略应用于现实环境的方法,通过对齐虚拟和真实车辆的轨迹。

用于MILER框架中,实现零样本模拟到现实转移。

PPO算法 (Proximal Policy Optimization)

一种强化学习算法,优化策略网络以提高学习效率和稳定性。

用于MILER框架中,训练策略网络。

BEVFusion

一种融合摄像头和LiDAR数据生成语义鸟瞰图的方法。

用于MILER框架中,生成与MLR模拟器一致的语义表示。

强化学习 (Reinforcement Learning)

一种机器学习方法,通过与环境的交互学习最优策略。

用于MILER框架中,训练自动驾驶策略。

开放问题 这项研究留下的未解疑问

  • 1 如何在不同天气条件下提高系统的鲁棒性仍需进一步研究。
  • 2 在更复杂的城市环境中应用MILER框架的可行性尚待验证。

应用场景

近期应用

无人驾驶汽车

MILER可用于无结构环境下的无人驾驶汽车开发,提升其安全性和鲁棒性。

远期愿景

智能交通系统

通过改进MILER框架,可在未来的智能交通系统中实现更高效的自动驾驶解决方案。

原文摘要

Reinforcement learning constitutes a promising approach owing to its potential for superhuman performance and self-learned policies. However, its application to real-world autonomous driving remains scarce, particularly in unstructured environments, because of the challenges associated with sim-to-real transfer for unstructured environments. In this work, we present MILER, an end-to-end policy framework with zero-shot sim-to-real transfer. During offline training, we employ a custom semantic mid-level representation (MLR) simulator and train the policy network using reinforcement learning, with its control outputs applied directly to a bicycle model. During deployment on the real vehicle, camera and LiDAR data are processed by BEVFusion to generate a semantic bird's-eye-view representation consistent with that of the MLR simulator. The actions generated by the policy network are not applied directly to the real vehicle. Instead, we employ a trajectory-alignment strategy that enables zero-shot sim-to-real transfer of both perception and control. We extensively evaluate the proposed framework on a diverse test track comprising numerous challenges, including various obstacles, hairpin curves, velocities of up to 33.6 km/h, and off-road sections. In total, we drove 17.3 km with two different vehicles on a 3.0 km test track without human intervention, thereby demonstrating the effectiveness of our approach. Furthermore, the entire software stack runs on a Jetson AGX Orin.

cs.RO cs.LG