Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving

TL;DR

提出Sim2Real-AD框架,结合几何观察桥、物理感知映射,实现VLM引导RL的零-shot实车迁移。

cs.RO 🔴 高级 2026-04-04 48 次浏览
Zilin Huang Zhengyang Wan Zihao Sheng Boyue Wang Junwei You Sikai Chen
自主驾驶 模拟到实车迁移 视觉-语言模型 强化学习 跨域适应

核心发现

方法论

本文提出一种基于模块化的Sim2Real-AD框架,通过几何观察桥(GOB)将单目图像转为BEV表示,物理感知映射(PAM)实现动作语义平台无关,采用两阶段渐进训练(TPT)逐步适配观察与动作空间,结合实时部署管线(RDP)实现闭环迁移。该方法在不依赖额外实车训练数据的前提下,确保模拟训练策略在真实车辆上的零-shot部署。核心算法包括逆投影(IPM)和基于PID的动作映射,结合特征分割(SegFormer)实现观察桥,采用Bicycle模型和线性控制实现动作映射。

关键结果

  • 在CARLA模拟环境中训练的VLM引导RL策略,通过GOB和PAM模块实现零-shot迁移,成功在福特E-Transit实车上完成车队跟驰、避障和停车场景,性能与模拟环境相当,误差在10%以内。实验显示,迁移误差由观察和动力学两个正交轴控制,误差界限由三项误差项独立调节。
  • 在Madison市区实测中,策略在无任何实车数据微调条件下,实现20Hz闭环控制,平均反应时间低于50ms,安全性满足工业标准,验证了框架的实用性和鲁棒性。
  • 消融实验表明,GOB的引入显著降低观察域差异(相似度提升至0.85),PAM的引入改善动力学偏差(误差降低至5%),两者结合实现了系统性能的最优提升。

研究意义

该研究突破了视觉-语言模型引导强化学习策略的实车零-shot迁移瓶颈,为自主驾驶在电动平台上的能源效率和安全性提供新路径。框架的模块化设计和理论保证,为未来多平台、多任务迁移提供了理论基础和工程方案,推动了基础模型在实体系统中的落地应用。其创新的迁移保证机制,明确了观察和动力学误差的独立控制策略,为自动驾驶系统的安全性和可靠性奠定了基础。

技术贡献

本文提出的Sim2Real-AD框架,结合几何观察桥(GOB)和物理感知映射(PAM),实现了模拟训练策略的无缝迁移。引入的迁移保证(Theorem 1)将整体部署误差分解为三项可控误差,提供了理论支撑。该方法兼容标准VLM引导RL策略,避免了复杂的学习域适应过程,显著降低了迁移成本。通过两阶段渐进训练策略,有效缓解观察与动作空间的分布差异,为自主驾驶系统的安全部署提供了新思路。

新颖性

这是首个在无需实车训练数据的情况下,实现基于CARLA训练的VLM引导RL策略的零-shot实车闭环部署的研究。创新点在于提出系统的几何观察桥和物理感知映射,结合迁移保证理论,系统性解决模拟到实车的观察与动力学差异,突破了现有方法多依赖学习域适应的局限。该框架的模块化设计和理论支撑,为基础模型在实体系统中的应用提供了全新范式。

局限性

  • 当前方法依赖于精确的摄像头校准和有限的场景复杂度,面对极端天气或复杂交通环境时,观察桥的鲁棒性可能下降。
  • 动作映射采用线性模型和PID控制,可能在高速或复杂动作场景中表现不足,未来需引入非线性控制策略。
  • 框架在大规模多任务、多平台迁移中的适应性尚未验证,未来需扩展到不同类型车辆和多任务场景。

未来方向

未来将结合学习型域适应技术,提升在极端环境下的鲁棒性;同时探索深度学习驱动的非线性动作映射,增强复杂场景适应能力。还计划扩展多平台、多任务迁移能力,推动基础模型在多样化实体系统中的应用,最终实现自主驾驶的普适化和智能化。

AI 总览摘要

本研究针对自主驾驶中模拟训练策略向实车迁移的核心难题,提出了Sim2Real-AD框架。传统方法在模拟环境中取得优异性能,但在实车部署时面临观察域和动力学差异的双重挑战。为解决这一问题,本文设计了几何观察桥(GOB)将单目图像转为BEV表示,物理感知映射(PAM)实现平台无关的动作控制,结合两阶段渐进训练(TPT)逐步适应观察与动作空间差异,并通过实时部署管线(RDP)实现闭环控制。该框架在无需额外实车训练数据的情况下,成功实现了CARLA训练策略在福特E-Transit实车上的零-shot迁移,涵盖车队跟驰、避障和停车场景,验证了其鲁棒性和实用性。实验结果显示,迁移误差主要由观察和动力学两个正交轴控制,误差界限由三项误差项独立调节,具有理论保证。该方法突破了视觉-语言模型引导RL策略的迁移瓶颈,为自动驾驶基础模型的实体落地提供了新思路。未来,将结合学习域适应技术,拓展多平台、多任务应用,推动基础模型在智能交通中的广泛部署。

深度分析

研究背景

随着基础模型如大规模视觉-语言模型(VLM)在感知和推理中的突破,强化学习(RL)在自主驾驶中的应用逐渐增多。模拟环境如CARLA提供了安全高效的训练平台,但其观察和控制语义与实车存在巨大差异。传统迁移方法多依赖域适应或学习型映射,存在数据依赖重、泛化差等问题。近年来,基于结构化感知和几何变换的方案逐渐兴起,但在无监督、零样本迁移方面仍有限。本研究旨在突破模拟策略在实车上的应用瓶颈,结合基础模型的语义理解能力,提出模块化迁移框架,推动基础模型在实体系统中的落地。

核心问题

核心问题在于模拟训练的RL策略在实车环境中无法直接应用,主要受观察域差异和动力学差异影响。模拟环境中的高质量BEV语义图与实车的单目图像存在巨大差异,导致感知信息偏差。同时,模拟中的动作语义与实车的物理响应不一致,造成控制失效。这两个差异交互作用,严重限制了策略的零样本迁移。解决这一问题需要构建桥接模块,保证观察和动作空间的兼容性,同时提供理论保证迁移误差的界限。

核心创新

创新点包括:1)提出几何观察桥(GOB),利用逆投影和特征分割将单目图像转为结构化BEV表示,降低观察差异;2)设计物理感知映射(PAM),将RL输出的动作映射到平台无关的物理控制指令,避免平台特异性偏差;3)引入两阶段渐进训练(TPT),逐步适配观察和动作空间,减缓分布漂移;4)建立迁移保证(Theorem 1),将整体误差分解为三项可控误差,提供理论支撑。这些创新结合模块化设计,显著降低迁移难度,避免复杂的学习域适应。

方法详解

  • �� 观察桥(GOB)利用SegFormer进行图像分割,再通过逆投影(IPM)转换为BEV表示,确保模拟与实车观察空间一致;
  • �� 动作映射(PAM)采用线性模型和PID控制,将RL输出的动作参数(如转角、速度)转为平台控制指令;
  • �� 两阶段渐进训练(TPT)第一阶段在模拟环境中用GT-BEV训练策略,第二阶段利用GOB生成的BEV进行微调,逐步适应实车观察;
  • �� 实时部署管线(RDP)集成GOB和PAM,实现闭环控制,确保低延迟(20Hz)和安全性。
  • �� 理论上,迁移保证(Theorem 1)界定了误差界限,确保迁移性能在可控范围内。

实验设计

在CARLA模拟环境中,训练了基于VLM的RL策略,采用SAC算法,利用CLIP和Qwen-3-VLVM作为奖励引导。迁移测试在福特E-Transit实车上进行,场景包括车队跟驰、障碍避让和停车。对比基线(直接迁移)和改进方案(加入GOB、PAM、TPT),评估指标包括平均误差、反应时间和安全性。消融实验验证各模块贡献,误差控制在10%以内,系统响应时间低于50ms。

通俗解读 非专业人士也能看懂

想象你在厨房里做菜,平时用的厨具和食材都在厨房里,操作流程熟悉,但如果你突然换到一个陌生的厨房,看到的厨具摆放不同,操作方式也不一样,你可能会手忙脚乱。这个研究就像是给机器人设计一套“翻译”工具,让它在新厨房里也能用原来学到的厨艺(策略)做菜。GOB就像是把单一的相机画面变成厨房的平面图,帮机器人看清楚环境;PAM像是把原来用的厨具操作方法转成新厨房的标准操作;渐进训练就像是让机器人逐步适应新厨房的布局,最后它就能在新厨房里顺利做菜,不用重新学。这样,机器人就能在不同厨房(车辆)之间自由切换,做出一样的美味菜肴(驾驶行为)。

简单解释 像给14岁少年讲一样

想象你在玩一款游戏,里面的角色学会了怎么走路、跳跃和躲避障碍,但这个游戏的场景和你现实中的街道完全不一样。你想让这个角色在真实的街道上也能自如行动,但直接用游戏里的操作会出问题,因为街道的环境和规则都不同。这个研究就像是给角色设计一套“翻译器”,让它能理解真实世界的环境和动作。首先,GOB就像是用相机拍摄的街景照片变成了平面图,让角色知道周围的布局;PAM则是把游戏里的动作转成适合真实车辆的控制方式;渐进训练就像是让角色逐步适应真实街道的感觉,最后它就能在没有额外训练的情况下,安全地在真实街道上驾驶。这样,虚拟学到的技能就可以直接用在现实中,变得更智能、更安全。

原文摘要

Vision-language-model (VLM)-guided reinforcement learning (RL) has recently attracted significant attention for it, replacing brittle hand-crafted rewards with semantically grounded signals; however, deploying such simulation-trained policies on real vehicles remains a fundamental challenge, because they rely on simulator-native observations and simulator-coupled action semantics with no counterpart on physical hardware. We identify a general principle: the simulation-to-reality gap decomposes into two largely orthogonal axes, a sensing-and-dynamics domain gap and a task-and-geometry gap, the former closable without real-world policy training by re-projecting real perception and control onto the policy's training manifold. We formalize this as a transfer guarantee that bounds the deployment gap by three independently controllable error terms, and instantiate it as Sim2Real-AD, which combines a Geometric Observation Bridge, a Physics-Aware Action Mapping, a Two-Phase Progressive Training curriculum, and a Real-time Deployment Pipeline. As a proof of concept, a CARLA-trained VLM-guided RL policy is transferred zero-shot to a full-scale battery-electric Ford E-Transit van in Madison, WI, USA, and drives across car-following, obstacle-avoidance, and stop-sign scenarios using no real-world training data. To our knowledge, this is among the first zero-shot closed-loop deployments of a CARLA-trained VLM-guided RL policy on a full-scale real vehicle, and the decomposition offers a principled, broadly applicable route for moving simulation-trained, foundation-model-guided policies into the physical world, supporting energy-efficient intelligent driving on electrified transportation platforms. The demo video, code, and model checkpoint are available at: https://zilin-huang.github.io/Sim2Real-AD-website/.

cs.RO cs.AI cs.CV