OPTED: On-Policy Fine-Tuning for End-to-End Driving using a Render-Free Teacher

TL;DR

OPTED通过无渲染教师进行端到端驾驶的策略微调,驾驶分数提高1.6倍和9.5倍。

cs.RO 🔴 高级 2026-09-18 13 次浏览
Damiano Da Col Maximilian Igl Peter Karkus Kashyap Chitta Boris Ivanovic Marco Pavone Konrad Schindler Christos Sakaridis
强化学习 端到端驾驶 策略微调 闭环训练 人工智能

核心发现

方法论

OPTED方法通过无渲染教师进行端到端驾驶策略的闭环微调。教师使用强化学习在矢量化输入上训练,并在闭环微调中为预训练学生提供监督。该方法应用于TransFuser和VaVAM模型,并在AlpaSim中进行微调。

关键结果

  • 在AlpaSim中,TransFuser的驾驶分数提高了1.6倍,而VaVAM提高了9.5倍,显示出显著的性能提升。
  • OPTED在闭环性能上与直接RL微调相匹配,但模拟器交互次数减少了三个数量级。
  • 实验表明OPTED在保持与人类先验接近的同时,显著提高了闭环驾驶性能。

研究意义

该研究通过引入无渲染教师,解决了端到端驾驶策略在闭环部署时可能出现的安全问题。OPTED方法不仅提高了驾驶性能,还降低了模拟器交互成本,为自动驾驶领域提供了新的解决方案。

技术贡献

OPTED通过将教师和学生分离到不同的模拟器中,避免了渲染成本高的问题,提供了更高效的闭环微调方法。该方法允许在大规模未配对数据集上进行预训练,提高了可扩展性和适用性。

新颖性

OPTED首次将无渲染教师应用于端到端驾驶策略的闭环微调,提供了一种更高效的训练方法,与现有的单一模拟器蒸馏方法相比具有显著优势。

局限性

  • OPTED依赖于教师的准确性,教师的错误可能导致学生策略的偏差。
  • 在某些复杂场景中,教师可能无法提供足够的监督信息。

未来方向

未来研究可以探索教师模型的改进,以及在更多驾驶场景中的应用,以进一步提高OPTED的性能和适用性。

AI 总览摘要

随着预训练数据规模的扩大,单靠数据扩展已无法带来显著收益,后训练在自动驾驶等物理AI领域变得越来越重要。端到端驾驶策略通过行为克隆进行开放式预训练,但在闭环部署时可能出现累计错误,增加安全风险。OPTED通过无渲染教师进行闭环微调,解决了这一问题。教师在矢量化输入上使用强化学习训练,然后在闭环微调中为预训练学生提供监督。实验结果显示,OPTED显著提高了驾驶性能,同时减少了模拟器交互次数。该方法不仅提高了驾驶性能,还降低了模拟器交互成本,为自动驾驶领域提供了新的解决方案。

深度分析

研究背景

自动驾驶领域的研究一直致力于提高驾驶策略的安全性和效率。传统的端到端驾驶策略通过行为克隆进行预训练,但在闭环部署时可能出现累计错误,导致车辆偏离训练数据分布,增加安全风险。闭环后训练可以缓解这一风险,但需要昂贵的传感器模拟。

核心问题

端到端驾驶策略在闭环部署时可能出现累计错误,导致车辆偏离训练数据分布,增加安全风险。如何在不增加模拟器交互成本的情况下提高闭环驾驶性能是一个重要问题。

核心创新

OPTED通过无渲染教师进行闭环微调,解决了端到端驾驶策略在闭环部署时可能出现的安全问题。教师使用强化学习在矢量化输入上训练,并在闭环微调中为预训练学生提供监督。

方法详解

  • �� 教师使用强化学习在矢量化输入上训练,避免了昂贵的渲染成本。
  • �� 学生在闭环微调中接受教师的监督,减少了模拟器交互次数。
  • �� OPTED方法允许在大规模未配对数据集上进行预训练,提高了可扩展性和适用性。

实验设计

实验在AlpaSim中进行,使用真实驾驶日志的神经重建。对TransFuser和VaVAM模型进行微调,并与直接RL微调进行比较。结果显示OPTED在闭环性能上与直接RL微调相匹配,但模拟器交互次数减少了三个数量级。

结果分析

实验结果显示,OPTED显著提高了驾驶性能,TransFuser的驾驶分数提高了1.6倍,而VaVAM提高了9.5倍。OPTED在保持与人类先验接近的同时,显著提高了闭环驾驶性能。

应用场景

OPTED方法可以应用于自动驾驶领域,提高驾驶策略的安全性和效率。该方法降低了模拟器交互成本,为自动驾驶领域提供了新的解决方案。

局限与展望

OPTED依赖于教师的准确性,教师的错误可能导致学生策略的偏差。在某些复杂场景中,教师可能无法提供足够的监督信息。未来研究可以探索教师模型的改进,以进一步提高OPTED的性能和适用性。

通俗解读 非专业人士也能看懂

想象你在开车,车里有一个经验丰富的驾驶教练,他通过观察地图和交通情况来指导你,而不是通过车窗看风景。这就是OPTED方法的工作原理。教练使用地图和交通信息进行训练,然后在你开车时提供指导,帮助你避免错误。这样你可以更安全地驾驶,同时减少模拟器的使用。

简单解释 像给14岁少年讲一样

想象一下你在玩一个赛车游戏,游戏里有一个超级聪明的AI助手,它通过观察地图和交通情况来指导你,而不是通过游戏画面。这就是OPTED方法的工作原理。AI助手使用地图和交通信息进行训练,然后在你玩游戏时提供指导,帮助你避免错误。这样你可以更安全地玩游戏,同时减少游戏的加载时间。

术语表

强化学习 (Reinforcement Learning)

一种机器学习方法,通过奖励和惩罚来训练模型,使其在给定环境中做出最佳决策。

在OPTED中用于训练教师模型。

行为克隆 (Behavior Cloning)

一种机器学习方法,通过模仿人类示范来训练模型,使其能够在相似环境中做出类似决策。

用于端到端驾驶策略的开放式预训练。

闭环训练 (Closed-loop Training)

一种训练方法,模型的输出影响其下一步的输入,模拟真实环境中的连续决策过程。

在OPTED中用于微调学生模型。

矢量化输入 (Vectorized Input)

一种数据表示方式,将复杂的环境信息简化为矢量形式,便于模型处理。

用于教师模型的训练。

模拟器交互 (Simulator Interaction)

模型与模拟环境进行交互的过程,用于训练和测试模型的性能。

OPTED通过减少模拟器交互次数来提高训练效率。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提高教师模型的准确性,以减少学生策略的偏差?
  • 2 在复杂驾驶场景中,如何确保教师提供足够的监督信息?

应用场景

近期应用

自动驾驶测试

OPTED可以用于自动驾驶车辆的测试,提高测试效率和安全性。需要高质量的驾驶日志和地图数据。

远期愿景

智能交通系统

OPTED可以用于智能交通系统的开发,提高交通管理效率。需要解决数据同步和实时处理的问题。

原文摘要

As scaling pre-training data alone yields diminishing returns, post-training is becoming increasingly important across physical AI domains such as autonomous driving. End-to-end driving policies are pre-trained in open loop with behavior cloning on human demonstrations. However, compounding errors during closed-loop deployment can take the vehicle outside the training data distribution, increasing the risk of safety-critical incidents. Closed-loop post-training can mitigate this risk but requires costly simulation for sensor-based policies. We propose OPTED (on-policy fine-tuning for end-to-end driving) which decouples reinforcement learning from the post-training of the end-to-end policy: a privileged teacher is trained using RL on vectorized inputs (HD-map and bounding boxes). This teacher then provides supervision to the pre-trained student during closed-loop post-training. We apply OPTED to two camera-based models, TransFuser and VaVAM, and fine-tune them in AlpaSim, using neural reconstructions (3DGS) of real driving logs. Driving scores increase by factors of 1.6$\times$ and 9.5$\times$, respectively. In controlled experiments OPTED matches closed-loop performance with approximately three orders of magnitude fewer simulator interactions than direct RL post-training, while staying closer to the human prior. Project page: https://01dami23.github.io/opted/

cs.RO cs.CV cs.LG