Fine-tuning is Not Enough: A Parallel Framework for Collaborative Imitation and Reinforcement Learning in End-to-end Autonomous Driving

TL;DR

PaIR-Drive通过并行框架提升自动驾驶性能,达成91.2 PDMS。

cs.RO 🔴 高级 2026-03-14 3 次浏览
Zhexi Lian Haoran Wang Xuerun Yan Weimeng Lin Xianhong Zhang Yongyu Chen Jia Hu
自动驾驶 模仿学习 强化学习 并行框架 轨迹采样

核心发现

方法论

PaIR-Drive通过将模仿学习(IL)和强化学习(RL)分成两个并行分支,避免了传统顺序微调中的策略漂移问题。IL分支负责从传感器输入生成轨迹,而RL分支则通过树状结构的轨迹神经采样器进行探索,优化最终计划。

关键结果

  • PaIR-Drive在NAVSIMv1基准上实现了91.2 PDMS,相比Transfuser基线提高了5.7分,展示了其在复杂城市场景中的优越性能。
  • 在NAVSIMv2基准上,PaIR-Drive实现了87.9 EPDMS,显著改善了驾驶方向合规性和车道保持等指标。
  • 通过消融研究,验证了树状结构轨迹采样器在提高轨迹质量和探索效率方面的关键作用。

研究意义

该研究通过PaIR-Drive框架突破了传统自动驾驶方法的性能瓶颈,展示了在不重新训练RL分支的情况下,如何通过并行优化超越人类专家的驾驶表现。这为自动驾驶领域提供了一种新的性能提升工具。

技术贡献

PaIR-Drive的技术贡献在于其创新的并行优化框架,消除了IL和RL之间的优化冲突,并引入了树状结构的轨迹采样器,提升了探索效率和轨迹质量。

新颖性

PaIR-Drive首次将IL和RL分离为并行分支进行优化,避免了传统方法中的策略漂移和性能瓶颈问题,提供了一种灵活且适应性强的框架。

局限性

  • 在某些复杂场景下,RL分支的探索可能仍然不足,导致性能未能进一步提升。
  • 方法依赖于高质量的专家演示数据,可能限制其在数据稀缺环境中的应用。

未来方向

未来研究可以探索如何在数据稀缺的环境中提升PaIR-Drive的性能,以及如何进一步优化RL分支的探索策略以应对更复杂的驾驶场景。

AI 总览摘要

自动驾驶技术近年来发展迅速,但现有方法常依赖模仿学习,其性能受限于人类演示的质量。传统的顺序微调方法通过强化学习来优化,但容易导致策略漂移和性能瓶颈。PaIR-Drive通过将模仿学习和强化学习分成两个并行分支,解决了这些问题。

在PaIR-Drive中,模仿学习分支负责从传感器输入生成轨迹,而强化学习分支则通过树状结构的轨迹神经采样器进行探索,优化最终计划。实验结果显示,PaIR-Drive在NAVSIM基准上实现了显著的性能提升,超越了现有的强化学习微调方法。

尽管PaIR-Drive展示了其在复杂城市场景中的优越性能,但其仍面临一些局限,如在某些复杂场景下探索不足。未来的研究可以进一步优化其探索策略,并探索在数据稀缺环境中的应用。

深度分析

研究背景

自动驾驶技术的研究始于模仿学习,通过模仿人类驾驶员的行为来训练模型。然而,这种方法的性能受限于人类演示的质量,尤其是在处理复杂场景时。近年来,强化学习被引入以通过奖励机制优化驾驶策略,但传统的顺序微调方法容易导致策略漂移和性能瓶颈。

核心问题

现有的自动驾驶方法在性能上受限于模仿学习的质量,顺序强化学习微调容易导致策略漂移和性能瓶颈。如何在不重新训练的情况下超越人类专家的驾驶表现是一个关键挑战。

核心创新

PaIR-Drive通过创新的并行框架,将模仿学习和强化学习分成两个独立分支进行优化,避免了传统方法中的优化冲突。引入的树状结构轨迹采样器提升了探索效率和轨迹质量。

方法详解

  • �� IL分支:从传感器输入生成轨迹,受人类轨迹监督。
  • �� RL分支:使用BEV特征图和人类轨迹进行探索。
  • �� 树状结构轨迹采样器:预测驾驶意图下的轨迹点偏移。
  • �� GRPO:使用模拟奖励更新策略。

实验设计

在NAVSIMv1和v2基准上进行实验,使用Transfuser和DiffusionDrive作为基线。评估指标包括PDMS和EPDMS,消融研究验证了树状结构采样器的作用。

结果分析

PaIR-Drive在NAVSIMv1上实现了91.2 PDMS,相比Transfuser提高了5.7分。在NAVSIMv2上,PaIR-Drive实现了87.9 EPDMS,显著改善了驾驶方向合规性和车道保持等指标。

应用场景

PaIR-Drive可用于提升现有自动驾驶系统的性能,尤其是在复杂城市场景中。其灵活的框架使其易于集成到不同的自动驾驶方法中。

局限与展望

PaIR-Drive在某些复杂场景下的探索可能仍然不足,方法依赖于高质量的专家演示数据,可能限制其在数据稀缺环境中的应用。

通俗解读 非专业人士也能看懂

想象一个厨房,模仿学习就像一个新手厨师,严格按照食谱做菜,而强化学习则像一个经验丰富的厨师,通过不断尝试和品尝来调整菜肴的味道。PaIR-Drive就像一个厨房助手,帮助这两个厨师同时工作,避免他们在厨房里互相干扰。模仿学习负责基础的食材准备,而强化学习则在此基础上进行创新,尝试新的调味料和烹饪方法。最终的结果是,一道既符合食谱又有创新风味的美味佳肴。

简单解释 像给14岁少年讲一样

想象你在玩一个赛车游戏,模仿学习就像是你在看高手的比赛录像,然后尽量模仿他们的操作。但有时候这些高手也会犯错,比如走错路。强化学习就像是你在游戏中不断尝试新的路线,看看哪条路最快。PaIR-Drive就像是一个超级助手,它能同时帮你模仿高手的操作,还能让你自由探索新的路线。这样一来,你就能比那些高手跑得更快,更稳!

术语表

模仿学习 (Imitation Learning)

一种通过模仿人类专家行为来训练模型的方法,常用于自动驾驶。

在PaIR-Drive中,模仿学习用于生成基础驾驶轨迹。

强化学习 (Reinforcement Learning)

通过奖励机制优化策略的方法,适用于需要探索和试错的场景。

在PaIR-Drive中,强化学习用于探索和优化最终驾驶计划。

轨迹采样器 (Trajectory Sampler)

用于生成和优化轨迹的组件,帮助模型探索更优路径。

PaIR-Drive中使用树状结构轨迹采样器来提升探索效率。

PDMS

一种评估自动驾驶性能的指标,综合考虑安全性、舒适性等因素。

PaIR-Drive在NAVSIMv1基准上实现了91.2 PDMS。

EPDMS

扩展的PDMS指标,增加了方向合规性和车道保持等评估维度。

PaIR-Drive在NAVSIMv2基准上实现了87.9 EPDMS。

开放问题 这项研究留下的未解疑问

  • 1 如何在数据稀缺的环境中有效应用PaIR-Drive仍需探索。
  • 2 RL分支在复杂场景下的探索策略有待进一步优化。

应用场景

近期应用

城市自动驾驶

PaIR-Drive可用于提升城市自动驾驶系统的性能,特别是在复杂交通场景中。

远期愿景

全自动驾驶

通过进一步优化,PaIR-Drive有望实现完全自主的自动驾驶,减少对人类干预的依赖。

原文摘要

End-to-end autonomous driving is typically built upon imitation learning (IL), yet its performance is constrained by the quality of human demonstrations. To overcome this limitation, recent methods incorporate reinforcement learning (RL) through sequential fine-tuning. However, such a paradigm remains suboptimal: sequential RL fine-tuning can introduce policy drift and often leads to a performance ceiling due to its dependence on the pretrained IL policy. To address these issues, we propose PaIR-Drive, a general Parallel framework for collaborative Imitation and Reinforcement learning in end-to-end autonomous driving. During training, PaIR-Drive separates IL and RL into two parallel branches with conflict-free training objectives, enabling fully collaborative optimization. This design eliminates the need to retrain RL when applying a new IL policy. During inference, RL leverages the IL policy to further optimize the final plan, allowing performance beyond prior knowledge of IL. Furthermore, we introduce a tree-structured trajectory neural sampler to group relative policy optimization (GRPO) in the RL branch, which enhances exploration capability. Extensive analysis on NAVSIMv1 and v2 benchmark demonstrates that PaIR-Drive achieves Competitive performance of 91.2 PDMS and 87.9 EPDMS, building upon Transfuser and DiffusionDrive IL baselines. PaIR-Drive consistently outperforms existing RL fine-tuning methods, and could even correct human experts' suboptimal behaviors. Qualitative results further confirm that PaIR-Drive can effectively explore and generate high-quality trajectories.

cs.RO cs.AI