核心发现
方法论
本文提出将学习到的轨迹奖励函数作为优化目标,结合交叉熵方法(CEM)在测试时对轨迹进行搜索。通过将冻结的端到端规划器提供的候选轨迹作为起点,利用高斯分布采样控制序列,经过多轮迭代优化,找到最大化奖励的轨迹。关键在于训练的奖励函数需具备良好的泛化能力,能在搜索空间外保持准确性。该方法无需重新训练,兼容多种规划器,显著提升性能。
关键结果
- 在NAVSIM-v1和NAVSIM-v2上,TOAD对六个基础规划器均实现性能提升,最大增幅达43.6%,NAVSIM-v2 EPDMS指标由34.7提升至49.8,逼近最优的PDM-Closed(56.6)水平。对DrivoR的零样本性能提升至56.3,创下新纪录。在HUGSIM闭环模拟中,TOAD改善了安全性指标(如TTC、NC)和舒适性,提升驾驶安全性和鲁棒性。
- 通过对比不同搜索策略(如平滑、重评分)验证,轨迹空间搜索优于控制空间搜索,且依赖于具有良好泛化能力的奖励函数(如DrivoR的解耦奖励器)。在六个不同基础规划器上,TOAD均实现性能提升,尤其在低性能规划器中效果最显著。
- 实验还显示,TOAD的优势源于探索轨迹空间中的新轨迹,而非简单重排序。其计算成本极低,利用预先提取的特征,单次推理时间在2ms以内,适合实时应用。
研究意义
该研究突破了传统轨迹规划中奖励函数仅用于排序的限制,将其转化为优化目标,极大拓展了端到端规划器的能力。通过引入测试时搜索机制,显著改善了自主驾驶系统在复杂场景中的鲁棒性和安全性,推动了自主驾驶技术向更高水平迈进。此方法兼容多种规划架构,为未来自主系统的模块化设计提供了新思路。
技术贡献
技术创新在于将训练好的轨迹奖励函数作为优化目标,结合CEM在测试时进行轨迹搜索,突破了传统只用于排序的限制。提出的控制空间采样策略确保轨迹的动态可行性和舒适性,利用信赖域限制搜索范围,避免偏离训练分布。该方法无需重新训练模型,具有良好的插件性和泛化能力,为端到端规划提供了新工具。
新颖性
首次将学习到的轨迹奖励函数作为优化目标,结合CEM在测试时进行轨迹搜索,突破了传统只用于排序的限制。与现有方法不同,本研究强调奖励函数的泛化能力,能在搜索空间外保持准确性,揭示了固定词汇奖励器的局限性,为自主驾驶轨迹优化提供新思路。
局限性
- 奖励函数的泛化能力依赖于训练时的正则化和数据多样性,若奖励器在极端场景下失效,搜索效果可能受影响。
- 本方法在复杂动态环境中仍需验证,尤其是在高密度交通或极端天气条件下的表现。
- 计算成本虽低,但在极端大规模场景中仍存在实时性挑战,需进一步优化算法效率。
未来方向
未来将探索多目标优化策略,结合环境感知和预测模型,提升搜索的鲁棒性和适应性。同时,结合强化学习进行奖励器的在线微调,以增强泛化能力。还计划在真实车辆上部署验证,推动工业化应用。
AI 总览摘要
自主驾驶技术的快速发展带来了端到端规划的广泛应用,但其局限在于候选轨迹集的有限性,导致性能受制于预定义的轨迹词汇。传统的评分机制仅在生成后进行排名,无法影响轨迹生成过程,限制了系统的潜力。本文提出的TOAD方法通过在测试时引入轨迹搜索,将训练好的奖励函数作为优化目标,显著提升了多种基础规划器的性能。
TOAD利用交叉熵方法(CEM)在控制空间进行多轮采样和优化,起点为规划器提供的候选轨迹。通过在轨迹空间中探索,能够发现更优的轨迹,增强系统的鲁棒性和安全性。关键在于奖励函数的泛化能力,只有能在搜索空间外保持准确的奖励器,才能实现有效优化。实验结果显示,TOAD在NAVSIM-v1和NAVSIM-v2上均取得优异表现,最大提升达43.6%,在NAVSIM-v2中逼近最优的PDM-Closed指标,创下56.3的EPDMS新纪录。
此外,TOAD在HUGSIM闭环模拟中也表现出优越的安全性和舒适性指标,验证了其实际应用潜力。该方法的核心创新在于将奖励函数转变为优化目标,结合控制空间采样,突破了传统的限制,为自主驾驶轨迹规划提供了新思路。未来,结合环境感知和多目标优化,将进一步推动自主驾驶系统的安全性和智能化水平。
深度解读
原文摘要
End-to-end planners for autonomous driving typically generate a set of candidate trajectories, score each one, and return the highest-scoring candidate. However, the scorer is applied only after the proposals are generated and cannot influence the set of trajectories: a weak set of candidates limits planning performance regardless of the scorer's quality. We instead treat the scorer as a learned trajectory-level reward function and search for trajectories that maximize it. Our method, TOAD, runs the Cross-Entropy Method at test time, warm-started from the planner's proposals. It requires no retraining and is plug-and-play for existing planners. Across six base planners, TOAD improves results on NAVSIM-v1 (94.7 PDMS), NAVSIM-v2 (56.3 EPDMS), and the closed-loop HUGSIM benchmark. The code will be made publicly available via the project page: https://valeoai.github.io/TOAD/.