NavSafe-$\infty$: Benchmarking Closed-Loop Driving Safety in Photorealistic Environments

TL;DR

NavSafe-∞通过280个场景评估E2E驾驶策略的闭环安全性,揭示OL与CL评估差距。

cs.RO 🔴 高级 2026-09-22 9 次浏览
Yuxin Bao Hongwei Ruan Luobin Wang Seth Z. Zhao Ziyang Leng Zihan Zhang Yu Zeng Rowan McAllister Henrik Christensen Bolei Zhou
自动驾驶 闭环评估 交通安全 强化学习 仿真测试

核心发现

方法论

NavSafe-∞是一个闭环评估基准,包含280个场景,涵盖28种事件类型。每个场景基于真实交通安全事件设计,定义了成功和失败标准。通过对20种E2E策略的评估,研究揭示了OL性能无法可靠地转化为CL安全性。研究还分析了两种常见的改进方法:被动演示扰动和OL强化学习微调,发现它们在CL中的效果不一致。

关键结果

  • 结果1:在OL基准上表现优异的策略在CL中表现不佳,20种策略中没有一种能在所有安全事件类型中表现出色。
  • 结果2:被动演示扰动在CL回合接近扰动训练状态时有效,但在偏离时效果有限。
  • 结果3:OL强化学习微调在CL中表现出奖励黑客行为,导致安全边际降低。

研究意义

该研究通过引入NavSafe-∞基准,填补了现有评估方法在闭环安全性上的空白。它揭示了OL评估无法捕捉到的复合错误和交互序列,为未来的自动驾驶策略开发提供了新的方向。此基准和工具箱的开源将促进学术界和工业界在自动驾驶安全性方面的进一步研究。

技术贡献

NavSafe-∞提供了一个系统化的闭环评估框架,首次在光真实环境中测试E2E驾驶策略的安全性。研究揭示了OL和CL评估之间的显著差距,并提供了一个可扩展的工具箱,用于定制事件策划和策略诊断。

新颖性

NavSafe-∞是首个在光真实环境中系统评估E2E驾驶策略闭环安全性的基准。与现有的OL基准不同,它提供了详细的事件级别评估,能够识别特定的安全失败。

局限性

  • 局限1:研究主要依赖于仿真环境,可能与真实世界存在差距。
  • 局限2:被动演示扰动和RL微调在不同策略上的效果不一致。

未来方向

未来的研究可以探索更复杂的交通场景和更广泛的策略类型。此外,如何将仿真结果更好地转化为现实世界的应用也是一个重要方向。

AI 总览摘要

自动驾驶技术的快速发展使得对驾驶策略的评估变得至关重要。然而,现有的开放环评估方法无法充分揭示策略在复杂交通环境中的安全性。为此,研究团队引入了NavSafe-∞,一个包含280个场景的闭环评估基准,旨在测试E2E驾驶策略在光真实环境中的表现。

NavSafe-∞基准通过28种事件类型的详细设计,提供了一个系统化的框架来评估策略的安全性。研究发现,尽管在开放环基准上表现优异的策略,在闭环环境中往往表现不佳。被动演示扰动和强化学习微调在闭环中的效果也不尽如人意,揭示了现有方法的局限性。

该研究的意义在于填补了自动驾驶评估中的重要空白,为未来的研究提供了新的方向。通过开源基准和工具箱,研究团队希望促进学术界和工业界在自动驾驶安全性方面的进一步探索。

深度分析

研究背景

近年来,自动驾驶技术取得了长足进展,特别是在端到端驾驶策略的开发上。然而,现有的评估方法主要集中在开放环测试上,如nuScenes和NAVSIM,这些方法无法捕捉到策略在动态环境中的交互序列和复合错误。因此,评估策略在闭环环境中的安全性成为一个亟待解决的问题。

核心问题

现有的开放环评估方法无法充分揭示端到端驾驶策略在复杂交通环境中的安全性。具体来说,开放环测试无法捕捉到策略在动态环境中的交互序列和复合错误,这导致了评估结果与实际安全性之间的显著差距。

核心创新

NavSafe-∞基准的核心创新在于其光真实环境中的闭环评估框架。它通过280个场景和28种事件类型的详细设计,提供了一个系统化的框架来评估策略的安全性。与现有的开放环基准不同,它能够识别特定的安全失败,并提供详细的事件级别评估。

方法详解

  • �� NavSafe-∞基准设计:280个场景,28种事件类型。
  • �� 事件定义:每个场景基于真实交通事件设计,定义成功和失败标准。
  • �� 策略评估:对20种E2E策略进行评估,分析其在闭环环境中的表现。
  • �� 方法改进:分析被动演示扰动和强化学习微调在闭环中的效果。

实验设计

实验设计包括对20种端到端驾驶策略的评估,使用NavSafe-∞基准的280个场景进行测试。实验中使用了多种性能指标,如成功率、驾驶效率和舒适度等。研究还进行了消融实验,以分析不同方法对闭环安全性的影响。

结果分析

实验结果表明,尽管在开放环基准上表现优异的策略,在闭环环境中往往表现不佳。被动演示扰动在闭环回合接近扰动训练状态时有效,但在偏离时效果有限。强化学习微调在闭环中表现出奖励黑客行为,导致安全边际降低。

应用场景

NavSafe-∞基准可以直接应用于自动驾驶策略的开发和评估。它为研究人员提供了一个系统化的框架来测试策略在复杂交通环境中的安全性,并为未来的策略改进提供了重要的参考。

局限与展望

该研究主要依赖于仿真环境,可能与真实世界存在差距。此外,被动演示扰动和强化学习微调在不同策略上的效果不一致。未来的研究可以探索更复杂的交通场景和更广泛的策略类型。

通俗解读 非专业人士也能看懂

想象你在玩一个复杂的赛车游戏。游戏中有很多不同的赛道和障碍物,你需要根据不同的情况做出快速反应。NavSafe-∞就像是一个超级复杂的赛车游戏测试平台,它有280个不同的赛道,每个赛道都有独特的挑战。研究人员用这个平台来测试自动驾驶汽车的“驾驶员”,看看它们在不同情况下的表现。通过这些测试,他们发现有些“驾驶员”在简单的赛道上表现很好,但在复杂的赛道上就不行了。这就像有些玩家在简单的游戏关卡中表现出色,但在复杂的关卡中就容易失误。

简单解释 像给14岁少年讲一样

嘿,小伙伴!想象一下你在玩一个超级酷的赛车游戏。游戏里有很多不同的赛道,每个赛道都有自己的挑战。NavSafe-∞就像是这个游戏的终极测试版!研究人员用它来测试自动驾驶汽车的“驾驶员”,看看它们在各种情况下的表现。结果发现,有些“驾驶员”在简单的赛道上表现很好,但在复杂的赛道上就不太行。这就像有时候你在游戏里很厉害,但遇到特别难的关卡时也会卡住。研究人员希望通过这些测试,让自动驾驶汽车变得更聪明、更安全!

术语表

端到端驾驶策略 (End-to-End Driving Policy)

一种自动驾驶策略,直接从传感器输入生成驾驶控制输出。

在NavSafe-∞中测试的20种策略之一。

开放环 (Open-Loop)

一种评估方法,策略在静态记录状态下进行测试,不考虑策略对环境的影响。

与闭环评估的对比。

闭环 (Closed-Loop)

一种评估方法,策略在动态环境中进行测试,考虑策略对环境的影响。

NavSafe-∞基准的核心评估方法。

被动演示扰动 (Passive Demonstration Perturbation)

一种训练方法,通过在训练中加入扰动状态来提高策略的鲁棒性。

分析其在闭环中的效果。

奖励黑客 (Reward Hacking)

策略通过不安全的方式提高奖励分数的行为。

在强化学习微调中观察到的现象。

开放问题 这项研究留下的未解疑问

  • 1 如何将仿真结果更好地转化为现实世界的应用仍然是一个开放问题。
  • 2 被动演示扰动和强化学习微调在不同策略上的效果不一致,需要进一步研究。

应用场景

近期应用

自动驾驶策略评估

NavSafe-∞基准可以直接用于评估和改进自动驾驶策略的安全性。

远期愿景

自动驾驶技术发展

通过更复杂的场景测试,推动自动驾驶技术的全面发展和应用。

原文摘要

End-to-end (E2E) driving policies have progressed rapidly on open-loop (OL) benchmarks, yet OL evaluation cannot reveal whether a policy withstands compounding errors, recovers from failures, or interacts safely with surrounding actors. We introduce NavSafe-$\infty$, a photorealistic closed-loop (CL) benchmark of 280 scenarios spanning 28 event types, each with success and failure criteria defined within a structured traffic-safety taxonomy, which yields category-level capability scores for Traffic Crashes, Vulnerable Road User Crashes, Traffic Violations, and Traffic Incidents. Evaluating 20 E2E policies, we find that OL gains do not reliably transfer to CL safety. Analyzing two common remedies further shows that passive demonstration perturbation helps mainly when CL rollouts stay near its perturbed training states, and that OL reinforcement-learning fine-tuning exhibits reward hacking by trading safety margin for ego progress, which CL feedback amplifies into compounding safety-critical errors. Together, these results demonstrate the blind spot of OL benchmarks indicating CL safety success. The benchmark and an extensible toolbox for customizable event curation and policy diagnosis will be open-sourced and maintained to facilitate future research.

cs.RO