Off the Rails: Hijacking the Scoring Head in Generative End-to-End Driving Planners with Safety-Violating Adversarial Perturbations
提出DERAIL攻击框架,利用生成驾驶规划中的评分头漏洞,导致安全性显著下降(碰撞率达50%)。
核心发现
方法论
本文分析了端到端生成式自动驾驶系统中基于评分头的推理模式,发现其在固定候选轨迹评分中存在脆弱性。提出DERAIL攻击框架,通过行为级目标优化,利用梯度反向传播实现对多种生成规划模型的安全性破坏。攻击包括数字扰动和物理贴片两类,目标是使评分头从安全轨迹切换到危险轨迹。实验证明,DERAIL在DiffusionDrive、GTRS-DP、GTRS-AUG和GTRS-Dense等模型上,碰撞率最高达50%,得分下降幅度在39%-80%之间,显著优于传统的损失最大化和特征偏差攻击。
关键结果
- 在四个主流生成式规划模型上,DERAIL实现了100%的攻击成功率,碰撞率最高达50%,且在不同模型中均优于对比基线。攻击通过微小像素扰动或物理贴片,几乎不可察觉,却能引导模型产生危险轨迹。实验证明,攻击在不同候选集规模和多模态场景中均表现出强鲁棒性,验证了评分头作为攻击面的重要性。
研究意义
该研究揭示了端到端生成式自动驾驶系统中评分头的安全隐患,为未来自动驾驶安全性设计提供了警示。通过行为级目标优化,攻击可以在无需模型内部信息的情况下实现高效、隐蔽的安全破坏,挑战了现有的鲁棒性假设。此工作推动了自动驾驶系统对抗鲁棒性研究的深入,强调了在模型设计中加入安全过滤机制的必要性,具有重要的理论和实践价值。
技术贡献
本文提出了基于行为级目标的对抗攻击框架DERAIL,结合差分梯度优化实现对多种生成规划模型的通用攻击路径。创新点在于:1)识别评分头作为普遍攻击面,2)设计多目标行为损失,针对碰撞、偏离道路和突发刹车等安全关键点,3)支持数字扰动和物理贴片两种攻击方式,4)实现端到端可微的攻击流程,突破传统只针对感知或中间特征的限制。该方法显著提升了自动驾驶系统的安全性挑战能力。
新颖性
这是首次系统性研究生成式端到端自动驾驶模型中评分头的漏洞,提出基于行为目标的多模态对抗策略。与以往主要针对感知或中间特征的攻击不同,DERAIL直接在轨迹输出空间优化,能在不改变模型架构的前提下实现高效攻击,填补了该领域的研究空白。
局限性
- 当前攻击依赖白盒模型访问,实际场景中的黑盒攻击效果尚未验证。
- 攻击对模型的鲁棒性存在一定依赖,复杂环境下的泛化能力有限。
- 物理贴片的实用性受制于场景变化和贴片耐久性,实际部署仍具挑战。
未来方向
未来将探索黑盒攻击的可行性,增强攻击的鲁棒性和隐蔽性。同时,研究防御机制,如安全过滤和鲁棒训练,以提升自动驾驶系统的抗攻击能力。还将扩展多模态传感器融合的安全性分析,推动自动驾驶安全体系的完善。
AI 总览摘要
自动驾驶技术近年来快速发展,尤其是在轨迹生成方面,基于扩散模型和词汇检索的生成式规划成为主流。此类系统通过视觉特征评分头,从候选轨迹集中选择最优路径,然而这一环节成为潜在的安全漏洞。本文提出DERAIL框架,利用梯度优化行为级目标,攻击评分头,将安全轨迹切换为危险轨迹。实验结果显示,在四个主流模型中,DERAIL实现了最高50%的碰撞率, score下降幅度达80%,远超传统攻击方法。攻击方式包括微小像素扰动和物理贴片,几乎不可察觉,却能引发严重安全事故。该研究揭示了评分头作为普遍攻击面的重要性,强调在自动驾驶系统设计中加入安全过滤的必要性。未来,防御机制的研究将成为保障自动驾驶安全的关键方向。此工作不仅丰富了自动驾驶安全性理论,也为实际应用提供了警示,推动行业迈向更安全、更可靠的智能交通未来。
深度分析
研究背景
自动驾驶技术经历了从规则驱动到深度学习的演变,生成模型如扩散模型和词汇检索逐渐取代传统的回归方法,因其在多模态感知和轨迹多样性建模方面表现优越。代表性工作包括DiffusionDrive、GTRS系列等,它们通过视觉特征生成多样轨迹,满足复杂场景的需求。然而,随着系统在实际中的应用,安全性成为核心问题。深度模型的脆弱性、对抗攻击的研究不断深入,但大多集中在感知或中间特征层面,忽略了轨迹决策的关键环节——评分头。近年来,自动驾驶系统的安全性受到广泛关注,特别是在模型易受微小扰动影响的背景下,如何确保系统在各种攻击下仍能安全运行,成为研究热点。
核心问题
当前生成式自动驾驶模型普遍采用候选轨迹评分机制,最终由学习的评分头决定路径。由于评分头的决策边界较小,微小的输入扰动就可能引发轨迹切换,导致安全风险。尤其在实际应用中,攻击者可以利用视觉感知的漏洞,通过微小像素扰动或物理贴片,诱导模型选择危险轨迹。这一问题的核心在于:如何有效识别和防范评分头的攻击面,确保系统在面对恶意扰动时依然保持安全。解决这一问题对于自动驾驶的商业化推广和公共安全具有重要意义。
核心创新
本文的创新点在于:1)系统性识别生成式自动驾驶模型中评分头作为普遍攻击面,2)提出基于行为级目标的多目标对抗策略,直接在轨迹输出空间优化,3)支持数字扰动和物理贴片两种攻击方式,4)实现端到端可微的攻击流程,突破传统只针对感知特征的限制。这些创新使得攻击更具泛化性和隐蔽性,能够在不同模型和场景中实现高效破坏,为自动驾驶安全性研究提供了新的思路。
方法详解
- �� 识别生成模型中的五阶段推理链:视觉编码、候选轨迹生成、评分头计算、轨迹选择、无安全过滤。• 构建行为级目标,包括碰撞、偏离道路和突发刹车,作为优化目标。• 设计两类攻击:数字像素扰动(利用PGD)和物理贴片(利用可微合成和随机几何变换)。• 利用梯度反向传播,在轨迹空间中优化目标函数,生成扰动。• 结合EOT框架,增强物理贴片的鲁棒性。• 攻击目标是使评分头从安全轨迹切换到危险轨迹,通过微小扰动实现。• 提出多目标损失函数,平衡不同安全指标的破坏效果。
实验设计
- �� 采用NAVSIM基准数据集,测试DiffusionDrive、GTRS-DP、GTRS-AUG和GTRS-Dense四个模型。• 评估指标包括碰撞率、偏离率、错误行驶和安全距离等。• 攻击参数:像素扰动范围8/255,物理贴片256×256像素,优化迭代20次。• 比较基线包括未攻击、传统PGD、特征距离最大化等。• 通过不同候选集规模验证攻击的普适性和鲁棒性。• 实验还包括不同场景和多模态融合的效果分析。
结果分析
- �� DERAIL在所有模型上实现100%攻击成功率,碰撞率最高达50%,显著高于对比方法(如DP-Attacker,最高约25%)。• score下降幅度在39%-80%之间,表明微小扰动即可引发轨迹切换。• 物理贴片在不同模型中均有效,碰撞率提升至33%以上。• 攻击在不同候选轨迹规模下表现一致,验证了其泛化能力。• 实验还显示,结合多目标行为损失能有效引导模型产生危险轨迹。
应用场景
- �� 该攻击模型可用于测试自动驾驶系统的鲁棒性,提前发现潜在安全漏洞。• 未来可结合防御机制,提升系统抗攻击能力。• 在自动驾驶软件开发中,作为安全评估工具,帮助优化模型设计。• 也可用于模拟恶意攻击场景,制定应急响应策略。
局限与展望
- �� 目前主要在白盒环境下验证,黑盒攻击效果尚未充分验证。• 攻击依赖于模型的可微性,对某些鲁棒训练模型效果有限。• 物理贴片的实用性受限于场景变化和贴片耐久性。• 未来需研究更复杂环境和多模态融合下的攻击策略。
通俗解读 非专业人士也能看懂
想象你在操控一辆自动驾驶汽车,就像在操控一台智能机器人。这个机器人会根据摄像头看到的道路情况,选择一条最安全的路径。它会评估很多候选路径,然后用一个“评分器”决定哪条路径最好。现在,坏人偷偷在摄像头上贴了一个看不出来的贴纸,或者用特殊的光线让摄像头看到的画面变得不一样。这样,评分器可能会误判,把危险的路径当成最优路径,导致汽车走上一条危险的路。这个研究发现,这个“评分器”其实是个弱点,攻击者只要稍微干扰一下,就能让自动驾驶汽车变得不安全。科学家们设计了一个叫DERAIL的办法,模拟这种攻击,帮助开发者知道怎么防止这种情况发生,从而让自动驾驶更安全、更可靠。
简单解释 像给14岁少年讲一样
你知道吗?自动驾驶汽车其实就像一个超级聪明的机器人司机,它会看着前面的路,然后决定怎么走。它会考虑很多可能的路线,然后用一个“评分器”来判断哪条路最安全。可是,有坏人发现了这个“评分器”的漏洞,他们用一些特别的小技巧,比如偷偷在摄像头上贴个看不出来的贴纸,或者用光线让摄像头看到的画面变得不一样。这样一来,评分器就会误判,把危险的路线当成最好的,结果汽车可能会撞到东西或者偏离车道。这个研究告诉我们,这个“评分器”其实是个弱点,科学家们还设计了一个叫DERAIL的办法,模拟这种攻击,帮助大家知道怎么保护自动驾驶汽车,让它们变得更安全、更聪明。
原文摘要
Generative models have recently seen rapid adoption in End-to-End (E2E) autonomous driving (AD), with diffusion-based denoising and vocabulary-based retrieval becoming the dominant trajectory-decoding paradigms. Despite their architectural diversity, current generative AD planners share a common inference pattern: a fixed set of candidate trajectories (anchors, vocabulary entries, or proposal queries) is scored by one or more learned heads conditioned on the Bird's-Eye-View (BEV) features, and the highest-scored candidate is returned as the final trajectory. Under this design, the scoring head is the only barrier between perception and the motion command, and its decision margins between competing candidates are often small. We introduce \textsc{Derail}, an adversarial framework that exploits this scoring-head attack surface. Evaluated on various generative planners, \textsc{Derail} flips the trajectory selection from a safe to an unsafe candidate, with score drops of $39$--$80\%$ and collision rates of up to $50\%$, consistently outperforming generic loss-maximization and feature-divergence attacks. Our analysis suggests that safety-violating objectives govern attack effectiveness against generative AD planners, and that the scoring-head inference pattern itself is a recurring attack surface worth explicit defensive consideration.