核心发现
方法论
本文系统研究了Hydra-MDP在轨迹词表密度上的扩展效果,发现随着轨迹锚点密度增加,性能持续提升未达饱和。提出SparseDriveV2,通过轨迹分解为几何路径和速度轮廓,构建超密集词表,并采用粗粒度路径和速度评分后细粒度轨迹评分的策略,有效覆盖行动空间。结合分解结构与多级评分机制,显著提升了词表密度(32倍),在NAVSIM和Bench2Drive等基准上取得SOTA性能。
关键结果
- 在NAVSIM上,SparseDriveV2实现92.0 PDMS和90.1 EPDMS,优于现有静态词表方法;在Bench2Drive中,Driving Score达89.15,成功率70.00,验证了超密集词表和高效评分策略的有效性。
- 通过逐步扩展词表密度,性能持续提升,未在计算限制前出现饱和,表明静态词表在充分密集时可媲美动态生成方案。
- 采用分解轨迹的结构,减少了模型复杂度,提升了扩展性,验证了分层评分策略在大规模词表中的实用性。
研究意义
该研究突破了静态轨迹词表在端到端自主驾驶中的瓶颈,证明高密度静态词表配合高效评分策略即可达到甚至超越动态生成方法的性能。这为未来自主驾驶系统的可扩展性和计算效率提供了新思路,降低了模型复杂度,推动了行业向更高性能、更低成本的方向发展。
技术贡献
提出基于轨迹几何路径与速度轮廓的因子化词表表示,极大扩展了行动空间覆盖范围。设计多级评分机制,先粗略筛选,再细粒度评估,有效兼顾效率与精度。结合大规模数据驱动的轨迹聚类,构建超密集词表,打破了静态词表性能瓶颈。模型架构简洁,易于扩展,验证在多个基准上优于现有SOTA。
新颖性
首次系统性验证静态轨迹词表密度对性能的影响,挑战了动态生成的必要性。创新在于轨迹分解与多级评分的结合,显著提升词表密度(32×),实现高效覆盖行动空间,突破传统静态词表的限制。
局限性
- 尽管词表密度大幅提升,但在极端复杂场景中仍可能面临覆盖不足的问题,尤其在动态环境变化剧烈时,静态词表的适应性有限。
- 模型在极大规模词表下的实时评分仍存在一定计算压力,未来需优化算法以进一步提升效率。
- 当前方法主要验证在模拟环境,实际部署中可能受传感噪声和环境变化影响,需结合感知增强策略。
未来方向
未来将探索自适应词表更新机制,结合在线学习和环境感知,提升在真实场景中的鲁棒性。还将结合多模态信息(如激光雷达、语义地图)优化轨迹表示,扩展到多任务场景,推动端到端自主驾驶的实用化。
AI 总览摘要
端到端自主驾驶作为未来智能交通的重要方向,面临着如何高效覆盖复杂行动空间的挑战。传统方法多依赖静态词表或动态生成,前者受限于离散化粗糙,后者则复杂且计算成本高。本文提出SparseDriveV2,通过轨迹的几何路径与速度轮廓的因子化表示,构建超密集的静态词表,显著提升覆盖能力。结合多级评分机制,先粗略筛选,再细粒度评估,有效兼顾效率与精度。实验结果显示,在NAVSIM和Bench2Drive上,性能优于现有方法,达成92.0 PDMS和89.15 Driving Score,验证了静态词表在高密度下的潜力。这一创新突破了静态词表的性能瓶颈,为自主驾驶系统的可扩展性提供了新思路。未来,结合在线学习和多模态信息,将推动端到端自主驾驶向更高鲁棒性和实用性迈进。
深度分析
研究背景
近年来,端到端自主驾驶逐渐成为研究热点,代表性方法包括VADv2、Hydra-MDP和DiffusionDrive等。静态轨迹词表通过聚类大规模驾驶数据获得,优点在于模型简洁,但在复杂场景下离散化带来性能瓶颈。动态生成方法如扩散模型和回归预测提供更细粒度的轨迹候选,但模型复杂度高,计算成本大。行业需求促使研究者探索静态词表的潜力,尤其在提升密度方面的突破成为关键。
核心问题
核心问题在于静态轨迹词表的离散化限制了行动空间的覆盖,导致在复杂环境中表现不佳。虽然动态生成提供更灵活的候选,但其复杂度和计算成本难以满足实时需求。如何在保持模型简洁的同时,显著增加词表密度,成为提升端到端自主驾驶性能的关键。现有研究未充分验证静态词表在高密度下的潜力,存在性能瓶颈与扩展性不足的问题。
核心创新
本文提出轨迹因子化表示,将轨迹拆分为几何路径和速度轮廓,极大丰富了行动空间的表达能力。引入多级评分策略,先粗略筛选,再精细评估,提升了大规模词表的评分效率。通过大规模数据驱动的轨迹聚类,构建超密集词表(32倍密度),突破静态词表性能瓶颈。模型架构简洁,易于扩展,验证在多个基准上优于现有SOTA。
方法详解
- �� 轨迹分解:将轨迹转换为几何路径和速度轮廓,分别进行聚类形成词表。• 词表构建:利用大规模驾驶数据,采用K-means聚类获得路径和速度锚点。• 轨迹重构:通过路径和速度轮廓组合生成候选轨迹。• 多级评分:先对路径和速度进行粗粒度评分,筛选出前K个候选;再对组合轨迹进行细粒度评分。• 训练:利用真实轨迹监督粗粒度和细粒度评分,结合规则系统进行多目标优化。
实验设计
采用NAVSIM和Bench2Drive两个公开基准,比较不同词表密度下的性能变化。训练中使用ResNet-34作为特征提取网络,评估指标包括PDMS、EPDMS、Driving Score和成功率。通过逐步扩展词表密度,验证性能持续提升,未在计算限制前饱和。还进行了消融实验,验证轨迹分解和多级评分的有效性。模型在不同复杂场景下表现一致优越,验证了方法的鲁棒性。
结果分析
在NAVSIM上,SparseDriveV2实现92.0 PDMS,优于现有静态词表方法;在Bench2Drive中,Driving Score达89.15,成功率70.00。词表密度提升32倍(1024×256到8192),性能持续改善,验证静态词表在充分密集时可媲美动态生成。多级评分显著降低计算负担,保证了大规模词表的实时性。模型在复杂交通场景中表现出色,验证了创新策略的有效性。
应用场景
该方法适用于自动驾驶车辆的路径规划,尤其在高密度词表和有限计算资源条件下。可部署于城市复杂交通环境,提升车辆决策的鲁棒性和效率。未来结合多模态感知信息,将实现更智能、更安全的自主驾驶系统,推动行业技术升级。
局限与展望
尽管词表密度大幅提升,但在极端复杂或动态变化剧烈的场景中仍可能存在覆盖不足的问题。模型在超大规模词表下的实时评分仍需优化,计算成本较高。当前验证主要在模拟环境,实际应用中需考虑传感噪声和环境变化带来的影响,未来需结合感知增强策略提升鲁棒性。
通俗解读 非专业人士也能看懂
想象你在准备一份非常丰富的菜单,菜单上有成千上万的菜肴选择。传统的方法就像是提前准备好一份有限的菜单,只包含几百个菜肴,虽然简单,但在面对复杂的宴会时,菜单可能不够丰富,不能满足所有客人的需求。而这篇论文提出的方法,就像是把菜肴拆分成不同的部分,比如主料和调料,然后用不同的组合方式,创造出无数新菜肴。这样一来,即使菜单变得超级丰富,也不用增加太多的准备工作。系统会先快速筛选出一些看起来不错的菜,然后再详细品尝,确保每一道菜都符合口味。最终,这样的菜单既丰富又高效,能满足各种复杂的宴会需求。这就像是用聪明的拆分和筛选,让菜单变得既丰富又实用,帮助厨师做出最棒的菜肴。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,拼图块有成千上万种不同的形状和颜色。以前的方法就像是提前准备好一份有限的拼图,虽然简单,但拼不出很多复杂的图案。这篇论文的方法就像是把拼图拆成两个部分:一部分是拼图的基本形状,另一部分是颜色和细节。然后用一种聪明的办法,把这些部分组合起来,拼出很多不同的图案。游戏开始时,系统会先快速挑出一些看起来不错的拼图组合,然后再仔细检查,确保拼得漂亮。这样一来,即使拼图很多,也不用花太多时间,就能拼出漂亮的图案。这就像是用聪明的拆分和筛选,让拼图变得既丰富又容易拼,帮你在游戏中取得好成绩。
原文摘要
End-to-end multi-modal planning has been widely adopted to model the uncertainty of driving behavior, typically by scoring candidate trajectories and selecting the optimal one. Existing approaches generally fall into two categories: scoring a large static trajectory vocabulary, or scoring a small set of dynamically generated proposals. While static vocabularies often suffer from coarse discretization of the action space, dynamic proposals provide finer-grained precision and have shown stronger empirical performance on existing benchmarks. However, it remains unclear whether dynamic generation is fundamentally necessary, or whether static vocabularies can already achieve comparable performance when they are sufficiently dense to cover the action space. In this work, we start with a systematic scaling study of Hydra-MDP, a representative scoring-based method, revealing that performance consistently improves as trajectory anchors become denser, without exhibiting saturation before computational constraints are reached. Motivated by this observation, we propose SparseDriveV2 to push the performance boundary of scoring-based planning through two complementary innovations: (1) a scalable vocabulary representation with a factorized structure that decomposes trajectories into geometric paths and velocity profiles, enabling combinatorial coverage of the action space, and (2) a scalable scoring strategy with coarse factorized scoring over paths and velocity profiles followed by fine-grained scoring on a small set of composed trajectories. By combining these two techniques, SparseDriveV2 achieves 92.0 PDMS and 90.1 EPDMS on NAVSIM, with 89.15 Driving Score and 70.00 Success Rate on Bench2Drive with a lightweight ResNet-34 as backbone. Code and model are released at https://github.com/swc-17/SparseDriveV2.