NTR: Neural Token Reconstruction for Scene Token Bottleneck in End-to-End Driving

TL;DR

引入神经Token重建(NTR)框架,通过 masked latent reconstruction 改善端到端自主驾驶中的场景Token瓶颈,提升性能。

cs.CV 🔴 高级 2026-05-29 42 次浏览
Jiahui Li Jiawei Sun Zixiang Ren Ming Liu Jiamin Shi Ruiteng Zhao Zhiyang Liu Liying Liu Zuoguan Wang Kaidi Yang
自主驾驶 表示学习 Transformer 场景理解 模型压缩

核心发现

方法论

NTR采用自蒸馏机制,通过在训练中引入masked latent重建目标,利用仅有的紧凑场景Token作为记忆,重建遮挡的patch级潜在特征。核心包括:• 使用在线ViT编码器处理遮挡图像,生成场景Token;• EMA教师编码器提供目标潜在特征;• 训练中引入semantic priors,偏向驾驶相关结构区域;• 仅在训练时引入重建模块,推理时无额外开销。该机制确保场景Token携带更丰富、非冗余的视觉信息,提升规划性能。

关键结果

  • 在Waymo E2E数据集上,NTR实现了8.0461的RFS,优于所有公开方法;在NavSim1&2上,PDMS达94.1,EPDMS达90.9,显著优于基线。消除冗余的场景Token表现出更高的有效秩和更低的相似性,验证了表示质量的提升。
  • 通过消除冗余,场景Token的有效维度增加,模型在多场景下表现更稳健,训练中引入semantic priors进一步引导重建目标,增强结构信息。
  • ablation实验显示,加入masked latent重建、EMA目标和semantic priors能显著提升RFS,分别从7.652提升至7.974,验证了各组件的贡献。

研究意义

该研究突破了端到端自主驾驶中场景表示的瓶颈问题,提出的NTR框架有效增强紧凑Token的表达能力,改善规划性能。通过引入masked latent重建,解决了仅由规划目标监督导致的表示冗余和信息不足问题,为未来自主系统的感知与决策融合提供新思路。该方法无需增加推理时成本,具有良好的实用性和扩展潜力,推动自主驾驶技术向更高的安全性和鲁棒性发展。

技术贡献

技术创新在于:• 提出基于masked latent重建的自蒸馏机制,直接监督场景Token的表达质量;• 引入foundation-model的semantic priors,偏向驾驶关键区域;• 在不改变推理架构的前提下,显著提升场景Token的表达丰富性和多样性。该方法结合Transformer的潜在特性,优化了表示的紧凑性与信息丰富性,为端到端规划提供了更强的表示基础。

新颖性

本研究首次在端到端自主驾驶中引入masked latent重建机制,直接监督场景Token的表达,突破了以往仅由规划目标弱监督的限制。结合foundation-model的semantic priors,创新性地引导重建目标,提升结构化信息的捕获能力,显著优于传统的架构设计和表示学习方法。

局限性

  • 该方法主要针对场景Token的压缩与表达,未直接改善视觉特征提取的质量,仍依赖预训练模型的表现;
  • semantic priors的质量受基础模型影响,在稀有或特殊场景中可能表现不足;
  • 训练过程中引入额外的重建目标增加了训练复杂度,可能影响训练效率。

未来方向

未来可结合更强的视觉预训练模型,提升基础特征质量;探索多模态信息融合,增强对稀有场景的适应能力;优化重建目标的自适应分配策略,减少对语义先验的依赖,提升模型泛化能力。

AI 总览摘要

端到端自主驾驶技术近年来取得显著进展,但场景理解的表达瓶颈仍制约系统性能。传统方法依赖复杂感知模块,导致系统复杂度高且鲁棒性不足。为此,本文提出了神经Token重建(NTR)框架,旨在通过masked latent重建机制,强化紧凑场景Token的表达能力。

NTR利用自蒸馏策略,结合在线编码器和EMA教师,训练过程中引入遮挡潜在特征重建任务,确保场景Token携带丰富的局部信息。引入foundation模型的semantic priors,偏向驾驶关键区域,提升重建目标的结构性。整个训练过程在不影响推理架构的前提下,显著改善场景Token的表达质量。

在Waymo E2E和NavSim数据集上,NTR实现了优异的性能:RFS达8.0461,PDMS达94.1,EPDMS达90.9,超越现有公开方法。实验证明,NTR有效降低Token冗余,提高表示多样性,增强模型的鲁棒性和泛化能力。该方法在实际车辆部署中表现出良好的适应性,展示了其在自动驾驶中的广泛应用潜力。

未来,结合更先进的视觉预训练模型和多模态信息,将进一步推动自主驾驶系统的感知与决策能力,向更高的安全性和效率迈进。

深度分析

研究背景

自主驾驶技术经历了从感知驱动到端到端规划的演变。早期依赖激光雷达和多传感器融合,后续引入深度学习模型实现端到端控制。代表性工作如Waymo的端到端系统,采用Transformer架构进行场景理解。尽管取得进展,但场景表示的紧凑性和信息丰富性仍是瓶颈,尤其在纯视觉系统中,如何在有限的Token数内保留关键视觉信息成为核心难题。近年来,Token压缩技术如Vision Transformer中的聚合Token逐渐成为研究热点,但其在自主驾驶中的应用仍面临冗余和信息不足的问题。

核心问题

核心问题在于如何在极度压缩的场景Token中,保持对规划决策至关重要的视觉信息。现有方法多依赖规划目标进行弱监督,导致Token表达冗余、信息缺失,影响系统鲁棒性和泛化能力。尤其在复杂交通场景中,冗余Token难以区分关键结构,限制了模型的理解深度和决策准确性。这一瓶颈阻碍了端到端系统在实际应用中的可靠性和安全性。

核心创新

本研究提出了NTR框架,创新点包括:• 通过masked latent重建,直接监督场景Token的表达质量,增强其信息丰富性;• 利用foundation模型的semantic priors,偏向驾驶关键区域,提升结构信息的捕获;• 在训练中引入自蒸馏机制,EMA教师提供稳定目标,避免模型退化。与传统只由规划目标监督的方案不同,NTR实现了对场景Token的有效引导,显著改善了表达质量和规划性能。

方法详解

  • �� 输入多视角图像和车辆状态,使用ViT编码器提取patch级特征;• 设计可学习的场景Token,进行多视角压缩,形成场景Token瓶颈;• 训练中引入masked latent重建目标,利用EMA教师提供潜在目标,偏向关键结构区域;• 采用semantic priors,通过foundation模型生成的掩码,动态分配重建区域;• 仅在训练时引入重建模块,推理时不影响原有规划架构,确保效率。

实验设计

在Waymo和NavSim数据集上,采用RFS、PDMS、EPDMS等指标进行评估。训练中使用预训练的DINOv2 ViT-S模型,重建比例设为0.3,EMA动量为0.999,优化器为AdamW。对比多种基线和消融模型,验证NTR在不同Token数量下的性能提升。通过多轮实验调优超参数,确保模型在真实场景中的鲁棒性和泛化能力。

结果分析

NTR在Waymo数据集上实现了8.0461的RFS,优于所有公开方法,且在NavSim上PDMS达94.1,EPDMS达90.9。消除冗余Token后,场景表示的有效秩提升,模型在复杂交通场景中表现更稳定。消融实验显示,Masked latent重建、EMA目标和semantic priors的结合带来最大性能提升,验证了各个组件的有效性。

应用场景

该方法适用于纯视觉端到端自主驾驶系统,特别在数据有限或复杂场景中表现优异。可用于未来自动驾驶车辆的场景理解模块,提升决策的鲁棒性和安全性。还可扩展到无人机、机器人等自主系统,改善其场景感知能力。

局限与展望

目前主要针对场景Token的压缩与表达,未直接优化视觉特征提取,依赖预训练模型质量。semantic priors在稀有场景中可能不足,训练过程增加复杂度,影响效率。未来需结合多模态信息和更强的预训练模型,提升泛化能力和效率。

通俗解读 非专业人士也能看懂

想象你在整理一堆照片,要把最重要的内容挑出来放在一个小盒子里,方便快速找到关键场景。传统方法就像只用一个标签告诉你“这是街道”,但没有告诉你具体有什么车、行人、交通灯。NTR就像用一种聪明的方式,不仅把重要的内容放进去,还能自己反复检查,确保没有遗漏关键细节。它用一种特殊的“记忆”机制,让这个小盒子里装的内容更丰富、更有用。这样,无论你走到哪里,都能快速找到重要信息,做出正确的驾驶决策。这就像一个聪明的助手,帮你把复杂的场景变得简单又可靠。

简单解释 像给14岁少年讲一样

嘿,你知道吗?开车时,车子其实要看很多东西,比如路标、车、行人、交通灯,但如果只用一小堆信息就能决定怎么走,那就厉害了!这篇论文就像发明了一种超级聪明的记忆系统,让车子能用很少的“关键词”就知道路况。它会自己反复练习,确保这些关键词能记住路上的重要细节,比如哪个车在变道,哪个交通灯亮了。这样,车子就能更快、更安全地开到目的地,就像你用一句话总结出一篇文章一样厉害。未来,这种技术还能让自动驾驶变得更聪明、更可靠!

原文摘要

Recent perception-free end-to-end (E2E) autonomous driving methods bypass explicit perception outputs by compressing dense image patch tokens into compact scene tokens for downstream trajectory generation and scoring. While these scene tokens form a compact visual bottleneck for the planner, they receive supervision solely from the planning objective, providing limited constraints on the encoded visual information. To address this limitation, we introduce Neural Token Reconstruction (NTR), a representation learning framework to directly constrain the compact scene-token bottleneck in perception-free driving. NTR introduces a self-distillation masked latent reconstruction objective that reconstructs masked patch-level latent features using only compact scene tokens as reconstruction memory. This forces reconstruction gradients to pass exclusively through the scene-token bottleneck, encouraging scene tokens to preserve richer and less redundant visual representations for planning. We further introduce semantic priors derived from foundation-model annotations as a weak semantic interface biasing reconstruction targets toward driving-related structures without introducing explicit perception heads. All auxiliary reconstruction components are removed at inference time, leaving the deployed planner unchanged. NTR achieves state-of-the-art performance on three public autonomous driving benchmarks, including 8.0461 RFS on Waymo E2E and 94.1 PDMS / 90.9 EPDMS on NavSim1&2. The learned scene tokens exhibit lower pairwise redundancy and higher effective rank, indicating that effective bottleneck supervision improves both compact visual representation learning and planning performance.

cs.CV cs.RO