Driving on Registers
DrivoR采用预训练ViT和注册令牌,压缩多摄像头信息,实现端到端自主驾驶,性能优越。
核心发现
方法论
本文提出基于预训练Vision Transformer(ViT)的端到端自主驾驶架构DrivoR,核心创新在于引入摄像头感知的注册令牌,将多摄像头特征压缩为紧凑的场景表示,显著降低后续计算成本。模型由三个Transformer模块组成:感知编码器、轨迹生成解码器和评分解码器。感知编码器利用LoRA微调的ViT-S提取视觉特征,并通过注册令牌实现多摄像头信息的压缩。轨迹解码器生成候选轨迹,评分解码器对候选轨迹进行评分,学习模仿oracle评分,预测安全、舒适和效率等子分数,实现行为条件驱动。训练采用Winner-Takes-All损失和子分数的二元交叉熵,推理时将评分视为奖励函数,支持多样化行为调控。
关键结果
- 在NAVSIM-v1和NAVSIM-v2数据集上,DrivoR超越或匹配最先进的基线方法,表现出优异的安全性和效率指标。例如,在NAVSIM-v1测试集上,DrivoR达到了94.6的PDMS分数,优于大部分对比方法,且模型参数仅约40M,计算效率提升3倍。
- 在NAVSIM-v2中,DrivoR在EPDMS指标上取得54.6的最高分,显著优于GTRS和RAP等方法。在HUGSIM闭环场景中,零样本迁移表现优异,达到49.8的道路完成率和35.7的HD-Score,验证了模型的泛化能力。
- 消融实验表明,注册令牌的引入大幅提升模型效率和性能,且分离的评分模块增强了行为调控能力。模型在不同数据增强和微调策略下保持鲁棒性,展现出良好的可扩展性。
研究意义
该研究突破了视觉特征压缩在端到端自主驾驶中的应用瓶颈,证明纯Transformer架构结合目标令牌压缩技术足以实现高效、准确的场景理解与决策。模型无需复杂中间表示或大规模轨迹词典,极大简化了系统设计,推动了自主驾驶模型的实用化进程。其行为调控机制为个性化和安全性提升提供了新思路,具有重要的学术和工业价值。
技术贡献
技术上,本文首次将ViT注册令牌用于多摄像头场景压缩,显著减少输入序列长度,降低计算复杂度。提出的双解码Transformer结构实现轨迹生成与评分的解耦,增强模型的多样性和可控性。引入子分数预测机制,使模型可根据不同偏好调节驾驶行为,提升系统的灵活性。整体架构简洁,参数量少,训练效率高,兼具性能与实用性。
新颖性
本研究的创新点在于首次将ViT注册令牌应用于端到端自主驾驶中的多摄像头特征压缩,突破了传统池化或复杂中间表示的限制。提出的解码-评分解耦设计和行为调控机制,为多模态感知与决策提供了新范式。与现有方法相比,极大简化了模型结构,提升了计算效率和泛化能力,填补了视觉特征压缩在此领域的空白。
局限性
- 模型依赖于高质量的摄像头感知,面对极端天气或遮挡场景可能性能下降;此外,纯Transformer架构在极高分辨率下仍存在计算瓶颈。
- 当前训练主要基于模拟数据,实际部署中需考虑传感器噪声和环境变化的适应性。
- 行为调控机制虽灵活,但在多目标优化和安全保障方面仍需进一步验证和完善。
未来方向
未来将探索多模态融合(如激光雷达、地图信息)以增强感知鲁棒性,优化行为调控策略实现更安全个性化驾驶。同时,计划引入强化学习机制提升模型在真实环境中的适应能力,推动端到端自主驾驶的商业落地。
AI 总览摘要
在自动驾驶领域,端到端学习方法因其简洁高效而受到关注,但面临感知信息庞大带来的计算瓶颈。本文提出的DrivoR架构,基于预训练的Vision Transformer(ViT)和摄像头感知的注册令牌,有效压缩多摄像头信息,显著降低后续处理负担。模型由感知编码器、轨迹生成解码器和评分解码器组成,前者通过注册令牌实现多视角信息的紧凑表达,后两者分别生成候选轨迹并进行评分,学习模仿oracle评分,预测安全、舒适和效率子分数,从而实现行为调控。实验结果显示,DrivoR在NAVSIM-v1、NAVSIM-v2和HUGSIM等多个数据集上表现优异,超越或接近最先进的基线方法,参数量仅40M,计算效率提升3倍,验证了纯Transformer架构结合目标令牌压缩的有效性。该方法简洁高效,为自主驾驶系统的实用化提供了新思路,尤其在多摄像头场景下的实时应用具有广阔前景。未来,模型将结合多模态信息和强化学习,进一步提升鲁棒性和个性化能力,推动自主驾驶技术的行业落地。
深度分析
研究背景
自动驾驶技术经历了从规则驱动到深度学习的演变,卷积神经网络(如ResNet)在感知中占据主导,但受限于计算成本和泛化能力。Transformer架构(如ViT)逐渐崭露头角,提供更强的特征表达能力。现有端到端方法多依赖复杂的中间表示或大规模轨迹词典,导致系统复杂且难以部署。近年来,关注点逐渐转向模型压缩与高效感知,尤其在多摄像头场景中,如何在保证感知精度的同时降低计算负担成为关键问题。此前的研究如VoV-Net、EVA、DINO等在感知性能上取得突破,但在端到端规划中的应用仍受限于特征维度和计算复杂度。
核心问题
核心问题在于多摄像头信息的高维视觉特征带来的计算瓶颈,传统池化方法虽能减缓负担,但损失了关键空间信息,影响规划精度。现有模型在保持高准确率的同时,难以实现实时性,尤其在复杂场景和高分辨率下表现不佳。此外,缺乏有效的场景压缩机制限制了模型的扩展性和行为调控能力,亟需一种既能压缩信息又能保留关键上下文的方案,以满足实际部署需求。
核心创新
本文提出注册令牌机制,将每个摄像头的特征通过微调的ViT生成一组紧凑的场景令牌,有效压缩多视角信息。引入的感知编码器无需复杂的中间表示,简洁高效。轨迹生成和评分两个解码器相互解耦,增强了模型的多样性和可控性。子分数预测机制使得模型可以根据不同偏好调整驾驶行为,提升个性化和安全性。整体架构简单,参数少,训练快,性能优越,突破了视觉特征压缩在端到端自主驾驶中的应用瓶颈。
方法详解
- �� 感知编码器:利用预训练ViT-S提取视觉特征,通过注册令牌实现多摄像头信息压缩,微调采用LoRA技术。• 轨迹解码器:输入学习的轨迹查询,结合ego状态,生成多候选轨迹,采用Winner-Takes-All损失训练。• 评分解码器:将轨迹转为查询,结合场景令牌进行评分,学习子分数预测,支持行为调控。• 训练目标:结合轨迹和评分损失,优化模型参数。• 推理阶段:将评分视为奖励函数,支持多样化行为调节。• 关键技术:注册令牌压缩、多解码器解耦、子分数调节,确保模型高效、灵活。
实验设计
使用NAVSIM-v1、NAVSIM-v2和HUGSIM数据集,比较多种基线模型,指标包括PDMS、EPDMS和道路完成率。训练采用Adam优化器,微调ViT采用LoRA,模型参数约40M。消融实验验证注册令牌的有效性,模型在不同场景下表现出优越的鲁棒性和泛化能力。通过对比不同数据增强策略,分析模型在复杂环境中的适应性。
结果分析
在NAVSIM-v1测试集,DrivoR达94.6的PDMS,优于大部分对比方法,参数少且计算快。在NAVSIM-v2中,EPDMS达54.6,领先于GTRS和RAP。HUGSIM闭环测试中,零样本迁移表现优异,道路完成率达49.8,HD-Score 35.7。消融实验显示注册令牌显著提升效率和性能,行为调控机制增强了模型的调节能力。
应用场景
该模型适用于多摄像头自动驾驶系统,特别在城市复杂场景中实现实时感知和决策。只需摄像头输入,无需额外传感器,便于部署。可用于无人驾驶、辅助驾驶等场景,提升安全性和效率。未来结合激光雷达和地图信息,将进一步增强系统鲁棒性。
局限与展望
模型对极端天气和遮挡敏感,感知性能可能下降。纯Transformer架构在高分辨率场景中仍存在计算瓶颈。训练依赖模拟数据,实际环境适应性待验证。行为调控机制在多目标优化中尚需完善,未来需考虑多模态融合和强化学习以提升鲁棒性。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,厨房里有很多不同的厨具和食材。每次做饭时,你需要看清所有食材的状态、位置和用量,然后决定用哪些厨具、放在哪个锅里。传统的方法就像用大锅把所有食材都搅在一起,虽然简单,但会丢失很多细节,做出来的菜可能不够好。现在,科学家们设计了一种聪明的“厨师助手”,它用一种特殊的“魔法眼镜”——叫做ViT,把每个摄像头看到的场景变成一组紧凑的“魔法符号”。这些符号像是厨房的简洁地图,告诉你哪些食材在哪、需要注意什么。这个助手还能根据不同的需求,比如快点做完或做得更安全,调整做菜的策略。它可以快速地帮你规划出一份菜谱,并判断哪条路线最安全、最舒服。这个系统就像一个聪明的厨房助手,既节省时间,又能做出高品质的菜肴,未来还能根据你的偏好,帮你做出个性化的美味佳肴。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的游戏,你的任务是带着一辆车在城市里跑。以前的方法就像用一堆大地图,把所有路、车、行人都画在一起,然后试图找到最好的路线,但地图太大,计算起来很慢。现在,这个新方法像是给你准备了一份特别的简洁地图,只用几个神奇的符号代表不同的视角,比如前面、左边、右边的路况。这些符号是用一种叫ViT的“魔法眼镜”生成的,能快速帮你理解整个场景。然后,系统会帮你画出几条可能的路线,像是“我可以走这条、那条”,并给每条路线打分,比如安全、舒服、快。你还可以告诉它,你更关心安全还是速度,它就会帮你调整选择。这样一来,你的车就能更快、更聪明地在城市里跑,避免危险,还能根据你的偏好做出不同的决策。就像你有一个超级智能的导航助手,帮你安全又快速地到达目的地!
术语表
Vision Transformer(ViT,视觉变换器)
一种基于Transformer架构的视觉特征提取模型,能有效捕捉图像中的长距离依赖关系。技术上,它将图像划分为块,像处理文本一样进行注意力计算。
在本文中,ViT用于提取多摄像头的视觉特征,并通过注册令牌实现场景压缩。
注册令牌(Register Tokens)
一种特殊的Token,用于编码每个摄像头的感知信息,压缩多视角特征为紧凑的场景表示。它们在Transformer中作为场景的“摘要”。
本文引入注册令牌,用于替代传统池化操作,提升信息压缩效率。
Winner-Takes-All(WTA,赢家通吃)损失
一种训练策略,只对最接近真实轨迹的候选轨迹进行监督,鼓励模型输出多样化的轨迹候选。
用于训练轨迹生成解码器,增强模型的多模态表达能力。
EPDMS(扩展预测驾驶模型评分)
一种综合衡量自主驾驶行为的指标,考虑安全、舒适、效率等多个子分数,用于评估模型性能。
在NAVSIM-v2中作为主要评估指标。
行为调控(Behavior Conditioning)
通过调整评分子分数的权重,实现对驾驶行为偏好的控制,比如偏重安全或速度。
本文模型支持根据不同偏好调节轨迹选择。
开放问题 这项研究留下的未解疑问
- 1 如何在极端复杂环境(如极端天气、夜间)下保持感知和决策的鲁棒性仍需研究,尤其是多模态融合策略的优化。
- 2 模型在实际部署中的在线学习和适应能力尚未充分验证,未来需结合强化学习或在线微调技术提升适应性。
- 3 在多目标、多约束场景下的行为调控机制还需完善,确保安全性与效率的平衡。
应用场景
近期应用
城市自动驾驶导航
可在城市复杂交通环境中实现实时路径规划和行为调节,降低硬件成本,提升安全性。
辅助驾驶系统
为高级驾驶辅助提供高效感知和决策支持,增强驾驶体验与安全保障。
远期愿景
全自动无人驾驶
结合多模态感知和强化学习,打造自主、智能、个性化的无人驾驶生态系统,逐步实现商业化。
原文摘要
We present DrivoR, a simple and efficient transformer-based architecture for end-to-end autonomous driving. Our approach builds on pretrained Vision Transformers (ViTs) and introduces camera-aware register tokens that compress multi-camera features into a compact scene representation, significantly reducing downstream computation without sacrificing accuracy. These tokens drive two lightweight transformer decoders that generate and then score candidate trajectories. The scoring decoder learns to mimic an oracle and predicts interpretable sub-scores representing aspects such as safety, comfort, and efficiency, enabling behavior-conditioned driving at inference. Despite its minimal design, DrivoR outperforms or matches strong contemporary baselines across NAVSIM-v1, NAVSIM-v2, and the photorealistic closed-loop HUGSIM benchmark. Our results show that a pure-transformer architecture, combined with targeted token compression, is sufficient for accurate, efficient, and adaptive end-to-end driving. Code and checkpoints will be made available via the project page.