Unified Driving Tokens: Representation- and Geometry-Guided Discrete Tokenizer for Driving World Models and Planning

TL;DR

提出基于表示和几何增强的统一离散驾驶标记器,提升自主驾驶中的场景重建与规划性能。

cs.CV 🔴 高级 2026-06-01 50 次浏览
Ziyang Yao Zeyu Zhu YunCheng Jiang Zibin Guo Huijing Zhao
自主驾驶 离散标记 场景理解 规划模型 几何增强

核心发现

方法论

本文提出一种结合表示引导与几何增强的离散标记器,基于VQ-VAE架构,利用冻结的DINO特征空间进行语义对齐,通过RGB重建、深度与相对位姿的跨帧监督,结合多码本量化稳定训练。模型在NAVSIM数据集上实现了高保真重建、语义一致性,并在轻量级规划和GPT风格的世界模型中表现出优异的生成与预测能力。

关键结果

  • 在NAVSIM测试集上,提出模型的重建指标rFID提升至4.15,PSNR达26.51,SSIM为0.774,优于基线方法。深度预测的AbsRel误差为0.0556,姿态误差Trans为0.647m,Rot为2.01°,显示几何信息的有效融入。规划任务中,利用离散标记作为输入,轻量级轨迹预测模型显著改善路径规划的准确性和安全性,生成质量优于传统像素重建方法。
  • 引入多码本量化机制,有效缓解联合监督下的容量竞争,保持了高质量的外观重建同时增强了几何和语义表达能力。在自动回归世界模型中,离散标记的预测准确率达85%以上,生成的未来场景连续性和多样性优于对比方法,验证了离散标记在多任务中的通用性。
  • 通过在不同任务中复用同一离散标记接口,模型实现了端到端的场景理解、预测和生成能力,展现出在自主驾驶系统中统一表示的潜力,为未来多模态、多任务一体化提供了技术基础。

研究意义

本研究突破了传统仅优化像素重建的离散标记器局限,提出面向自主驾驶的语义与几何双重引导的离散表示,显著提升了场景理解、路径规划与场景生成的协同性。其创新的多码本量化机制和跨帧几何监督,为场景的连续性和结构一致性提供了坚实保障,推动了自主驾驶中统一场景表示的研究进展。这不仅丰富了视觉标记器的理论体系,也为实际自动驾驶系统的安全性、鲁棒性和效率提升提供了新途径。

技术贡献

本文提出结合表示引导与几何增强的离散标记器,创新性地引入多码本量化机制以缓解容量瓶颈,利用冻结的DINO特征实现语义对齐,并通过跨帧深度与相对位姿监督强化几何信息的表达。模型在VQ-VAE基础上,融合RGB与语义特征的联合重建,确保外观与语义信息的双重保留。实验中,离散标记在轻量级规划和GPT风格世界模型中表现出优异的任务适应性,验证了其作为统一场景表示的有效性。这一框架为多任务、多模态自主驾驶提供了新思路,拓展了离散表示在复杂动态场景中的应用潜力。

新颖性

本研究首次提出面向自主驾驶的表示与几何双重引导的离散标记器,突破了传统像素重建导向的限制,融合语义对齐与几何监督,采用多码本机制增强容量,实现在多任务中的统一表达。相比现有方法,显著提升了场景的结构一致性和任务适应性,为离散表示在自主驾驶中的应用开辟了新路径。

局限性

  • 模型在极端复杂或动态变化剧烈的场景下,几何与语义信息的表达仍存在一定偏差,可能影响规划与生成的准确性。
  • 多码本机制虽然缓解了容量瓶颈,但增加了模型复杂度,训练和推理成本较高,限制了在资源受限场景中的部署。
  • 当前方法主要在NAVSIM数据集上验证,泛化到真实世界复杂场景仍需进一步验证和优化。

未来方向

未来将探索多模态信息融合,如激光雷达与语音信号,提升场景理解的丰富性;同时优化模型结构以降低计算成本,增强在边缘设备的实用性。此外,将结合强化学习优化路径规划策略,进一步提升自主驾驶的安全性与鲁棒性。

AI 总览摘要

自主驾驶技术的核心挑战在于高效、准确地理解复杂场景并做出安全决策。传统的视觉标记器多侧重于像素重建,难以兼顾场景语义和几何信息,限制了其在路径规划和场景生成中的应用潜力。本文提出一种融合表示引导与几何增强的统一离散标记器,基于VQ-VAE架构,利用冻结的DINO特征实现语义对齐,结合跨帧深度和相对位姿监督,采用多码本机制稳定训练。该模型在NAVSIM数据集上实现了高保真重建和语义一致性,显著优于现有方法。在规划任务中,离散标记作为输入,提升了路径预测的准确性和安全性,同时在GPT风格的世界模型中展现出优异的生成能力。这一研究突破了传统仅关注像素的标记器局限,为自主驾驶中的场景理解、预测与生成提供了统一的技术框架。未来,将进一步结合多模态信息和强化学习,推动自主系统的安全性和智能化水平迈上新台阶。

深度分析

研究背景

自主驾驶的发展经历了从基于规则的系统到深度学习的场景理解,代表性工作如Waymo的端到端深度模型、Tesla的自动驾驶辅助系统。近年来,生成模型如扩散模型和VQ-VAE推动了场景合成与理解的融合,但多任务统一表示仍是难点。传统离散标记器多偏重像素重建,缺乏对语义和几何信息的有效融合,限制了其在路径规划和场景预测中的应用效果。

核心问题

核心问题在于如何设计一种既能支持高质量场景重建,又能有效编码语义和几何信息的离散标记器。现有方法多偏重像素重建,忽视场景的结构和动态信息,导致在路径规划和场景生成中表现不足。此外,容量限制和训练不稳定也制约了多任务的实现,亟需一种兼顾多方面需求的统一表示方案。

核心创新

创新点包括:1)引入表示引导机制,通过冻结的DINO特征实现语义对齐,增强语义表达;2)结合跨帧深度和相对位姿监督,强化几何信息的连续性;3)采用多码本量化机制,缓解容量竞争,提升表达能力;4)在VQ-VAE基础上联合RGB与语义重建,确保外观与语义的双重保留。这些创新共同实现了场景的高效、结构化、连续性表达,为多任务自主驾驶提供了新思路。

方法详解

  • �� 输入:RGB图像和冻结的DINO特征;
  • �� 编码:结合RGB细节分支和DINO特征,通过Transformer融合;
  • �� 量化:多码本机制,将特征映射到离散码字,缓解容量瓶颈;
  • �� 重建:联合RGB和DINO特征的解码,确保外观和语义一致性;
  • �� 跨帧监督:引入深度和相对位姿,增强几何连续性;
  • �� 训练目标:结合重建损失、语义对齐、对抗训练和容量正则,优化模型;
  • �� 规划:在冻结的离散标记上训练轻量级轨迹预测器;
  • �� 世界模型:训练GPT风格的自回归模型,预测未来场景。

实验设计

使用NAVSIM数据集,模型在不同配置下进行训练与评估。对比基线包括传统像素重建和现有离散标记方法,指标涵盖重建质量(rFID、PSNR、SSIM)、深度误差(AbsRel)和姿态误差(Trans、Rot)。规划性能通过路径预测准确率和安全指标评估,生成能力通过自回归模型的连续性和多样性验证。实验还包括容量分析和消融研究,验证多码本机制的有效性。

结果分析

模型在NAVSIM测试集上,重建指标明显优于基线,rFID降至4.15,PSNR达26.51,SSIM为0.774。深度误差显著降低,Trans误差为0.647m,Rot为2.01°。在路径规划中,离散标记提升路径预测准确率,减少碰撞风险。自回归模型生成的场景连续性和多样性优于对比方法,验证了离散标记的多任务适应性。这些结果表明,提出的方法在场景理解、预测和生成方面实现了良好的融合。

应用场景

该技术可应用于自动驾驶中的场景感知、路径规划和场景模拟。离散标记作为统一接口,简化多任务模型设计,提升系统整体效率。未来,结合多模态信息(如激光雷达、语音)将进一步丰富场景理解,推动自主系统的安全性和鲁棒性提升。

局限与展望

当前模型在极端复杂或动态剧烈变化的场景中表现有限,几何和语义信息的表达仍有提升空间。多码本机制虽然增强容量,但增加了模型复杂度和计算成本,限制了在资源有限设备上的部署。模型在真实世界数据的泛化能力仍需验证,未来需结合更多多模态信息和优化算法以实现更广泛应用。

通俗解读 非专业人士也能看懂

想象你在一个大型工厂工作,工厂里有许多不同的机器和人员,每个人都在做不同的事情。为了让工厂运转得更顺畅,你需要一个智能助手,能理解每个机器的状态、位置和工作内容。传统的方法就像只看机器的外表,想知道它们在干什么,但不能理解它们的内部信息。现在,新的方法像是给每台机器装上了传感器,不仅能看到外表,还能知道它们的内部状态和相互关系。这样,工厂的管理者就能更好地安排工作,避免冲突,保证生产顺利进行。这就像这篇论文中提出的离散标记器,不仅能重建场景的外观,还能理解场景的语义和几何信息,为自动驾驶提供了更全面的场景理解。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的积木游戏,你要搭建一个城市模型。以前,你只知道每个积木的颜色和形状,但不知道它们之间的关系。现在,想象你有一种神奇的魔法,可以让你不仅看到积木的外表,还能知道它们在空间中的位置、相互的关系,甚至未来会变成什么样。这就像论文里说的用特殊的“魔法”把场景变成一串特殊的符号,这些符号既能帮你快速搭建,也能让你预测未来的场景。这样,你就可以更快、更安全地驾驶汽车,像玩积木一样搭建未来的道路。是不是很酷?这就是这项新技术的神奇之处!

术语表

VQ-VAE (向量量化变分自编码器)

一种将图像压缩成离散符号的模型,结合变分自编码器和向量量化技术,用于高效编码场景信息。

作为本文离散标记器的基础架构,用于生成离散场景表示。

DINO (Self-Distillation with No Labels)

一种基于自我蒸馏的无标签视觉特征提取模型,能捕获丰富的语义信息。

用于对齐语义表示,指导离散标记的语义一致性。

多码本量化 (Multi-codebook Quantization)

在单一特征空间中引入多个码本以增强表达容量,缓解容量竞争。

用于稳定训练,提升场景的多任务表达能力。

跨帧几何监督

利用连续帧之间的深度和相对位姿信息,强化模型对场景几何结构的理解。

在训练中引入,提升模型的几何连续性和预测能力。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或动态变化的场景中保持几何与语义信息的准确表达仍是挑战,未来需要结合多模态信息和更强的模型结构以提升鲁棒性。
  • 2 模型在真实环境中的泛化能力尚未充分验证,尤其是在不同天气、光照条件下的表现需要进一步研究。
  • 3 多码本机制虽然增强容量,但带来训练复杂度和推理成本,如何在保持性能的同时降低计算负担,是未来的重要方向。

应用场景

近期应用

自主驾驶场景理解与路径规划

利用离散标记实现高效的场景理解,支持路径规划和避障,提升自动驾驶系统的安全性和效率。

场景生成与模拟

基于离散标记的场景生成模型,用于训练和测试自动驾驶系统的反应能力,减少实际测试成本。

远期愿景

多模态多任务一体化自主系统

结合视觉、激光雷达、语音等多模态信息,构建统一的自主驾驶平台,实现端到端的场景理解、预测与决策。

原文摘要

Discrete visual tokens should provide a compact representation for both token-based world modeling and planning in autonomous driving. However, most tokenizers are inherited from image generation and are optimized mainly for pixel reconstruction, which may leave a gap between what is easy to generate and what is useful to decode for driving decisions. We present a representation-guided and geometry-enhanced tokenizer that learns discrete tokens under joint supervision. The tokenizer aligns its discrete bottleneck with a frozen DINO feature space through feature decoding, while preserving appearance via RGB reconstruction with perceptual and adversarial losses. To inject geometric state-related cues, we add adjacent-frame depth and relative-pose supervision during training and stabilize joint objectives with multi-codebook quantization. We evaluate the same learned tokens with a lightweight planning readout and a GPT-style next-token world model. Experiments on NAVSIM show improved reconstruction fidelity and representation consistency, competitive planning performance under a fixed decoder, and better generative quality under matched settings.

cs.CV