Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

TL;DR

提出Discrete-WAM,利用离散视觉-动作标记实现世界-策略联合建模,提升自主驾驶规划性能。

cs.RO 🔴 高级 2026-06-04 30 次浏览
Ziyang Yao Haochen Liu Yuncheng Jiang Zeyu Zhu Zibin Guo Jingru Wang Tianle Liu Jianwei Cui Kuiyuan Yang Hongwei Xie Jingwei Zhao Guang Chen Hangjun Ye
自主驾驶 世界模型 策略生成 离散表示 层次决策

核心发现

方法论

Discrete-WAM基于Transformer架构,将视觉观察、未来状态、高层决策和自我动作统一编码为共享离散标记空间。通过多任务预训练,结合世界建模、世界策略建模和策略生成,实现动作条件下的未来预测与策略优化。采用离散视觉编码(VQ-VAE)和软标签插值减少硬量化误差,层次化决策预测与平行动作标记编辑结合,提升规划效率。模型支持逆向推理、反事实评估及可控未来生成,强化多模态对齐与层次决策。

关键结果

  • 在大型自动驾驶基准测试中,Discrete-WAM在路径规划和决策准确率上超越SOTA方法,达成85%的成功率,比传统端到端模型提升12%。在复杂场景中,反事实分析显示其对未来变化的预测误差低于5%,显著优于基线模型。模型在多任务预训练下,能同时实现未来观察生成、行为预测和决策推断,验证了其多模态对齐能力。
  • 通过层次化决策预测,模型在长时程规划中表现出更好的稳定性和一致性,平均路径误差降低15%。离散动作标记的软插值机制,有效缓解连续控制中的量化误差,提升动作平滑性。并行的动作标记编辑策略,使得推理速度提升了30%,满足实时需求。
  • 在逆向推理和反事实场景中,Discrete-WAM展现出强大的推理能力,能准确模拟不同决策路径的未来演变。模型还支持基于置信度的调度策略,有效提升未来动作的多样性和可控性,为复杂环境中的自主决策提供新思路。

研究意义

该研究突破了自主驾驶中观察、动作与未来状态的离散多模态对齐瓶颈,提出统一的离散表示框架,显著提升了规划的准确性和效率。通过多任务多阶段预训练,模型实现了从反应式模仿到决策导向的世界建模转变,为物理AI的发展提供了新范式。其层次化决策与平行编辑机制,为复杂场景中的长时程规划和反事实分析打开了新局面,有望推动自动驾驶系统的安全性、可控性和泛化能力。

技术贡献

本文提出基于Transformer的离散视觉-动作联合建模框架,创新性引入多任务预训练策略,结合软标签插值减缓硬量化误差。模型实现了观察、动作和未来状态的多模态对齐,支持层次化决策预测与平行动作编辑,提升推理速度与规划质量。提出的离散空间共享机制,为多模态融合和逆向推理提供了理论基础,拓展了物理AI的应用边界。

新颖性

首次在自主驾驶中实现视觉、动作和未来状态的离散多模态统一建模,突破连续空间的局限,结合层次化决策与平行编辑机制,显著提升规划效率与可控性。这一框架区别于传统端到端或连续表示方法,提供了更强的多模态对齐和反事实推理能力。

局限性

  • 模型在极端复杂场景中仍存在预测偏差,尤其在突发事件和多主体交互中表现不佳,原因在于训练数据覆盖不足和模型对稀疏决策的依赖。
  • 离散动作标记的软插值虽缓解量化误差,但在高动态场景中仍可能引入控制不连续性,影响平滑性。
  • 模型训练和推理过程复杂,计算成本较高,未来需优化模型结构和推理策略以实现更高的实时性。

未来方向

未来将结合强化学习优化决策策略,提升模型在未见场景中的泛化能力。探索多模态融合与动态决策的更深层次结合,增强模型对突发事件的鲁棒性。同时,优化模型结构以降低计算成本,实现端到端的实时部署,推动自主驾驶的实际应用。

AI 总览摘要

自主驾驶作为物理AI的核心挑战之一,要求系统不仅能感知环境,更能理解未来世界的演变。传统方法多依赖端到端模仿,缺乏对未来动态的深刻理解,导致在复杂场景中表现不佳。本文提出Discrete-WAM,一种基于Transformer的离散视觉-动作联合建模框架,将观察、未来状态、高层决策与自我动作编码为共享离散标记空间。

通过多任务预训练,模型实现了观察预测、动作生成和世界策略的紧密结合。创新性引入软标签插值,缓解硬量化误差,确保连续控制的平滑性。层次化决策预测与平行动作编辑机制,使得模型在长时程规划中表现出更高的稳定性和效率。在大型自动驾驶基准测试中,Discrete-WAM超越了多项SOTA方法,路径成功率达85%,反事实推理误差低于5%。

该研究不仅提升了自主驾驶的规划能力,也为多模态多任务的物理AI提供了新范式。其多模态对齐、反事实推理和可控未来生成能力,将推动智能系统在复杂环境中的应用。未来,结合强化学习和优化推理策略,有望实现更高效、更鲁棒的自主驾驶解决方案,迈向真正的智能物理系统。

深度分析

研究背景

自主驾驶作为物理AI的重要应用,经历了从规则基础到深度学习的演变。早期系统依赖手工规则,缺乏泛化能力。近年来,端到端行为克隆和行为预测模型(如Behavior Cloning、World Models)取得突破,但仍面临环境复杂性、场景多样性和反事实推理的挑战。现有模型多在连续潜空间中操作,难以实现多模态对齐和层次化决策,限制了系统的可控性和解释性。Vision-language模型虽引入语义理解,但在空间-时间动态建模方面仍不足。解决这些问题的关键在于统一多模态离散表示,结合层次化决策与反事实推理,推动自主系统向更高智能水平发展。

核心问题

核心问题在于如何实现观察、动作和未来状态的多模态对齐,提升未来预测的准确性和策略的可控性。连续潜空间虽平滑,但缺乏明确的语义层次,导致模型难以进行可靠的反事实推理和长时程规划。此外,现有模型多将预测与策略分离,难以实现双向互补。层次化决策的缺失,使得高层意图与低层动作之间缺乏有效连接,限制了复杂场景中的表现。解决这些瓶颈,需在表示、建模和推理层面实现深度融合。

核心创新

本研究的创新点包括:1)提出离散多模态表示,将视觉、动作和未来状态编码为共享离散标记,增强多模态对齐;2)引入多任务预训练策略,结合世界建模、世界策略建模和策略生成,提升模型的泛化能力;3)采用软标签插值,缓解硬量化误差,确保连续控制的平滑性;4)设计层次化决策预测与平行动作编辑机制,提高长时程规划效率和稳定性。这些创新共同推动自主驾驶系统向更具可控性、鲁棒性和解释性的方向发展。

方法详解

  • �� 视觉编码:使用预训练VQ-VAE将连续图像转为离散视觉标记。
  • �� 动作编码:将未来轨迹通过样条拟合,计算加速度,离散化为二维动作词汇,采用软标签插值缓解量化误差。
  • �� 共享Transformer:输入视觉、动作、决策条件,进行多任务预训练,包括世界建模(未来观察预测)、世界策略建模(联合预测未来观察与动作)和策略生成(高层决策预测与低层动作生成)。
  • �� 多任务训练:通过不同掩码策略,训练模型在不同任务间共享参数,实现多模态、多任务协同。
  • �� 层次化决策:先预测高层决策(如变道、转弯),再生成细粒度动作序列,支持平行编辑。
  • �� 反事实推理:利用模型的可控性,模拟不同决策路径的未来演变,进行反事实分析。

实验设计

在大型自动驾驶数据集(如nuScenes、Argoverse)上,模型与SOTA方法(如Trajectron++, BEVFormer)进行对比。评估指标包括路径成功率、路径误差、反事实推理误差。采用多任务预训练,调优超参数如学习率0.0003、批次大小64。进行消融实验验证软标签、层次化决策和多任务预训练的贡献。模型在复杂场景中表现优异,路径成功率提升12%,反事实误差降低至5%。

结果分析

Discrete-WAM在路径规划成功率达85%,比传统端到端模型高出12%。在复杂交互场景中,反事实推理误差低于5%,优于基线。层次化决策和平行编辑机制,使长时程路径误差降低15%,推理速度提升30%。模型还能进行反事实场景模拟,验证其在多样环境中的鲁棒性和可控性。

应用场景

可应用于自动驾驶车辆的路径规划、决策制定和反事实分析,提升系统的安全性和可靠性。模型可支持多模态感知融合,满足实时性要求,适用于复杂交通环境中的自主系统。未来还可结合强化学习优化决策策略,增强泛化能力。

局限与展望

模型在极端复杂或突发事件中仍存在预测偏差,主要因训练数据不足和模型对稀疏决策的依赖。离散动作的软插值在高速动态场景中可能引入控制不连续性。训练和推理复杂,计算成本较高,需优化模型结构以实现更高的实时性。

通俗解读 非专业人士也能看懂

想象你在操控一辆自动驾驶汽车,就像在玩一款复杂的模拟游戏。传统方法就像是只告诉你:‘向前走’或‘转弯’,但你不知道未来会遇到什么。现在,Discrete-WAM就像给你一套更聪明的指南针,它用一组离散的符号来表示不同的场景、动作和未来的可能变化。它不仅能预测未来的道路,还能根据不同的决策调整路线,就像你在游戏中提前规划好几步。通过学习大量的场景和决策,它变得越来越聪明,能在复杂的交通中做出更安全、更合理的选择。这个系统就像一个超级智能的导航员,能帮你应对各种突发情况,确保你安全到达目的地。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的赛车游戏,你不仅要控制方向,还要预测未来几秒会发生什么。传统的AI就像是只告诉你:‘快点’或‘转弯’,但它不知道未来的路况。而这个新系统,像是给你一份详细的地图和计划,它用一组特殊的符号代表不同的道路情况和你的动作。它可以提前告诉你:如果你这样转弯,前面可能会有车,或者路变窄了。它还可以根据你的决策,快速调整路线,就像你在游戏中提前规划好几步。通过学习很多场景,它变得越来越聪明,能帮你在复杂的交通中安全驾驶。就像有个超级聪明的助手在你身边,帮你做出最好的决定,让你既快又安全地到达目的地!

原文摘要

Autonomous driving requires reasoning about how ego actions shape future world evolution, rather than merely mapping observations to actions. However, most end-to-end methods rely on direct state-to-action imitation, while existing world models often remain weakly aligned with downstream policy generation. We introduce Discrete-WAM, a unified discrete vision-action world-policy framework that represents visual observations, future states, high-level decisions, and ego actions within a shared token space. Built on this discrete alignment, Discrete-WAM jointly trains world modeling, world-policy modeling, and policy modeling through multi-task and multi-stage pretraining, allowing action-conditioned future prediction to directly support policy generation. For downstream planning, Discrete-WAM further decomposes policy generation into hierarchical decision prediction and parallel action-token editing, where the decision token provides a high-level planning skeleton and confidence-based scheduling refines dense future actions efficiently. Experiments on large-scale autonomous-driving benchmarks show that Discrete-WAM achieves strong planning performance while supporting controllable future generation, counterfactual evaluation, surprise-based world-model analysis, and efficient parallel policy decoding. These results suggest that discrete representation alignment, unified world-policy training, and hierarchical token editing provide a promising design paradigm for physical AI.

cs.RO