Teaching Vision-Language-Action Models What to See and Where to Look

TL;DR

DriveTeach-VLA通过DVD和2D-TGP优化视觉语言行动模型,Navsim上PDMS达90.4。

cs.CV 🔴 高级 2026-07-02 41 次浏览
Yuguang Yang Canyu Chen Zhewen Tan Yizhi Wang Zichao Feng Chunyang Liu Kehua Sheng Juan Zhang Linlin Yang Baochang Zhang Yan Wang Bo Zhang Xianbin Cao
视觉语言模型 自动驾驶 轨迹预测 自监督学习 多模态学习

核心发现

方法论

DriveTeach-VLA通过驾驶感知视觉蒸馏(DVD)和2D轨迹引导提示(2D-TGP)优化视觉语言行动模型。DVD通过自蒸馏学习驾驶关键视觉特征,2D-TGP将轨迹投影到图像平面以提供空间指导。

关键结果

  • 在Navsim基准测试中,DriveTeach-VLA的PDMS达到90.4,显著优于AutoVLA的89.1。
  • 在nuScenes中,L2误差为0.30,碰撞率为0.12,均为最佳表现。
  • 消融实验表明DVD和2D-TGP显著提高了模型的空间注意力分布和轨迹预测精度。

研究意义

该研究解决了现有视觉语言行动模型中空间依赖性不足的问题,通过引入驾驶特定视觉和空间提示,显著提升了轨迹预测的可靠性。这为多模态学习在自动驾驶领域的应用提供了新方向。

技术贡献

提出了DVD和2D-TGP两种新方法,分别用于视觉感知优化和空间指导。通过自蒸馏和轨迹投影,模型实现了从感知到规划的紧密耦合,填补了现有方法在空间依赖性上的空白。

新颖性

首次将2D轨迹引导提示应用于视觉语言行动模型,并结合驾驶感知视觉蒸馏,显著提升了模型的空间理解能力和轨迹预测性能。

局限性

  • 2D-TGP的生成依赖于相机参数的准确性,可能在传感器校准不良时失效。
  • 训练过程需要高计算资源,限制了其在资源受限环境中的应用。
  • 模型在复杂动态场景中的表现仍需进一步验证。

未来方向

未来可探索更高效的DVD方法,减少计算开销,同时研究2D-TGP在多传感器融合场景中的适应性。

AI 总览摘要

现有视觉语言行动模型(VLA)在自动驾驶中的应用面临空间依赖性不足的问题,导致轨迹预测不可靠。DriveTeach-VLA通过引入驾驶感知视觉蒸馏(DVD)和2D轨迹引导提示(2D-TGP),显著提升了模型的空间理解能力。DVD通过自蒸馏学习驾驶关键视觉特征,而2D-TGP将轨迹投影到图像平面,为模型提供精确的空间指导。

在Navsim基准测试中,DriveTeach-VLA的PDMS达到90.4,超越了现有最优方法AutoVLA的89.1。在nuScenes数据集上,DriveTeach-VLA的L2误差为0.30,碰撞率为0.12,均为最佳表现。消融实验进一步验证了DVD和2D-TGP对模型性能提升的关键作用。

尽管取得了显著进展,该方法仍存在计算开销高和复杂场景适应性不足的问题。未来研究可探索更高效的DVD方法,并研究2D-TGP在多传感器融合中的潜力,为自动驾驶提供更可靠的解决方案。

深度分析

研究背景

视觉语言模型(VLM)近年来在多模态学习中取得了显著进展,但其在自动驾驶中的应用仍面临挑战。现有方法多依赖文本驱动的视觉问答(VQA)数据,缺乏对空间依赖性和驾驶行为的建模。

核心问题

现有VLA模型在轨迹预测中表现不佳,主要原因是其训练数据偏向语义推理而非空间规划,导致模型难以捕捉驾驶场景中的关键空间信息。

核心创新

DriveTeach-VLA通过DVD和2D-TGP解决了上述问题。DVD通过自蒸馏学习驾驶关键视觉特征,2D-TGP将轨迹投影到图像平面,为模型提供空间指导。

方法详解

  • �� DVD:利用Grounding DINO检测关键对象,并通过自蒸馏对ViT编码器进行优化。
  • �� 2D-TGP:将专家轨迹投影到图像平面,生成空间提示。
  • �� 模型训练:包括DVD预训练、SFT微调和GRPO强化学习。

实验设计

实验在Navsim和nuScenes数据集上进行,采用PDMS和L2误差等指标评估性能。消融实验验证了DVD和2D-TGP的有效性。

结果分析

DriveTeach-VLA在Navsim上PDMS达90.4,在nuScenes上L2误差为0.30,均优于现有最优方法。

应用场景

该方法可用于自动驾驶中的轨迹规划,尤其适用于复杂动态场景。

局限与展望

模型对相机参数的依赖性较高,且计算开销较大,可能限制其在实际场景中的应用。

通俗解读 非专业人士也能看懂

可以将DriveTeach-VLA比作一个经验丰富的驾驶教练。DVD就像教练教你如何观察路况,识别红绿灯和行人等关键信息;2D-TGP则像教练在地图上标出最佳驾驶路线,告诉你应该注意哪些区域。通过这两种方式,模型不仅知道“看什么”,还知道“怎么看”,从而更好地规划行驶轨迹。

简单解释 像给14岁少年讲一样

想象你在玩赛车游戏,游戏里有个超级助手。这个助手会告诉你哪里有障碍物(比如红绿灯或其他车),还会在屏幕上画出一条最佳路线,让你知道该怎么开。DriveTeach-VLA就像这样的助手,但它用在真实的自动驾驶中!

术语表

视觉语言模型 (Vision-Language Model)

结合视觉和语言信息进行任务的模型,例如图像描述生成。

用于从图像和文本中提取多模态信息。

驾驶感知视觉蒸馏 (Driving-aware Vision Distillation)

通过自蒸馏学习驾驶关键视觉特征的方法。

用于优化模型的视觉编码器。

2D轨迹引导提示 (2D Trajectory-Guided Prompt)

将轨迹投影到图像平面以提供空间指导的技术。

为轨迹预测提供精确的空间提示。

自蒸馏 (Self-Distillation)

通过教师模型指导学生模型学习的训练方法。

用于增强模型的视觉感知能力。

PDMS (Planning-Driven Metric Score)

用于评估轨迹规划性能的综合指标。

在Navsim基准测试中用于比较模型性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在多传感器融合场景中应用2D-TGP?
  • 2 如何降低DVD的计算开销以适应资源受限环境?

应用场景

近期应用

自动驾驶轨迹规划

在城市交通中优化车辆轨迹,减少碰撞,提高安全性。

驾驶辅助系统

为高级驾驶辅助系统(ADAS)提供更精确的空间指导。

远期愿景

完全自动驾驶

实现更高可靠性的自动驾驶系统,适应复杂动态场景。

原文摘要

Vision-Language-Action (VLA) models have emerged as a promising paradigm for end-to-end autonomous driving. However, existing VLAs' training relies heavily on text-centric visual question answering and chain-of-thought reasoning data, which emphasizes linguistic reasoning rather than action-grounded planning. As a result, the learned representations capture semantic knowledge but lack spatial dependencies crucial for reliable trajectory prediction. We propose DriveTeach-VLA, a framework that explicitly teaches VLAs what to see and where to look. Driving-aware Vision Distillation (DVD) injects driving-specific perceptual priors into the vision encoder, while 2D Trajectory-Guided Prompts (2D-TGP) provide spatial conditioning aligned with feasible driving trajectories. Together, they form a vision-guided learning pipeline: what to see (DVD pretraining) - where to look (TGP-guided SFT) - how to act (TGP-guided GRPO). DriveTeach-VLA achieves the state-of-the-art performance on NAVSIM and nuScenes. Our code is available at: https://github.com/ShivaTeam/DriveTeach-VLA.

cs.CV