Teaching Vision-Language-Action Models What to See and Where to Look
DriveTeach-VLA通过DVD和2D-TGP优化视觉语言行动模型,Navsim上PDMS达90.4。
核心发现
方法论
DriveTeach-VLA通过驾驶感知视觉蒸馏(DVD)和2D轨迹引导提示(2D-TGP)优化视觉语言行动模型。DVD通过自蒸馏学习驾驶关键视觉特征,2D-TGP将轨迹投影到图像平面以提供空间指导。
关键结果
- 在Navsim基准测试中,DriveTeach-VLA的PDMS达到90.4,显著优于AutoVLA的89.1。
- 在nuScenes中,L2误差为0.30,碰撞率为0.12,均为最佳表现。
- 消融实验表明DVD和2D-TGP显著提高了模型的空间注意力分布和轨迹预测精度。
研究意义
该研究解决了现有视觉语言行动模型中空间依赖性不足的问题,通过引入驾驶特定视觉和空间提示,显著提升了轨迹预测的可靠性。这为多模态学习在自动驾驶领域的应用提供了新方向。
技术贡献
提出了DVD和2D-TGP两种新方法,分别用于视觉感知优化和空间指导。通过自蒸馏和轨迹投影,模型实现了从感知到规划的紧密耦合,填补了现有方法在空间依赖性上的空白。
新颖性
首次将2D轨迹引导提示应用于视觉语言行动模型,并结合驾驶感知视觉蒸馏,显著提升了模型的空间理解能力和轨迹预测性能。
局限性
- 2D-TGP的生成依赖于相机参数的准确性,可能在传感器校准不良时失效。
- 训练过程需要高计算资源,限制了其在资源受限环境中的应用。
- 模型在复杂动态场景中的表现仍需进一步验证。
未来方向
未来可探索更高效的DVD方法,减少计算开销,同时研究2D-TGP在多传感器融合场景中的适应性。
AI 总览摘要
现有视觉语言行动模型(VLA)在自动驾驶中的应用面临空间依赖性不足的问题,导致轨迹预测不可靠。DriveTeach-VLA通过引入驾驶感知视觉蒸馏(DVD)和2D轨迹引导提示(2D-TGP),显著提升了模型的空间理解能力。DVD通过自蒸馏学习驾驶关键视觉特征,而2D-TGP将轨迹投影到图像平面,为模型提供精确的空间指导。
在Navsim基准测试中,DriveTeach-VLA的PDMS达到90.4,超越了现有最优方法AutoVLA的89.1。在nuScenes数据集上,DriveTeach-VLA的L2误差为0.30,碰撞率为0.12,均为最佳表现。消融实验进一步验证了DVD和2D-TGP对模型性能提升的关键作用。
尽管取得了显著进展,该方法仍存在计算开销高和复杂场景适应性不足的问题。未来研究可探索更高效的DVD方法,并研究2D-TGP在多传感器融合中的潜力,为自动驾驶提供更可靠的解决方案。
深度分析
研究背景
视觉语言模型(VLM)近年来在多模态学习中取得了显著进展,但其在自动驾驶中的应用仍面临挑战。现有方法多依赖文本驱动的视觉问答(VQA)数据,缺乏对空间依赖性和驾驶行为的建模。
核心问题
现有VLA模型在轨迹预测中表现不佳,主要原因是其训练数据偏向语义推理而非空间规划,导致模型难以捕捉驾驶场景中的关键空间信息。
核心创新
DriveTeach-VLA通过DVD和2D-TGP解决了上述问题。DVD通过自蒸馏学习驾驶关键视觉特征,2D-TGP将轨迹投影到图像平面,为模型提供空间指导。
方法详解
- �� DVD:利用Grounding DINO检测关键对象,并通过自蒸馏对ViT编码器进行优化。
- �� 2D-TGP:将专家轨迹投影到图像平面,生成空间提示。
- �� 模型训练:包括DVD预训练、SFT微调和GRPO强化学习。
实验设计
实验在Navsim和nuScenes数据集上进行,采用PDMS和L2误差等指标评估性能。消融实验验证了DVD和2D-TGP的有效性。
结果分析
DriveTeach-VLA在Navsim上PDMS达90.4,在nuScenes上L2误差为0.30,均优于现有最优方法。
应用场景
该方法可用于自动驾驶中的轨迹规划,尤其适用于复杂动态场景。
局限与展望
模型对相机参数的依赖性较高,且计算开销较大,可能限制其在实际场景中的应用。
通俗解读 非专业人士也能看懂
可以将DriveTeach-VLA比作一个经验丰富的驾驶教练。DVD就像教练教你如何观察路况,识别红绿灯和行人等关键信息;2D-TGP则像教练在地图上标出最佳驾驶路线,告诉你应该注意哪些区域。通过这两种方式,模型不仅知道“看什么”,还知道“怎么看”,从而更好地规划行驶轨迹。
简单解释 像给14岁少年讲一样
想象你在玩赛车游戏,游戏里有个超级助手。这个助手会告诉你哪里有障碍物(比如红绿灯或其他车),还会在屏幕上画出一条最佳路线,让你知道该怎么开。DriveTeach-VLA就像这样的助手,但它用在真实的自动驾驶中!
术语表
视觉语言模型 (Vision-Language Model)
结合视觉和语言信息进行任务的模型,例如图像描述生成。
用于从图像和文本中提取多模态信息。
驾驶感知视觉蒸馏 (Driving-aware Vision Distillation)
通过自蒸馏学习驾驶关键视觉特征的方法。
用于优化模型的视觉编码器。
2D轨迹引导提示 (2D Trajectory-Guided Prompt)
将轨迹投影到图像平面以提供空间指导的技术。
为轨迹预测提供精确的空间提示。
自蒸馏 (Self-Distillation)
通过教师模型指导学生模型学习的训练方法。
用于增强模型的视觉感知能力。
PDMS (Planning-Driven Metric Score)
用于评估轨迹规划性能的综合指标。
在Navsim基准测试中用于比较模型性能。
开放问题 这项研究留下的未解疑问
- 1 如何在多传感器融合场景中应用2D-TGP?
- 2 如何降低DVD的计算开销以适应资源受限环境?
应用场景
近期应用
自动驾驶轨迹规划
在城市交通中优化车辆轨迹,减少碰撞,提高安全性。
驾驶辅助系统
为高级驾驶辅助系统(ADAS)提供更精确的空间指导。
远期愿景
完全自动驾驶
实现更高可靠性的自动驾驶系统,适应复杂动态场景。
原文摘要
Vision-Language-Action (VLA) models have emerged as a promising paradigm for end-to-end autonomous driving. However, existing VLAs' training relies heavily on text-centric visual question answering and chain-of-thought reasoning data, which emphasizes linguistic reasoning rather than action-grounded planning. As a result, the learned representations capture semantic knowledge but lack spatial dependencies crucial for reliable trajectory prediction. We propose DriveTeach-VLA, a framework that explicitly teaches VLAs what to see and where to look. Driving-aware Vision Distillation (DVD) injects driving-specific perceptual priors into the vision encoder, while 2D Trajectory-Guided Prompts (2D-TGP) provide spatial conditioning aligned with feasible driving trajectories. Together, they form a vision-guided learning pipeline: what to see (DVD pretraining) - where to look (TGP-guided SFT) - how to act (TGP-guided GRPO). DriveTeach-VLA achieves the state-of-the-art performance on NAVSIM and nuScenes. Our code is available at: https://github.com/ShivaTeam/DriveTeach-VLA.