A DVDrive Approach for doScenes Instructed Driving Challenge

TL;DR

提出DVDrive,通过划分视角增强多视角感知,实现Instruction-conditioned轨迹预测,提升精度。

cs.CV 🔴 高级 2026-06-20 38 次浏览
Zijian Fu Xiangyang Chu Mengshi Qi Huadong Ma Guanghao Zhang Wei Li
自动驾驶 多模态感知 视觉语言 轨迹预测 深度学习

核心发现

方法论

基于OmniDrive框架,结合nuScenes数据集,训练模型预测6秒轨迹。引入DVPE风格的划分视角感知模块,将多视角特征划分为局部视图,利用可见性感知交叉注意力减少干扰。模型融合视觉、语言信息,通过多视角空间划分提升局部空间推理能力。采用Transformer架构,结合深度采样的3D几何表示,增强多视角特征的空间一致性。训练过程中,结合导航指令进行条件化优化,提升模型对指令的理解和执行能力。

关键结果

  • 在doScenes验证集上,提出方法在A@1s、A@2s、A@3s指标上均优于基线,mADE从0.372降至0.358,表现出对长远轨迹预测的显著提升。
  • 在官方测试集排名中,模型获得第一名,ADE达2.0913,FDE为5.5946,明显优于历史和指令基线,验证了模型的泛化能力。
  • 引入划分视角机制后,模型在复杂场景中的局部感知能力增强,有效减少了跨视角干扰,提升了指令与视觉证据的对齐效果。

研究意义

该研究突破了传统轨迹预测中全局多视角交互的局限,通过局部空间划分显著提升长距离预测的准确性,推动自主驾驶中视觉-语言融合技术的发展。模型在实际场景中表现出更强的鲁棒性和理解能力,为未来多模态感知与决策提供新思路,具有重要的学术和工业应用价值。

技术贡献

创新点在于引入DVPE风格的划分视角感知模块,有效减少多视角特征干扰,结合Transformer实现局部空间推理。模型融合视觉、语言信息,采用深度几何采样增强空间表达,优化多模态信息交互机制。训练过程中,条件化指令输入,提升模型对导航意图的理解能力。这些技术突破显著优于现有全局交互方法,为长远轨迹预测提供了新方案。

新颖性

首次在自主驾驶中引入划分视角的多视角感知机制,结合Transformer实现局部空间感知,解决多视角特征干扰问题。不同于传统全局交互,强调局部空间的有效利用,提升长距离轨迹预测精度。这一创新为多模态感知提供了新思路,也丰富了多视角3D感知的研究内容。

局限性

  • 模型在极端复杂场景下仍存在感知盲区,尤其在遮挡严重或视角变化剧烈时表现不佳,需进一步增强鲁棒性。
  • 训练成本较高,依赖大量多视角数据和深度采样,实际部署时对计算资源要求较大。
  • 对指令理解的复杂性限制了模型在多样化导航任务中的适应能力,未来需引入更强的语言理解模块。

未来方向

未来将探索多模态融合的自适应机制,提升模型在极端场景中的鲁棒性。结合强化学习优化轨迹生成策略,增强模型对复杂指令的理解。同时,考虑引入更高效的多视角特征编码技术,降低计算成本,推动模型向端到端实时应用发展。

AI 总览摘要

自动驾驶中的轨迹预测一直是核心难题,传统方法多依赖单一感知或全局多视角交互,难以兼顾长远预测与局部细节。本文提出的DVDrive方法,基于OmniDrive架构,融合划分视角的多视角感知机制,有效减少跨视角干扰,提升局部空间推理能力。通过引入深度几何采样和Transformer模型,模型在nuScenes和doScenes数据集上实现了优异表现,长距离预测误差显著降低,排名第一。该技术不仅增强了模型对复杂场景的理解,也为多模态感知与自主决策提供了新思路。未来,结合强化学习与更高效的特征编码,将推动自动驾驶技术迈向更高的安全性和智能化水平。

深度分析

研究背景

自动驾驶技术的发展经历了从基于规则的感知到深度学习的感知-决策一体化。早期方法依赖激光雷达和高清地图,逐步引入多视角摄像头提升环境感知能力。代表性工作如BEVFormer和Detr3D实现了多视角3D感知,但在长距离轨迹预测中仍受全局交互干扰影响。近年来,视觉-语言融合成为研究热点,旨在提升系统的理解与交互能力。尽管如此,现有模型多忽视多视角特征的空间划分,导致信息冗余和干扰,限制了长远轨迹的准确性。

核心问题

核心问题在于多视角感知中全局交互引入大量无关信息,影响局部空间推理,尤其在长距离轨迹预测中表现不佳。传统模型难以有效利用局部空间信息,导致预测误差大、鲁棒性差。此外,现有方法对自然语言指令的理解能力有限,难以实现精准的导航意图执行。这些问题制约了自动驾驶系统在复杂环境中的表现,亟需引入更细粒度的空间划分与多模态融合机制。

核心创新

引入DVPE风格的划分视角感知机制,将多视角空间划分为局部虚拟视图,减少跨视角干扰。结合深度几何采样,增强空间特征表达。利用Transformer实现局部空间的高效交互,提升长远轨迹预测精度。模型还融合自然语言指令,条件化训练增强理解能力。这些创新显著区别于传统全局交互方法,为多模态自主感知提供新思路。

方法详解

  • �� 输入多视角图像特征,投影到统一Transformer空间。• 采样深度点,构建3D几何表示。• 将空间划分为局部视图,定义查询和特征集合。• 转换局部坐标系,生成位置编码。• 在每个局部视图内进行可见性感知的交叉注意力,聚合空间相关信息。• 融合历史场景信息,增强长距离预测能力。• 条件化自然语言指令,优化模型理解与执行。• 训练采用AdamW,结合指令增强监督,提升指令对齐。

实验设计

在nuScenes和doScenes数据集上,模型训练采用12个未来轨迹点,预测6秒轨迹。使用A@1s、A@2s、A@3s和mADE指标评估,训练细节包括学习率1e-4、余弦退火、批次2、8GPU。对比基线模型,提出方法在所有指标上均优,mADE从0.372降至0.358,验证了划分视角机制的有效性。模型在官方测试中排名第一,显著优于传统全局交互模型。

结果分析

模型在验证集上A@1s、A@2s、A@3s指标分别达0.145、0.316、0.613,优于基线。测试排名中,ADE为2.0913,FDE为5.5946,远低于历史和指令基线,验证了长远预测的准确性。引入划分视角机制后,模型在复杂场景中表现出更强的局部感知能力,有效减少干扰,提升指令与视觉证据的对齐。

应用场景

该技术可应用于自动驾驶中的路径规划、场景理解和人机交互。依赖多视角摄像头和自然语言指令,适合未来智能驾驶辅助系统。模型提升了在复杂交通环境中的鲁棒性和预测精度,有助于实现更安全、更智能的自动驾驶。

局限与展望

模型在极端遮挡或视角剧烈变化场景下仍存在感知盲区,需进一步增强鲁棒性。训练成本高,依赖大量多视角数据,部署时对计算资源要求大。对复杂指令的理解能力有限,未来需结合更强的自然语言处理技术。

通俗解读 非专业人士也能看懂

想象你在一个复杂的工厂里工作,工厂里有很多不同的区域和机器。每个区域都可以看作一个视角,工人需要根据指示完成任务。传统的方法就像让工人同时盯着所有区域,信息太多,容易迷失重点。而DVDrive的方法是把工厂划分成几个小区域,工人只关注自己负责的区域,减少干扰,更快找到目标。这样一来,无论工厂多大、多复杂,工人都能更准确地完成任务。这就像模型把多视角信息划分成局部视图,只关注与任务相关的部分,提升效率和准确性。

简单解释 像给14岁少年讲一样

你知道在学校里,有很多教室和老师,每个老师负责不同的科目。有时候,老师会给你一些指示,比如“去操场跑步”或者“到图书馆找书”。如果你要完成一项任务,比如去操场跑步,你需要知道自己在哪个教室,怎么走,路上会遇到什么。传统的方法就像让你同时看所有教室的地图,信息太多,容易迷路。而新方法就像把学校划分成几个区域,你只关注自己要去的区域,记住路线,这样就能更快找到目的地。这个想法用在自动驾驶中,就是把多视角的视觉信息划分成局部区域,让汽车更聪明、更快地理解环境,安全行驶。

原文摘要

Instruction-conditioned trajectory prediction is an emerging problem in autonomous driving, where a model predicts the future ego trajectory not only from visual scene context and historical motion, but also from a natural-language maneuver instruction. This paper presents our submission to the doScenes Instructed Driving Challenge, built upon OmniDrive, a vision-language-action driving agent with 3D perception, reasoning, and planning capabilities. We adapt OmniDrive to the doScenes setting by training it on instruction-annotated nuScenes scenes and generating a 6-second ego trajectory represented by 12 future waypoints. To improve multi-view visual grounding, we further introduce a DVPE-style divided-view perception module into the OmniDrive perception head. Instead of attending globally to all camera features, the proposed module groups query features and image tokens into divided local view spaces and performs visibility-aware cross-attention within each view. This design reduces irrelevant cross-view interference and helps the model better align language instructions with local driving-relevant visual evidence. The code is publicly available at: https://github.com/feel12348/doscenes-omnidrive.

cs.CV cs.AI