MapTR: Structured Modeling and Learning for Online Vectorized HD Map Construction

TL;DR

MapTR采用结构化Transformer,基于Permutation-Equivalent建模,实现实时高精度HD地图构建,mAP提升5.0,速度8倍。

cs.CV 🔴 高级 2022-08-31 47 次浏览
Bencheng Liao Shaoyu Chen Xinggang Wang Tianheng Cheng Qian Zhang Wenyu Liu Chang Huang
自动驾驶 地图构建 Transformer 点集建模 实时系统

核心发现

方法论

MapTR提出一种统一的Permutation-Equivalent建模,将地图元素表示为点集及其等价排列组,避免形状歧义。采用分层查询嵌入,结合层次匹配机制,端到端预测多类地图元素。利用Transformer编码器-解码器架构,通过Hierarchical Bipartite Matching实现点和实例的匹配,有效稳定学习过程。训练中引入点对点损失和边方向损失,提升几何形状的表达能力。该方法仅用摄像头输入,在nuScenes数据集上实现高效、鲁棒的在线矢量HD地图构建。

关键结果

  • MapTR-nano在RTX 3090上以25.1FPS实现实时推理,较现有摄像头方法快8倍,mAP提升5.0,达成端到端高精度地图构建。MapTR-tiny在速度上实现3倍提升,mAP提升13.5,表现优异。在多模态方法中,MapTR亦超越对手0.7的mAP,展现单模态摄像头的强大性能。模型在复杂场景中表现稳定,地图元素几何形状预测准确,显著推动自动驾驶地图感知技术发展。
  • 通过Permutation-Equivalent建模,解决点集排列不唯一的问题,增强模型稳定性。层次匹配机制有效提升学习效率,端到端架构简洁高效,显著优于传统逐点预测或 raster化方法。大量定性结果验证模型在多样驾驶场景中的鲁棒性,展示其在实际自动驾驶中的应用潜力。

研究意义

该研究突破了在线高精度HD地图构建的效率瓶颈,提出的MapTR模型实现了实时、端到端的矢量地图生成,极大改善了传统离线或逐点预测方法的性能限制。其创新的Permutation-Equivalent建模解决了形状表达中的歧义问题,为自动驾驶中的环境感知提供了更稳定、更精确的地图信息。模型在nuScenes数据集上的优异表现,验证了其在复杂、多变驾驶场景中的实用价值,为未来自动驾驶系统的感知与规划提供了坚实基础。

技术贡献

本研究引入Permutation-Equivalent建模,统一描述多类地图元素的几何形状,有效避免排列歧义。设计层次查询嵌入,结合Transformer架构,实现实例级和点级的联合预测。采用Hierarchical Bipartite Matching,优化实例和点的匹配过程,提升训练稳定性和效率。模型结构简洁,端到端训练,显著提升推理速度和准确率,达到实时性能。该方法首次实现摄像头单模态下的高效矢量HD地图构建,推动了自动驾驶感知技术的边界。

新颖性

本论文的创新点在于提出Permutation-Equivalent建模,解决点集排列歧义问题,结合层次查询和双向匹配机制,实现端到端的高效地图构建。与传统逐点预测或 raster化方法不同,MapTR在模型结构和训练策略上实现突破,首次在单模态摄像头输入下达到实时高精度地图生成,具有开创性意义。

局限性

  • 模型对极端复杂场景中的遮挡和动态变化仍存在一定挑战,尤其在极端光照或遮挡严重的情况下,地图元素的几何预测可能出现误差。
  • 目前主要基于静态地图元素建模,对于动态交通元素(如车辆、行人)融合能力有限,未来需结合动态检测技术。
  • 模型在极大规模场景下的计算成本尚需优化,尤其在多传感器融合和多模态信息整合方面仍有提升空间。

未来方向

未来将结合多模态传感器(如激光雷达、毫米波雷达)提升地图感知的鲁棒性,探索动态元素的实时建模与预测。同时,优化模型结构以降低计算成本,增强在大规模复杂场景中的适应能力。此外,将引入自监督学习和迁移学习策略,提升模型泛化能力,推动自动驾驶环境感知的全面升级。

AI 总览摘要

MapTR是一种创新的端到端Transformer架构,专为高效、实时的在线矢量HD地图构建设计。传统方法多依赖离线SLAM或逐点预测,存在效率低、鲁棒性差的问题。MapTR通过引入Permutation-Equivalent建模,将地图元素抽象为点集及其等价排列组,有效避免几何形状歧义,增强模型稳定性。采用分层查询嵌入策略,结合层次匹配机制,实现多类地图元素的联合预测,极大提升了推理速度和准确性。在nuScenes数据集上,MapTR-nano模型在仅用摄像头输入的情况下,达到了25.1FPS的实时推理速度,比现有摄像头方法快8倍,且mAP提升5.0,展现出极强的实用潜力。该模型不仅在单模态条件下表现优异,还超越多模态方法,验证了其在复杂驾驶场景中的鲁棒性和稳定性。其核心创新在于Permutation-Equivalent建模和层次匹配机制,为未来自动驾驶环境感知提供了新思路。未来工作将聚焦多模态融合、动态元素建模及模型优化,推动自动驾驶感知技术的全面升级。

深度分析

研究背景

自动驾驶对高精度环境感知提出了极高要求,HD地图作为关键基础,为路径规划和决策提供详细的静态环境信息。早期多采用离线SLAM或激光雷达构建,成本高且更新滞后。近年来,基于摄像头的实时地图构建逐渐兴起,利用BEV语义分割或像素分组的方法,但存在信息稀疏、表达不精确的问题。点序列预测方法如VectorMapNet虽能生成矢量地图,但推理慢且易受点排列影响。DETR等Transformer架构的出现,为端到端检测提供了新思路,但在地图元素多样性和形状复杂性方面仍有挑战。MapTR结合结构化建模和Transformer,旨在突破效率与精度的瓶颈,推动自动驾驶感知技术迈向新高度。

核心问题

现有地图构建方法多依赖离线处理或逐点预测,难以满足实时性和高精度的需求。 raster化地图信息缺乏实例级结构,点序列预测存在排列歧义,导致模型不稳定。多类地图元素的复杂形状和多样性增加了建模难度,尤其在复杂场景中,模型易受遮挡、动态变化影响,难以保证鲁棒性。如何在保证高效率的同时,准确描述多样化地图元素的几何形状,成为核心难题。单模态摄像头的局限也限制了模型的泛化能力,亟需一种统一、稳定、高效的解决方案。

核心创新

本研究提出Permutation-Equivalent建模,解决点集排列歧义问题,确保模型对多类地图元素的几何描述稳定可靠。设计分层查询嵌入,结合Transformer架构,实现实例和点级的联合预测,提升表达能力。引入Hierarchical Bipartite Matching,有效优化实例和点的匹配过程,增强训练稳定性。模型端到端,单模态输入即可实现高精度、实时的地图构建,显著优于传统逐点预测和 raster化方法。创新的结构设计和训练策略,为自动驾驶地图感知提供了新范式。

方法详解

  • �� 输入多视角摄像头图像,利用Backbone提取特征,转化为BEV表示。• 设计层次查询,包括实例级和点级查询,结合位置和类别信息。• 采用多层Transformer解码器,交互更新查询,利用Deformable Attention采样BEV特征。• 预测每个地图元素的类别和点集位置,利用Permutation-Equivalent建模避免形状歧义。• 通过层次匹配机制,先进行实例匹配,再进行点匹配,优化整体学习。• 训练中引入点对点损失和边方向损失,确保几何形状的准确表达。• 端到端训练,模型可在单模态摄像头条件下实现高效推理。

实验设计

在nuScenes数据集上,采用6个摄像头视角,覆盖360°FOV,评估三类地图元素(人行横道、车道线、道路边界)。模型使用AP指标,结合Chamfer距离进行匹配。训练采用AdamW优化器,MapTR-tiny使用ResNet50,MapTR-nano用ResNet18,训练周期24-110轮。对比多种基线方法,验证模型在速度和精度上的优势。通过消融实验,分析Permutation-Equivalent建模、边界损失和不同BEV转换方法的影响。

结果分析

MapTR-nano在RTX 3090上实现25.1FPS,mAP提升5.0,超越现有摄像头方法8倍速度。在多模态对比中,MapTR亦领先0.7mAP。MapTR-tiny达成13.5mAP提升,速度提升3倍。模型在复杂场景中表现稳定,几何预测准确,验证了结构化建模的有效性。消融实验显示Permutation-Equivalent建模带来5.9的mAP提升,边方向损失也显著改善几何表达。整体结果证明该方法在自动驾驶地图感知中的优越性。

应用场景

该模型适用于自动驾驶环境中的实时高精度地图感知,尤其在单模态摄像头场景下,减少硬件成本。可用于路径规划、交通管理和智能导航系统,提升自动驾驶的安全性和效率。未来结合多模态数据,将进一步增强系统的鲁棒性和适应性,为自动驾驶产业带来革命性变革。

局限与展望

模型在极端复杂或遮挡严重的场景中仍存在误差,动态交通元素的融合能力有限,模型计算成本在大规模场景中偏高。未来需优化多模态融合策略,提升动态元素建模能力,降低计算复杂度。

通俗解读 非专业人士也能看懂

想象你在厨房里准备一道菜。每次你用不同的碗装食材,但食材的形状和位置都很重要。传统方法就像每次都用不同的碗装相同的食材,容易搞错顺序或形状。MapTR就像用一种特殊的标签,把每个食材的形状和位置都标记得很清楚,不管你怎么摆放都能识别出来。它用一种聪明的方式,记住每个食材的特征,不会被摆放顺序影响。这样,无论厨房多复杂,它都能快速准确地帮你整理出所有食材,做出美味的菜肴。这种方法让自动驾驶车辆也能像厨师一样,快速、准确地绘制出周围环境的地图,确保行车安全。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,你需要把不同的拼图片拼成完整的图案。有时候,拼图片的顺序可以变,但图案还是一样的。传统的拼图方法就像每次都要按固定顺序拼,容易出错。而MapTR就像用一种聪明的规则,告诉你拼图片可以换位置,但只要拼出一样的图案就行。它用一种特殊的数学方法,把每个拼图片的形状和位置都记得很清楚,不会被换顺序迷惑。这样,无论拼图怎么变,它都能很快找到正确的拼法,拼出完整的图案。这就像自动驾驶车辆用这个方法,能快速画出周围的道路和障碍物地图,保证安全行驶。

原文摘要

High-definition (HD) map provides abundant and precise environmental information of the driving scene, serving as a fundamental and indispensable component for planning in autonomous driving system. We present MapTR, a structured end-to-end Transformer for efficient online vectorized HD map construction. We propose a unified permutation-equivalent modeling approach, i.e., modeling map element as a point set with a group of equivalent permutations, which accurately describes the shape of map element and stabilizes the learning process. We design a hierarchical query embedding scheme to flexibly encode structured map information and perform hierarchical bipartite matching for map element learning. MapTR achieves the best performance and efficiency with only camera input among existing vectorized map construction approaches on nuScenes dataset. In particular, MapTR-nano runs at real-time inference speed ($25.1$ FPS) on RTX 3090, $8\times$ faster than the existing state-of-the-art camera-based method while achieving $5.0$ higher mAP. Even compared with the existing state-of-the-art multi-modality method, MapTR-nano achieves $0.7$ higher mAP, and MapTR-tiny achieves $13.5$ higher mAP and $3\times$ faster inference speed. Abundant qualitative results show that MapTR maintains stable and robust map construction quality in complex and various driving scenes. MapTR is of great application value in autonomous driving. Code and more demos are available at \url{https://github.com/hustvl/MapTR}.

cs.CV cs.RO