CarLLaVA: Vision language models for camera-only closed-loop driving

TL;DR

CarLLaVA采用LLaVA视觉编码器和LLaMA架构,纯摄像头输入实现闭环自主驾驶,性能领先。

cs.CV 🔴 高级 2024-06-15 22 次浏览
Katrin Renz Long Chen Ana-Maria Marcu Jan Hünermann Benoit Hanotte Alice Karnsund Jamie Shotton Elahe Arani Oleg Sinavski
自主驾驶 视觉语言模型 深度学习 CARLA挑战 无标签学习

核心发现

方法论

CarLLaVA结合LLaVA的视觉编码器(CLIPViT-L-336px)和LLaMA架构,利用高分辨率图像切片增强细节捕获。模型输入包括前视图图像、目标点和车辆速度,采用半解缠结输出表示路径和航点,提升横向和纵向控制。训练采用高效样本采样策略,避免在简单样本上浪费计算资源。模型通过多模态预训练的视觉编码器提取丰富特征,并用LLaMA解码器生成路径、航点及语言评论。训练过程中引入多视角和时间序列信息,增强模型鲁棒性。核心算法包括Vision Transformer(ViT)和Transformer解码器,结合PID控制实现平滑操控。

关键结果

  • 在CARLA挑战赛2.0传感器轨道中,CarLLaVA以DS得分6.87,超越前沿模型5.18,提升458%,在无需LiDAR等昂贵传感器条件下实现最优性能。
  • 仅用摄像头输入,模型在复杂场景(如交叉口、停车场)表现出优异的路径跟踪和避障能力,显著优于传统基于深度和语义标签的方法。
  • 预训练视觉编码器和高分辨率图像处理显著提升模型细节感知能力,AB测试显示预训练模型DS值高出从零训练模型约4.16点。

研究意义

本研究突破了纯摄像头自主驾驶的瓶颈,减少对昂贵传感器的依赖,降低成本,增强模型迁移到真实场景的可行性。利用视觉语言预训练模型,模型不仅实现高性能,还具备潜在的多任务能力(如语言描述),推动端到端自主驾驶技术向更智能、更经济方向发展。这一方法对未来自动驾驶系统的普及和成本控制具有深远影响。

技术贡献

提出基于LLaVA视觉编码器与LLaMA解码器的端到端闭环驾驶框架,创新性地引入半解缠结路径和航点表示,有效提升横纵向控制精度。采用高效样本采样策略,显著减少训练时间和计算资源消耗。模型在无需LiDAR等昂贵传感器的前提下,结合多模态预训练特征,实现了在CARLA挑战中的优异表现,为视觉语言模型在自主驾驶中的应用提供新思路。

新颖性

首次将大规模互联网预训练的视觉语言模型(LLaVA)应用于纯摄像头自主驾驶,结合半解缠结路径表示和高分辨率图像处理,显著提升闭环控制性能。不同于传统依赖LiDAR或语义标签的方法,本研究实现了无标签、低成本的高性能自主驾驶方案,开辟了视觉语言模型在自动驾驶中的新应用路径。

局限性

  • 模型在极端天气(如大雾、暴雨)条件下表现仍有限,主要由于视觉信息受干扰,未来需引入多模态感知增强鲁棒性。
  • 高分辨率图像处理带来较大计算负担,实际部署时需优化模型结构或硬件加速。
  • 目前模型对复杂交互场景(如突发交通事件)反应仍有提升空间,需结合强化学习或模仿学习进一步优化策略。

未来方向

未来将结合多模态传感器(如雷达、声纳)增强环境感知,提升极端天气下的鲁棒性。探索多任务学习框架,实现路径规划、语义理解与自然语言交互的融合。优化模型结构以适应硬件限制,推动模型在真实车辆上的部署与验证。此外,结合强化学习提升模型应对突发事件的能力,推动自主驾驶向更智能、更安全的方向发展。

AI 总览摘要

随着自动驾驶技术的不断发展,如何在保证成本效益的同时实现高性能的闭环控制,成为行业的核心挑战。传统方法依赖昂贵的激光雷达和复杂标签,限制了大规模应用的可能性。本文提出的CarLLaVA模型,利用互联网规模预训练的视觉语言模型(LLaVA)和LLaMA架构,仅依赖摄像头输入,突破了这一瓶颈。

CarLLaVA通过高分辨率图像切片增强细节捕获,结合半解缠结路径和航点表示,显著提升横纵向控制能力。在训练策略上,采用样本筛选技术,避免在简单样本上浪费计算资源,从而实现高效训练。模型在CARLA挑战赛中获得DS得分6.87,远超前沿模型,展现了纯摄像头自主驾驶的巨大潜力。

这一创新不仅降低了成本,还为未来多模态、多任务的自动驾驶系统提供了技术基础。模型的成功验证,标志着视觉语言模型在自动驾驶中的应用迈出了重要一步。未来,结合多模态感知和强化学习,CarLLaVA有望实现更复杂场景下的安全与可靠自主驾驶,推动行业迈向智能化新纪元。

深度分析

研究背景

自动驾驶技术经历了从基于激光雷达的高精度感知到深度学习端到端模型的演变。早期研究依赖昂贵传感器,限制了普及。近年来,深度学习模型如DAVE-2、Transfuser等实现了较好性能,但多依赖标签和传感器融合。多模态预训练模型(如CLIP、LLaVA)引入视觉-语言理解,为自主驾驶带来新思路。尽管如此,纯摄像头方案仍面临细节感知不足和鲁棒性挑战。现有研究多集中在模拟环境或有限场景,缺乏大规模实证验证。

核心问题

核心问题在于如何在仅用摄像头的条件下,实现高精度、鲁棒的闭环控制。传统方法依赖昂贵传感器,成本高且受环境影响大。纯视觉方案面临细节捕获不足、场景理解困难、控制精度有限等难题。如何利用预训练模型提取丰富特征,结合有效路径和航点表示,提升横纵向控制性能,是当前研究的关键瓶颈。此外,训练效率与模型泛化能力也是亟待解决的问题。

核心创新

本研究的创新点包括:1)采用LLaVA预训练视觉编码器,提升图像细节感知能力;2)引入半解缠结路径和航点表示,改善横纵向控制;3)高效样本采样策略,显著缩短训练时间;4)仅用摄像头实现端到端闭环控制,降低成本。不同于传统依赖标签的方案,结合互联网预训练模型实现多任务潜能,推动视觉语言模型在自主驾驶中的应用。模型结构设计兼顾性能与效率,为未来大规模部署提供可能。

方法详解

  • �� 输入:前视图图像、目标点、车辆速度。
  • �� 图像处理:将高分辨率图像切片(336x336)独立编码,拼接形成特征图。
  • �� 特征提取:利用LLaVA-NeXT的ViT模型提取丰富视觉特征。
  • �� 目标编码:通过MLP编码目标点和速度信息,加入空间和时间编码。
  • �� 解码:LLaMA架构生成路径和航点,采用学习查询机制。
  • �� 输出:半解缠结表示路径和航点,用PID控制实现平滑操控。
  • �� 训练:采用样本筛选策略,避免在简单样本上浪费计算,使用MSE损失监督路径和航点,语言生成采用LM损失。

实验设计

在CARLA挑战赛2.0中,模型使用自定义数据集(290万样本)进行训练,采用多场景、多天气条件。对比基线模型(如TF++、ResNet-34)和不同预训练策略(有无预训练、不同模型规模)。通过DS、RC和IS指标评估性能,进行AB测试和消融实验验证模型设计的有效性。模型在不同距离和场景下表现稳定,验证了高效样本采样和半解缠结表示的优势。

结果分析

CarLLaVA在传感器轨道中获得DS 6.87,优于前沿模型5.18,提升458%。仅用摄像头实现,能在复杂交叉口、停车场等场景中保持高精度路径跟踪。预训练视觉编码器和高分辨率图像显著提升细节感知,AB测试显示预训练模型DS值高出从零训练模型约4.16点。模型在多天气、多场景下表现优异,验证了其鲁棒性和泛化能力。

应用场景

该模型适用于成本敏感的自动驾驶场景,如共享出行、物流配送等。只需摄像头,降低硬件成本,便于大规模部署。未来可结合自然语言交互,实现人机协作和智能导航。还可扩展到无人驾驶出租车、自动化物流车等行业应用,推动智能交通发展。

局限与展望

模型在极端天气(如大雾、暴雨)下表现仍有限,主要因视觉信息受干扰。高分辨率图像处理带来较大计算负担,实际部署需优化。复杂交互场景(如突发交通事件)反应仍需提升,未来需结合强化学习或多模态感知增强鲁棒性。

通俗解读 非专业人士也能看懂

想象你在一个工厂里工作,工厂里有很多不同的机器和流程。以前,工厂需要昂贵的设备(比如激光雷达)来确保每个机器都按计划工作,但成本很高。现在,科学家们发明了一种新方法,就像用一台高清摄像头观察工厂,只用它就能判断每台机器的状态和下一步动作。这台“高清摄像头”经过特别训练,能像人一样理解场景,知道哪里有障碍,哪里需要调整。它还会告诉你下一步该怎么走,比如绕过障碍或停车。这就像你用手机拍照后,AI帮你分析图片,告诉你哪里出问题,下一步怎么做。这样,工厂的管理变得更便宜、更智能,也更容易推广到其他工厂。这个方法用在自动驾驶车上,就是让车只用摄像头就能看清路况,安全驾驶,不需要昂贵的激光雷达或复杂标签。它像一个聪明的眼睛,帮车判断前方的路况,做出正确反应。未来,这种技术还能让车和人更好沟通,变得更智能、更省钱,就像你用手机和朋友聊天一样方便。

原文摘要

In this technical report, we present CarLLaVA, a Vision Language Model (VLM) for autonomous driving, developed for the CARLA Autonomous Driving Challenge 2.0. CarLLaVA uses the vision encoder of the LLaVA VLM and the LLaMA architecture as backbone, achieving state-of-the-art closed-loop driving performance with only camera input and without the need for complex or expensive labels. Additionally, we show preliminary results on predicting language commentary alongside the driving output. CarLLaVA uses a semi-disentangled output representation of both path predictions and waypoints, getting the advantages of the path for better lateral control and the waypoints for better longitudinal control. We propose an efficient training recipe to train on large driving datasets without wasting compute on easy, trivial data. CarLLaVA ranks 1st place in the sensor track of the CARLA Autonomous Driving Challenge 2.0 outperforming the previous state of the art by 458% and the best concurrent submission by 32.6%.

cs.CV cs.RO