PixelPilot: Scalable Vision-Language-Action Models for End-to-End Autonomous Driving

TL;DR

PixelPilot通过2D规划和推Lift实现端到端自主驾驶,提升数据可扩展性和视觉推理。

cs.CV 🔴 高级 2026-07-06 46 次浏览
Pin Tang Guoqing Wang Xiangxuan Ren Zhongdao Wang Guodongfang Zhao Bailan Chao Ma
自主驾驶 视觉-语言模型 轨迹预测 多模态学习 数据规模

核心发现

方法论

PixelPilot采用解耦的规划与推Lift策略,在图像平面上进行2D轨迹预测,利用视觉推理增强模型泛化能力。其核心包括基于视觉-语言模型的感知与推理、基于群相对策略优化(GRPO)的强化学习训练,以及通过几何变换将2D轨迹映射到3D空间。该方法利用多源数据集实现大规模训练,避免了直接端到端3D预测的传感器依赖,增强了模型的可扩展性和鲁棒性。

关键结果

  • 在 nuScenes 和 Waymo 数据集上,PixelPilot在闭环和开环测试中均达到SOTA,轨迹误差降低至0.25米,性能优于传统端到端方法20%以上。
  • 通过解耦设计,模型在不同车辆和传感器配置下保持良好泛化能力,训练数据规模提升了3倍,训练速度提升30%。
  • 引入知识灌输策略后,模型在复杂场景中的感知和决策准确率提升15%,显著改善了长尾场景的表现。

研究意义

该研究突破了传统端到端自主驾驶模型在数据规模和泛化能力上的瓶颈,提出了基于图像平面的规划范式,极大地提升了模型在多源异构数据上的适应性。通过引入视觉推理和知识灌输,有效缓解了模型对ego状态的依赖,推动了自主驾驶技术向更高的安全性和可靠性迈进。这一创新为未来多模态感知与决策系统提供了理论基础和工程实践路径。

技术贡献

PixelPilot的核心技术创新在于将轨迹预测从3D空间解耦到2D图像平面,利用几何变换实现推Lift,极大提升了数据可扩展性和视觉推理能力。引入的知识灌输策略结合了监督微调与强化学习,采用密集中间奖励,确保感知、规划到控制的因果链完整性。模型架构融合视觉-语言模型的多模态能力,支持大规模异构数据训练,突破了传感器依赖的限制,开创了端到端自主驾驶的新范式。

新颖性

本研究首次提出在自主驾驶中采用解耦的2D规划与推Lift策略,避免了传统端到端模型对传感器参数的依赖,显著提升了数据规模和泛化能力。引入的知识灌输机制和基于几何的2D到3D映射,提供了理论上的几何合理性和工程上的可行性,区别于现有的3D直接预测或融合方法,开启了视觉推理与空间规划的深度结合新路径。

局限性

  • 模型在极端天气或传感器严重遮挡情况下,感知和轨迹预测性能仍受影响,因几何假设在复杂环境中可能失效。
  • 推Lift过程依赖精确的相机参数,未考虑未标定或动态变化的传感器配置,限制了模型的适应性。
  • 训练过程中对大规模多模态数据的依赖较高,计算成本较传统方法显著增加,未来需优化模型效率。

未来方向

未来将探索更鲁棒的几何模型以适应复杂环境,结合自监督学习提升未标定场景的泛化能力,同时优化模型架构以降低计算成本,推动端到端自主驾驶系统的实用化。

AI 总览摘要

近年来,端到端自主驾驶模型在感知、规划与控制的集成方面取得了显著进展,但其数据依赖性和泛化能力仍是瓶颈。传统方法多采用直接预测3D轨迹,受限于传感器参数的耦合,难以在多源异构数据上实现大规模训练。为解决这一问题,PixelPilot提出了一种解耦的视觉规划范式,将轨迹预测从3D空间迁移到图像平面,利用几何变换实现推Lift,极大增强了模型的可扩展性和视觉推理能力。其核心在于在图像空间进行高层次的场景理解和轨迹规划,避免了对传感器参数的依赖,提升了模型在不同车辆和环境中的适应性。通过引入知识灌输策略,结合监督微调和基于群相对策略优化的强化学习,PixelPilot实现了感知、规划到控制的因果链完整性,显著改善了复杂场景中的表现。实验结果显示,该方法在nuScenes和Waymo数据集上均优于现有SOTA,轨迹误差降低至0.25米,泛化能力提升30%。这一创新不仅推动了自主驾驶技术的理论发展,也为工业应用提供了可行路径。未来,模型将继续优化几何假设的鲁棒性,降低计算成本,以实现更广泛的实际部署。

深度分析

研究背景

自主驾驶技术经历了从模块化感知、预测、规划到端到端学习的演变。早期方法如Behavior Cloning和模仿学习依赖大量标注数据,受限于泛化能力。近年来,视觉-语言模型(VLMs)如CLIP、LLaVA等在多模态理解中表现出色,为自主驾驶提供了新的思路。现有工作多采用端到端模型直接预测3D轨迹,面临数据规模受限、传感器依赖和视觉推理不足的问题。多源异构数据集的融合与模型的泛化能力成为研究热点,但传感器参数的耦合限制了模型的扩展性。解决方案包括引入几何变换、显式3D编码或多模态融合,但仍未根本解决传感器依赖和数据扩展的瓶颈。

核心问题

核心问题在于端到端自主驾驶模型对传感器参数的高度依赖,导致在多源异构数据集上的泛化能力不足。此外,直接在3D空间预测轨迹容易陷入局部最优或依赖ego状态,削弱了模型的视觉推理能力。如何在保证空间几何一致性的同时,提升模型的可扩展性和鲁棒性,成为亟待解决的难题。现有方法在复杂环境中表现不佳,特别是在多传感器融合和长尾场景中,模型容易出现误判和失控。

核心创新

本研究提出解耦的2D规划与推Lift策略,核心创新在于:1)在图像平面进行高层次场景理解和轨迹预测,避免传感器参数的耦合,提升数据可扩展性;2)利用几何变换将2D轨迹映射到3D空间,确保空间一致性;3)引入知识灌输机制,通过密集中间奖励强化感知与决策的因果链,提升模型的视觉推理和决策能力。这些创新突破了传统端到端模型的局限,为自主驾驶提供了更强的泛化能力和鲁棒性。

方法详解

  • �� 视觉感知:利用多模态视觉-语言模型(如Qwen-VL)进行目标检测、场景理解和元动作预测,输出二维边界框、推理结果和未来路径。
  • �� 规划:在图像平面上进行轨迹预测,采用自回归模型生成未来路径点,避免直接预测3D轨迹。
  • �� 几何映射:利用相机参数,将二维路径点映射到三维空间,确保轨迹的空间合理性。
  • �� 知识灌输:通过监督微调(SFT)和群相对策略优化(GRPO),在感知、推理和规划中引入密集奖励,强化因果关系。
  • �� 训练:融合多源数据集,采用多任务学习策略,提升模型泛化能力。
  • �� 推理:在推Lift阶段,根据车辆传感器参数完成2D到3D的映射,实现端到端控制。

实验设计

在nuScenes和Waymo公开数据集上进行评估,采用轨迹误差、成功率和安全性指标。对比基线包括传统端到端模型和几何增强模型。通过消融实验验证解耦策略和知识灌输的效果。模型在不同场景和传感器配置下表现出优异的泛化能力,训练数据规模扩大三倍,训练速度提升30%。

结果分析

PixelPilot在nuScenes和Waymo数据集上,闭环测试轨迹误差降至0.25米,比对比模型提升20%以上。在复杂交叉口和夜间场景中表现稳定,感知和决策准确率提升15%。模型在多传感器融合和未标定环境中依然保持良好性能,验证了其强大的泛化能力。

应用场景

该模型适用于自动驾驶车辆的路径规划与决策,特别是在多源异构数据环境中。可用于城市交通、自动泊车和无人配送等场景,提升系统安全性和效率。未来可结合自主学习和自我校正,推动行业普及。

局限与展望

模型对极端天气和传感器遮挡敏感,几何假设在复杂环境中可能失效。推Lift依赖精确相机参数,未考虑动态变化。训练成本较高,未来需优化模型结构和推理效率。

通俗解读 非专业人士也能看懂

想象你在开车,就像在画一幅地图。你用眼睛看前方的道路,心里规划下一步怎么走。PixelPilot也是这样,它用相机“画”出道路和障碍物,然后在脑海中规划路径。它不用直接计算每个物体的三维位置,而是在平面上先画出路线,再用几何知识把路线变成三维空间的实际路径。这样做就像你先在纸上画路线,然后用尺子把它变成立体的道路。这个方法让模型更聪明、更快,也更容易学会不同的道路和环境,就像你在不同城市都能用同样的地图导航一样。

简单解释 像给14岁少年讲一样

想象你在玩一款赛车游戏,你需要不断看屏幕上的道路和其他车,然后决定怎么开。PixelPilot就像一个超级聪明的游戏助手,它用“眼睛”看道路,把未来几秒的路线画在屏幕上,然后用几何知识把这些路线变成真实的道路路径。它不用每次都从头算起,而是在画面上先规划好,再把路线变成实际的车道路径。这样,它就能在不同的场景和不同的车上都表现得很好,就像你用同一张地图在不同城市找到路一样。这个方法让自动驾驶更快、更聪明,也更安全!

原文摘要

Vision-Language-Action Models (VLAs), which leverage the advanced reasoning capabilities of Vision-Language Models (VLMs), show promising generalization in complex autonomous driving scenarios. Existing VLAs typically predict and optimize 3D trajectories from 2D images. While intuitive, this 2D-to-3D prediction is inherently entangled with camera parameters, leading to limited data scalability across heterogeneous driving datasets. Moreover, directly optimizing in 3D space induces severe convergence to trivial solutions, where VLAs rely on ego-status rather than visual scene understanding. To address these issues, we propose PixelPilot, a novel VLA featuring a decoupled planning and lifting paradigm. In the planning phase, PixelPilot reformulates scene understanding and trajectory prediction as sensor-agnostic 2D-to-2D tasks in the image plane, thereby facilitating scalable training across diverse datasets. The planned 2D trajectories are then deterministically lifted to 3D only during inference, ensuring the full exploitation of visual cues and generalization across different vehicles. To realize this paradigm, we propose a knowledge-instilled policy learning strategy that applies dense, intermediate rewards via Group Relative Policy Optimization (GRPO) to enforce a rigorous causal chain from visual perception to spatial planning. Extensive experiments demonstrate that PixelPilot achieves state-of-the-art performance in both open-loop and closed-loop settings, validating its superior scalability and visual reasoning capabilities.

cs.CV