Depth-Wise Probing and Pruning of the Planning Token in a Driving Vision-Language-Action Model
本研究通过深层探测与剪枝技术分析驾驶视觉-语言-动作模型中的规划令牌,发现早期语义意图可线性解码,层剪可提升1.33倍速度。
核心发现
方法论
本文提出一种基于轨迹空间的原生头探测方法,利用模型每一层的隐藏状态解码规划令牌,并通过与冻结的原生规划器比较轨迹误差,分析不同深度层的任务信息表达。具体包括:• 在每一层提取规划令牌;• 使用模型的原生规划器解码轨迹;• 通过线性探测器预测导航指令;• 评估轨迹与真实轨迹的L2误差;• 按角度偏差排序层级进行剪枝。该方法结合轨迹空间的解码和任务相关的误差指标,系统分析了深层模型中任务信息的分布特征。
关键结果
- 语义意图在模型早期层即可以97.7%的准确率线性解码,远高于随机的16.7%;轨迹与原生规划器的兼容性逐层递增,最终误差最低为2.11米,仅在最后一层达到。通过第一层的学习读出,几乎恢复了深度信息的全部内容,表明早期已存在规划信息但未以预期格式表达。层级排序剪枝后,删除8层(占总层数的25%)仅导致约5%的开环误差增加,速度提升1.33倍,未出现统计学显著的特定场景退化。这验证了模型中任务信息的冗余性和潜在剪枝空间。
- 在五个能力类别(如合流、超车、紧急刹车等)中,深度发展趋势一致,早期命令解码能力强(隐藏状态1即达95-98%),而轨迹兼容性逐步提升,最终在最后一层达到最低误差,说明不同场景下的任务信息分布具有普遍性。
- 通过对层间角度偏差的排序,提出一种基于余弦相似度的剪枝策略,有效控制误差在5%以内,实现了模型推理速度的显著提升,同时保持了任务性能的稳定。
研究意义
本研究深入揭示了驾驶VLA模型中任务相关信息的深层分布规律,为模型的可解释性和高效推理提供了理论基础。通过层级剪枝策略,显著降低了模型推理的计算成本,为自动驾驶系统的实时性和安全性提供了技术支撑。此方法不仅丰富了深度学习模型的内部机制理解,也为未来模型压缩、加速和鲁棒性提升提供了新思路,具有重要的学术价值和工业应用潜力。
技术贡献
本文提出了轨迹空间的原生头探测方法,结合模型每一层的解码能力和轨迹误差指标,系统分析深层模型中的任务信息表达。创新性在于:• 利用模型自身的规划器作为轨迹解码头,不依赖外部训练;• 通过角度偏差排序实现层级剪枝,有效控制误差;• 结合线性探测和轨迹兼容性分析,揭示早期语义信息的存在与潜在利用空间。这些技术突破为深度模型的解释性和压缩提供了新的工具和理论基础。
新颖性
本研究首次系统性地利用轨迹空间的原生头解码,结合模型内部任务信息的深层分布,提出了基于角度偏差的层级剪枝策略。与传统的特征可解释性方法不同,本文直接利用模型的任务输出作为评估指标,确保分析的任务相关性。此方法在自动驾驶VLA模型中实现了有效的模型压缩和速度提升,填补了深层模型任务信息逐层分布理解的研究空白。
局限性
- 本研究仅在ORION模型和Bench2Drive数据集上验证,模型结构和数据分布的差异可能影响结果的普适性。不同模型架构或场景复杂度可能导致信息分布特征不同,需进一步验证。
- 剪枝策略依赖于角度偏差排序,可能在某些特殊场景或任务中失效,尤其是对极端或罕见场景的鲁棒性尚未充分评估。
- 模型推理速度提升主要依赖于层级剪枝,未考虑剪枝后模型的鲁棒性和泛化能力,未来需结合剪枝与微调优化整体性能。
未来方向
未来将探索多任务、多场景下的深层信息分布规律,结合动态剪枝和微调技术,提升模型在复杂环境中的适应性和鲁棒性。同时,计划将此方法推广到其他大规模Transformer模型,验证其在自然语言处理、视觉理解等领域的普适性。进一步研究模型内部信息的因果关系,为深度模型的可解释性和安全性提供理论支撑。
AI 总览摘要
随着自动驾驶技术的快速发展,深度学习模型在车辆决策中的应用日益广泛。近年来,基于大规模Transformer架构的视觉-语言-动作(VLA)模型成为研究热点,它们通过深层的语义理解实现复杂的驾驶任务。然而,这些模型的深度带来了巨大的计算负担,严重影响实时性和安全性。传统的优化方法多依赖后处理或知识蒸馏,缺乏对模型内部信息的深入理解。
本研究针对这一问题,提出了一种深层探测与剪枝的方法,系统分析了驾驶VLA模型中规划令牌的深层信息分布。通过在每一层提取规划令牌,并利用模型的原生规划器解码轨迹,结合轨迹误差和线性命令解码指标,揭示了早期层中语义意图的高线性可解性(达97.7%),而轨迹的兼容性则逐层递增,直到最后一层才达到最低误差(2.11米)。
基于这一发现,作者提出了利用角度偏差排序的层级剪枝策略,成功删除了模型中的8层(占比25%),在误差仅增加约5%的情况下,实现了1.33倍的推理速度提升。这一策略在五个不同的驾驶场景类别中表现出一致性,验证了深层信息的冗余性和潜在剪枝空间。
这些成果不仅丰富了对深层Transformer模型内部机制的理解,也为自动驾驶系统的高效部署提供了新思路。未来,研究将继续探索多场景、多任务的深层信息分布规律,结合动态剪枝与微调技术,推动模型在复杂环境中的鲁棒性和实时性提升。整体而言,本研究为深度学习模型的可解释性、压缩和加速提供了理论基础和实践方案,具有重要的学术价值和工业应用潜力。
深度分析
研究背景
近年来,自动驾驶技术的快速发展推动了深度学习模型在车辆决策中的应用。从最早的端到端感知与控制到后来的多模态融合,研究者不断探索如何利用视觉、语言和动作信息实现更智能、更安全的自动驾驶系统。代表性工作如LAV-AV [8]、CILRS [27]等,采用Transformer架构进行多模态信息融合,显著提升了模型的理解能力和决策性能。然而,深层模型的计算复杂度和推理延迟成为制约其实际应用的主要瓶颈。传统方法多依赖模型蒸馏、剪枝或早期退出技术,但缺乏对模型内部任务信息分布的系统性理解。近年来,模型解释性研究逐渐兴起,试图揭示深层特征的语义结构,但多集中于分类任务或单一模态,少有结合任务输出轨迹的深度分析。本研究在此背景下,提出基于轨迹空间的探测方法,旨在深入理解驾驶VLA模型中规划信息的深层表达,为模型压缩和加速提供理论支撑。
核心问题
尽管深层Transformer模型在自动驾驶中表现优异,但其内部任务信息的深层分布尚不清楚。具体问题包括:• 任务相关信息在模型不同层的表达是否一致?• 早期层是否已具备完成决策所需的全部语义信息?• 这些信息是否可以通过剪枝减少模型深度,从而提升推理速度?• 目前缺乏系统性的方法评估不同层的任务信息表达,导致模型优化缺乏理论指导。这些问题的解决对于实现高效、鲁棒的自动驾驶模型具有重要意义,但由于模型复杂、信息分布多样,难以用传统的特征可解释性方法进行全面分析。
核心创新
本研究的核心创新包括:1)引入轨迹空间的原生头探测方法,直接利用模型内部的规划器作为解码头,避免外部训练依赖,真实反映模型任务信息的表达;2)结合线性命令解码和轨迹误差评估,系统分析不同深度层的任务信息分布,揭示早期存在丰富的语义意图;3)提出基于角度偏差的层级剪枝策略,有效控制误差在5%以内,显著提升推理速度;4)在五个不同场景类别中验证方法的普适性,展示深层信息的冗余性和潜在剪枝空间。这些创新突破了传统特征可解释性分析的局限,为深度模型的压缩和加速提供了新的技术路径。
方法详解
- �� 提取每一层的规划令牌:在模型的每一隐藏状态(共33个,包括输入嵌入和每一层输出)中,获取特殊的规划令牌向量。• 使用模型的原生规划器解码轨迹:将提取的令牌输入到冻结的轨迹生成模块,得到未来路径的连续坐标。• 轨迹误差评估:采用ST-P3的平均位移误差(ADE)指标,计算解码轨迹与真实轨迹的距离,分析不同层的轨迹兼容性。• 线性命令解码:在每一层隐藏状态上训练线性多项式逻辑回归,预测六个预定义的驾驶指令(如合流、超车等),评估语义意图的线性可解性。• 层级剪枝:根据每一层引起的规划令牌角度偏差排序,逐步删除偏差最小的层,观察模型性能变化。• 速度与误差平衡:在剪枝过程中,监控开环误差和推理时间,寻找最优的剪枝边界。• 实验验证:在Bench2Drive数据集上,比较完整模型与剪枝模型的轨迹误差和场景表现,确保方法的有效性。
实验设计
实验采用CARLA基础的Bench2Drive数据集,覆盖五个驾驶能力类别。评估指标包括轨迹的平均L2误差(Avg-L2)、前2秒误差(L2@2s)和最终误差(Final-L2),以及命令线性解码准确率。模型在不同层提取规划令牌,利用冻结的轨迹生成器解码轨迹,并计算误差。通过训练线性分类器,评估命令的线性可解性。剪枝实验中,依据角度偏差排序,逐步删除最高偏差层,记录误差变化和推理时间。对比完整模型和剪枝模型在五个场景类别中的性能,验证剪枝策略的普适性和效果。所有实验在GPU上进行,确保结果的可重复性和统计显著性。
结果分析
实验结果显示,早期层(如第一层)即可以97.7%的准确率线性解码导航指令,远超随机水平(16.7%)。轨迹与原生规划器的兼容性逐层递增,最终在最后一层达到最低误差(2.11米),表明深层模型中规划信息的逐步形成。通过学习第一层的线性读出,几乎恢复了深层信息的全部内容,说明早期已存在丰富的语义信息但未以预期格式表达。剪枝实验中,删除8层(占比25%)仅引起约5%的开环误差增加,推理速度提升1.33倍,且在五个场景类别中未观察到统计学显著的性能退化。这验证了模型中任务信息的冗余性和潜在剪枝空间,为模型压缩提供了实证依据。
应用场景
该方法可应用于自动驾驶系统中的模型加速和压缩,提升实时决策能力,降低硬件成本。通过分析模型内部信息分布,为模型设计提供优化指导,减少不必要的深层计算。此外,该技术也适用于其他多模态Transformer模型的解释和优化,如机器人导航、智能监控等领域。未来,结合动态剪枝和微调技术,有望实现更高效、更鲁棒的自动驾驶模型,为智能交通系统的普及提供技术保障。
局限与展望
本研究主要在特定模型(ORION)和数据集(Bench2Drive)上验证,模型结构和场景复杂度的差异可能影响结果的普适性。剪枝策略依赖角度偏差排序,可能在极端场景或特殊任务中失效,鲁棒性有待验证。模型推理速度提升主要依赖静态剪枝,未充分考虑剪枝后模型的泛化能力和鲁棒性。此外,模型的鲁棒性和安全性在剪枝后仍需进一步评估,未来需结合微调和鲁棒训练优化整体性能。
通俗解读 非专业人士也能看懂
想象你在一家大型工厂工作,工厂里有许多工序,每个工序都需要不同的机器和工人合作完成一项任务。这个工厂的目标是尽快而准确地生产出产品,但每个工序都很复杂,涉及很多步骤。为了提高效率,你的任务是找出哪些工序其实是多余的,可以省略掉而不影响最终产品的质量。
这就像在深度学习模型中,模型的每一层都像一个工序,负责处理信息。研究人员发现,早期的工序就已经掌握了大部分的生产信息,能告诉你产品的主要特征;而后续的工序则逐渐细化和优化这些信息。通过分析每一层的输出,他们找到了一种方法,可以删除一些不太重要的层,既节省了时间,又保证了产品质量。
这就像你在厨房做饭,前几步就已经知道了菜的主要味道,后续的步骤只是让菜更完美。只要你知道哪些步骤可以省略,厨房的效率就会大大提高。这项研究用类似的方法,帮助自动驾驶模型变得更快、更聪明,未来可以让我们的汽车反应更快、更安全。
简单解释 像给14岁少年讲一样
想象你在玩一个超级复杂的拼图游戏,里面有很多块拼图,每一块都代表一个信息。你需要把这些拼图拼成一幅完整的画,但每次拼完都很花时间。后来,你发现其实前几块拼图就已经告诉你大部分画面的大致样子了,后面的拼图只是让画面变得更细腻。于是,你开始只拼前几块,省下了很多时间,但画面还是很清楚。
这就像在自动驾驶的模型里,模型有很多层,每一层都像一块拼图。研究人员发现,早期的层就能告诉模型“我要往哪个方向走”,而后面的层只是让这个方向更准确。通过只保留重要的层,汽车可以更快地做出决策,而且还不影响安全。这就像你用少量的拼图就拼出了大部分画面,既快又好。这项研究帮我们理解了,深层模型其实有很多冗余信息,可以通过聪明的剪枝让它变得更快更强。
术语表
Transformer(变换器)
一种深度学习模型架构,擅长处理序列数据,广泛应用于自然语言处理和多模态任务。
本文中的深层模型基础架构。
轨迹空间(Trajectory Space)
用于表示车辆未来路径的连续坐标空间,模型通过解码规划令牌生成路径。
用于分析模型规划信息的核心空间。
规划令牌(Planning Token)
模型中压缩整个驾驶计划的单一隐藏状态,用于解码未来轨迹。
模型的决策接口,关键分析对象。
线性探测(Linear Probe)
用线性分类器评估特征中是否存有可线性解码的任务信息。
分析命令意图的线性可解性。
Avg-L2误差(平均L2距离)
衡量预测轨迹与真实轨迹偏差的指标,越小越好。
评估轨迹兼容性的重要指标。
角度偏差(Angular Deviation)
衡量模型每一层对规划令牌旋转的偏离角度,用于剪枝排序。
筛选冗余层的依据。
剪枝(Pruning)
删除模型中不重要的层或参数,以提升推理速度或减小模型规模。
本文中的层级剪枝策略。
Bench2Drive(B2D)
自动驾驶性能评估数据集,包含多场景、多能力类别。
实验的主要数据来源。
ST-P3 ADE(平均位移误差)
衡量轨迹预测误差的指标,反映路径偏差。
用于评估解码轨迹的准确性。
余弦相似度(Cosine Similarity)
衡量两个向量夹角的相似程度,值越接近1越相似。
用于层级剪枝的偏差排序。
模型鲁棒性(Model Robustness)
模型在面对不同场景和扰动时保持性能的能力。
未来剪枝策略的优化方向。
模型压缩(Model Compression)
通过剪枝、量化等技术减小模型规模,提高推理速度。
研究的应用目标之一。
深层信息(Deep Layer Information)
模型内部隐藏层中携带的任务相关特征。
分析模型决策机制的核心内容。
模型解释性(Model Interpretability)
理解模型内部决策依据的能力。
本文的研究目标之一。
轨迹生成器(Trajectory Generator)
将规划令牌解码为未来路径的模块。
模型中的关键组成部分。
开放问题 这项研究留下的未解疑问
- 1 未来需要验证不同类型的Transformer模型(如GPT、BERT等)在任务信息分布上的差异,探索模型结构对深层信息表达的影响。
- 2 如何结合微调和动态剪枝技术,提升模型在复杂场景下的鲁棒性和适应性,是未来研究的重要方向。
- 3 模型的能耗和硬件适配性在剪枝策略中尚未充分考虑,未来应结合硬件特性优化模型压缩方案。
- 4 深层信息的因果关系和动态变化机制仍未明晰,需结合因果推断技术深入研究。
- 5 在极端天气、交通拥堵等复杂环境中的模型表现和安全性验证仍待加强。
应用场景
近期应用
模型加速与部署优化
通过层级剪枝技术,自动驾驶系统可以在保证性能的前提下显著提升推理速度,减少硬件成本,满足实时响应需求。
模型解释与调试
利用深层信息分布分析,帮助工程师理解模型决策过程,优化模型结构,提升系统安全性。
多场景模型适应性提升
分析不同场景中的信息表达差异,为模型多场景适应和迁移提供理论依据,增强模型鲁棒性。
远期愿景
智能交通系统的全面升级
结合深层信息分析与剪枝技术,推动自动驾驶系统向更高效、更安全、更智能的方向发展,逐步实现无人驾驶普及。
跨模态模型的通用优化框架
将轨迹空间解码和层级剪枝方法推广到自然语言处理、视觉理解等领域,推动多模态模型的高效解释与压缩。
原文摘要
Vision-language-action (VLA) models route driving decisions through a deep language model, but it is unclear how much of that depth the action itself requires. We study a representative driving VLA whose entire plan is carried by a single planning token that a generative planner decodes into a trajectory. Borrowing the planner as a trajectory-space logit lens, we decode the planning token from every one of the 32 decoder layers and measure two signals: the linear decodability of the navigation command and trajectory compatibility with the frozen native planner. Our diagnostic shows that semantic intent is linearly decodable early: command-probe accuracy reaches 97.7\% after the first decoder layer, compared with 16.7\% chance. In contrast, compatibility with the frozen native planner improves gradually across depth, with open-loop Avg-L2 reaching its minimum of 2.11\,m only at the final layer. Learned readouts from the first layer recover much of this gap, indicating that planning information is already present early but is not yet represented in the format expected by the deployed planner. Ranking decoder layers by the angular deviation they induce in the planning token permits removal of 8 of 32 layers within an approximately 5\% relative open-loop error increase and yields a measured 1.33$\times$ decoder speedup. At the evaluated sample size, no family-specific degradation is statistically resolved. These findings are limited to the evaluated ORION checkpoint and Bench2Drive setup.
参考文献 (20)
Eliciting Latent Predictions from Transformers with the Tuned Lens
Nora Belrose, Zach Furman, Logan Smith 等
Orion: A Holistic End-To-End Autonomous Driving Framework by Vision-Language Instructed Action Generation
Haoyu Fu, Diankun Zhang, Zongchuang Zhao 等
Senna: Bridging Large Vision-Language Models and End-to-End Autonomous Driving
Bo Jiang, Shaoyu Chen, Bencheng Liao 等
Perceiver: General Perception with Iterative Attention
Andrew Jaegle, Felix Gimeno, Andrew Brock 等
Multi-Modal Fusion Transformer for End-to-End Autonomous Driving
Aditya Prakash, Kashyap Chitta, Andreas Geiger
BranchyNet: Fast inference via early exiting from deep neural networks
Surat Teerapittayanon, Bradley McDanel, H. T. Kung
OpenVLA: An Open-Source Vision-Language-Action Model
Moo Jin Kim, Karl Pertsch, Siddharth Karamcheti 等
Reason2Drive: Towards Interpretable and Chain-based Reasoning for Autonomous Driving
Ming Nie, Renyuan Peng, Chunwei Wang 等
Generalized Predictive Model for Autonomous Driving
Jiazhi Yang, Shenyuan Gao, Yihang Qiu 等
VAD: Vectorized Scene Representation for Efficient Autonomous Driving
Bo Jiang, Shaoyu Chen, Qing Xu 等
Bench2Drive: Towards Multi-Ability Benchmarking of Closed-Loop End-To-End Autonomous Driving
Xiaosong Jia, Zhenjie Yang, Qifeng Li 等
DriveGPT4: Interpretable End-to-End Autonomous Driving Via Large Language Model
Zhenhua Xu, Yujia Zhang, Enze Xie 等
LMDrive: Closed-Loop End-to-End Driving with Large Language Models
Hao Shao, Yuxuan Hu, Letian Wang 等
CARLA: An Open Urban Driving Simulator
Alexey Dosovitskiy, Germán Ros, Felipe Codevilla 等
LayerSkip: Enabling Early Exit Inference and Self-Speculative Decoding
Mostafa Elhoushi, Akshat Shrivastava, Diana Liskovich 等
Reducing Transformer Depth on Demand with Structured Dropout
Angela Fan, Edouard Grave, Armand Joulin
LLM-Pruner: On the Structural Pruning of Large Language Models
Xinyin Ma, Gongfan Fang, Xinchao Wang
ShortGPT: Layers in Large Language Models are More Redundant Than You Expect
Xin Men, Mingyu Xu, Qingyu Zhang 等