核心发现
方法论
本文设计了基于块层的模型划分策略,将VLA模型按Transformer块层粒度划分,结合异步跨帧流水线实现GPU前缀与CPU后缀的并行推理。采用资源调度机制动态调整层划分点,优化计算负载与通信开销。实验中在Orion和MindDrive模型上验证,显著降低延迟,提升推理频率,GPU内存占用从45GB降至29GB。系统在真实车辆平台上成功部署,解决了GPU内存不足问题。
关键结果
- 在Bench2Drive测试中,Orion模型平均延迟由521ms降至408ms,降低21.7%;MindDrive由443ms降至306.2ms,降低30.9%。
- GPU峰值内存由45GB减至29GB,显著缓解硬件压力。
- 在Autoware.Universe环境中,原生Orion无法运行,混合架构成功协同全车系统,验证其实用性。
研究意义
该研究突破了传统单一设备推理的瓶颈,通过异构资源协作实现低延迟、低内存占用,为自主驾驶系统的高效部署提供新思路。解决了模型规模与硬件资源不匹配的难题,推动VLA模型在实际场景中的应用落地,具有重要的工业和学术价值。
技术贡献
提出块层粒度的异构推理架构,结合跨帧异步流水线和动态调度机制,有效平衡GPU与CPU资源利用。实现模型结构的自然切分,避免破坏Transformer块的完整性,提升系统整体效率。系统设计兼顾硬件感知优化与实际部署需求,具备良好的扩展性和适应性。
新颖性
首次提出基于块层的模型划分结合跨帧异步流水线的VLA推理架构,解决了自主驾驶中连续多帧推理的时序依赖与硬件资源不匹配问题,区别于以往单帧或纯模型优化方法。
局限性
- 当前方法依赖于Transformer块层结构,难以直接应用于非Transformer模型或结构复杂的模型。
- 调度策略在极端硬件资源变化时可能表现不足,需进一步优化适应性。
- 在极端场景下,通信开销仍可能成为瓶颈,影响实时性能。
未来方向
未来将探索多模态融合的更高效策略,结合硬件感知的自适应调度算法,提升系统鲁棒性。同时,考虑多任务场景下的资源分配,推动模型压缩与硬件协同优化,向更大规模、多场景应用扩展。
AI 总览摘要
随着自动驾驶技术的不断发展,视觉-语言-行动(VLA)模型逐渐成为实现端到端智能决策的关键路径。然而,这类模型在实际部署中面临推理延迟高、GPU资源压力大的挑战。传统的单设备推理难以满足高速实时需求,尤其在复杂场景下,模型规模庞大导致硬件资源紧张。为此,本文提出了一种基于块层的异构CPU-GPU协作推理框架,结合跨帧异步流水线,有效缓解了GPU内存瓶颈和延迟问题。该架构通过在Transformer块层粒度上划分模型,将视觉编码器和语言模型前缀在GPU上执行,而将后缀部分迁移至CPU,实现了多设备协同。实验在Orion和MindDrive模型上验证,延迟分别降低21.7%和30.9%,GPU峰值内存从45GB降至29GB,显著提升了推理效率和硬件利用率。在真实车辆平台上,混合架构成功部署,解决了原生模型无法在GPU有限内存下运行的问题。这一创新为自主驾驶系统提供了高效、可扩展的模型推理方案,推动VLA模型在实际场景中的应用落地。未来,结合硬件感知调度和多模态融合,将进一步提升系统的鲁棒性和适应性,为智能交通带来更广阔的前景。
深度分析
研究背景
近年来,自动驾驶从模块化感知、预测、规划逐步向端到端一体化方向演进。大规模多模态模型如LMDrive、CoVLA、AutoVLA推动了场景理解与决策的融合,工业界如小米的ORION和理想的MindVLA也在积极探索端到端VLA系统。然而,模型规模庞大带来的推理瓶颈限制了其在硬件资源有限的车辆平台上的部署。现有研究多关注模型结构优化与压缩,缺乏系统层面对异构硬件资源的调度策略。
核心问题
在自动驾驶中,VLA模型的实时推理成为核心难题。模型复杂度高,计算量大,GPU资源紧张,内存压力巨大。而传统推理多为单设备串行,难以满足高速、多帧连续推理的需求。如何在有限硬件条件下实现低延迟、低内存占用的推理,是当前亟待解决的问题。
核心创新
本文提出块层粒度的模型划分策略,利用Transformer块的结构特性,将模型在GPU和CPU之间自然切分,避免破坏块的完整性。同时,设计跨帧异步流水线,使GPU处理当前帧,CPU提前处理下一帧,极大提高推理吞吐。调度机制根据系统状态动态调整层划分点,平衡负载与通信。结合硬件感知优化,系统在真实车辆平台上实现高效部署,突破了传统单设备限制。
方法详解
- �� 利用Transformer块层结构,将模型划分为GPU前缀和CPU后缀,确保模型完整性。• 设计跨帧异步流水线,将GPU处理当前帧的前缀,边传输边由CPU处理后缀,实现并行。• 引入动态调度机制,根据实时资源状态调整层划分,优化延迟。• 采用硬件感知加速策略,提升CPU端推理效率。• 在Orion和MindDrive模型上进行系统验证,测量延迟、内存和推理频率。• 通过真实车辆测试,验证系统实用性和鲁棒性。
实验设计
采用Bench2Drive测试平台,比较原始模型与混合架构的性能差异。指标包括平均推理延迟、GPU峰值内存、推理频率。在不同层划分点下进行消融,分析通信开销与负载平衡。真实车辆环境中,结合Autoware.Universe,验证系统在实际场景中的表现。参数调优确保模型性能不受影响,系统稳定性得到保障。
结果分析
实验显示,混合架构将Orion模型延迟从521ms降至408ms,降低21.7%;MindDrive由443ms降至306.2ms,降低30.9%。GPU峰值内存由45GB减至29GB,显著缓解硬件压力。系统在连续多帧推理中保持高频率,满足实际应用需求。真实车辆测试中,混合架构成功运行,解决了原生模型因GPU内存不足无法部署的问题。这些结果验证了方法的有效性和实用性。
应用场景
该架构适用于自主驾驶车辆中的多模态感知与决策系统,特别是在GPU资源有限的场景。可实现端到端的低延迟推理,提升车辆响应速度。未来还可结合多模态信息融合和硬件感知调度,支持更复杂的场景与多任务需求,推动智能交通系统的普及。
局限与展望
目前方法依赖Transformer块结构,难以直接迁移到非Transformer模型。调度策略在极端硬件变化时可能表现不足,通信开销仍存在潜在瓶颈。未来需优化调度算法,提高系统鲁棒性和适应性。
通俗解读 非专业人士也能看懂
想象你在厨房做饭,厨房里有两个厨师:一个负责切菜(GPU),一个负责炒菜(CPU)。平时,切菜和炒菜是分开做的,但如果你把所有工作都堆在一个厨师身上,时间就会变得很长。现在,你让切菜的厨师专注切菜,把炒菜的厨师专注炒菜,还让他们在不同的时间同时工作。这样,厨房的效率就大大提高了。这个方法就像把复杂的模型拆成几个部分,让不同的硬件同时工作,既快又省力。
简单解释 像给14岁少年讲一样
想象你在学校里做一个大项目,里面有很多步骤,比如画图、写报告、做演示。以前,你一个人做所有事情,花了很长时间。而现在,你找几个朋友帮忙:一个负责画图,一个写报告,一个做演示。你们还安排好时间,让画图的人先画完,写报告的人在他做完后开始写,演示的人在最后准备。这样一来,大家同时工作,整个项目完成得更快。这就像论文里用的技术,把模型拆成几部分,让不同的硬件同时工作,节省时间,效率更高。
术语表
Transformer (变换器)
一种深度学习模型结构,擅长处理序列数据,广泛应用于自然语言处理和视觉任务。
论文中用于构建VLA模型的核心结构,块层划分基于Transformer块。
异步流水线 (Asynchronous Pipeline)
一种并行处理技术,允许不同阶段同时进行,减少等待时间,提高效率。
本文设计的跨帧异步流水线实现GPU和CPU的并行推理。
块层划分 (Block-layer Partitioning)
将模型按Transformer块粒度划分为不同执行单元,便于异构设备调度。
核心创新之一,用于平衡GPU和CPU的计算负载。
多模态模型 (Multimodal Model)
融合多种数据类型(如视觉、语言)进行联合推理的深度学习模型。
VLA模型即为典型的多模态模型。
边界隐藏状态 (Boundary Hidden State)
模型中跨设备传输的中间激活,用于连接不同设备的模型部分。
在模型划分中传输的中间激活,保证模型完整性。
开放问题 这项研究留下的未解疑问
- 1 如何进一步降低多模态模型在极端硬件限制下的延迟,仍需探索更高效的模型压缩与调度算法。
- 2 跨模态信息融合在异构架构中的优化策略尚不充分,未来需结合硬件感知进行深度调优。
原文摘要
Vision-Language-Action (VLA) models are becoming a promising paradigm for autonomous driving, but their deployment on existing vehicle platforms remains difficult because they introduce both high inference latency and strong GPU-side resource pressure. In a full autonomous driving stack, this problem is even more pronounced: legacy vehicle platforms were provisioned for modular pipelines, yet after several planning-related functions are absorbed into a unified VLA model, part of the original CPU budget becomes underutilized, while the visual encoder and the main reasoning path still concentrate most computation and memory demand on the GPU. As a result, directly deploying VLA together with the rest of the onboard system can be hard under realistic GPU memory constraints. To address this issue, we present a hybrid CPU--GPU inference framework with flexible resource scheduling for autonomous driving. Our design partitions the VLA backbone at the block-layer granularity, executes the visual encoder and LLM prefix on the GPU, and offloads the LLM suffix to the CPU through a cross-frame asynchronous pipeline, thereby exposing a schedulable boundary for redistributing compute and memory pressure across heterogeneous processors. We evaluate the proposed framework on two representative driving VLA models, Orion and MindDrive. On Bench2Drive, our method reduces average latency from 521ms to 408.0ms for Orion and from 443ms to 306.2ms for MindDrive, corresponding to 21.7% and 30.9% reduction, respectively. For Orion, the estimated peak GPU memory is further reduced from 45GB to 29GB. In real-vehicle deployment under coexistence with Autoware.Universe, native Orion cannot run because the onboard GPU memory budget is insufficient, whereas the hybrid version runs successfully together with the full vehicle stack.