ETA-VLA: Efficient Token Adaptation via Temporal Fusion and Intra-LLM Sparsification for Vision-Language-Action Models

TL;DR

ETA-VLA通过时间融合和稀疏化减少计算量32%,保留94%准确率。

cs.RO 🔴 高级 2026-03-26 2 次浏览
Yiru Wang Anqing Jiang Shuo Wang Yuwen Heng Zichong Gu Hao Sun
自动驾驶 视觉语言模型 稀疏化 时间融合 深度学习

核心发现

方法论

ETA-VLA通过引入时间融合模块(TFM)和内部LLM稀疏聚合器(ILSA)来提高视觉语言动作模型的效率。TFM在视觉编码器特征上操作,通过变换器和可学习权重自适应地融合多帧历史特征,压缩时间维度,同时保留关键运动线索。ILSA在LLM内部进行细粒度的令牌稀疏化,采用无RoPE的语义评分机制,确保视觉令牌仅基于其与驾驶指令的语义相关性进行评分。

关键结果

  • ETA-VLA在NAVSIM v2上实现了与最先进基线相当的驾驶性能,同时将计算FLOPs减少约32%。
  • 该方法修剪了85%的视觉令牌,推理FLOPs减少61%,但在NAVSIM v2基准上仍保留了94%的原始准确率。
  • 在Navtest基准上,ETA-VLA的EPDMS得分为85.0,超过了许多现有方法。

研究意义

ETA-VLA在视觉语言动作模型中通过减少计算复杂度和提高效率,为自动驾驶领域带来了显著的进步。它解决了历史多视图帧处理中的计算瓶颈问题,使得在嵌入式硬件上运行成为可能。该方法的成功展示了通过稀疏化和时间融合来优化模型性能的潜力。

技术贡献

ETA-VLA通过时间融合和稀疏化策略在视觉语言动作模型中实现了显著的计算效率提升。与现有方法相比,它在LLM内部实现了层自适应稀疏处理,并引入了无RoPE的语义评分机制,确保视觉令牌选择的语义相关性。

新颖性

ETA-VLA首次在视觉语言动作模型中结合了时间融合和内部LLM稀疏化策略。与以往方法不同,它在LLM内部进行稀疏化处理,显著减少了计算复杂度,同时保留了模型的语义理解能力。

局限性

  • ETA-VLA在处理极端复杂场景时可能会遇到性能下降的问题,因为稀疏化策略可能会丢失重要的视觉信息。
  • 该方法在实时应用中可能需要进一步优化以满足高频率更新的需求。

未来方向

未来的研究可以探索更复杂的场景下的稀疏化策略优化,以及在不同硬件平台上的适应性。此外,结合其他感知模式(如雷达或激光雷达)的多模态融合也是一个值得探索的方向。

AI 总览摘要

自动驾驶系统中,视觉语言动作(VLA)模型的整合提供了一种解释复杂场景和执行控制命令的统一框架。然而,准确的时间推理需要结合历史多视图帧,这对计算资源提出了严峻挑战。ETA-VLA通过引入时间融合模块(TFM)和内部LLM稀疏聚合器(ILSA),有效地减少了计算复杂度。TFM在视觉编码器特征上操作,通过变换器和可学习权重自适应地融合多帧历史特征,压缩时间维度,同时保留关键运动线索。ILSA在LLM内部进行细粒度的令牌稀疏化,采用无RoPE的语义评分机制,确保视觉令牌仅基于其与驾驶指令的语义相关性进行评分。实验结果表明,ETA-VLA在NAVSIM v2基准上实现了与最先进基线相当的驾驶性能,同时将计算FLOPs减少约32%。该方法修剪了85%的视觉令牌,推理FLOPs减少61%,但在NAVSIM v2基准上仍保留了94%的原始准确率。未来的研究可以探索更复杂的场景下的稀疏化策略优化,以及在不同硬件平台上的适应性。

深度分析

研究背景

在自动驾驶领域,视觉语言动作(VLA)模型因其能够将高维视觉输入和语言指令映射为可执行的驾驶动作而备受关注。传统的VLA架构通常将多视图历史帧展平并与文本提示连接,随着帧数的增加,序列长度线性增长,导致FLOPs的二次爆炸。这种计算复杂度使得在车辆嵌入式硬件上运行变得不可行。

核心问题

VLA模型在处理高维时空数据时面临效率与准确性之间的权衡。驾驶是一个动态过程,准确的轨迹预测需要对运动历史的理解,通常需要处理过去的多帧数据。标准的VLA架构在处理多视图历史帧时,计算复杂度随着帧数和视图数量的增加而呈指数增长。

核心创新

ETA-VLA通过引入时间融合模块(TFM)和内部LLM稀疏聚合器(ILSA)来提高效率。TFM在视觉编码器特征上操作,通过变换器和可学习权重自适应地融合多帧历史特征,压缩时间维度。ILSA在LLM内部进行细粒度的令牌稀疏化,采用无RoPE的语义评分机制,确保视觉令牌仅基于其与驾驶指令的语义相关性进行评分。

方法详解

  • �� 时间融合模块(TFM):在视觉编码器特征上操作,通过变换器和可学习权重自适应地融合多帧历史特征。
  • �� 内部LLM稀疏聚合器(ILSA):在LLM内部进行细粒度的令牌稀疏化,采用无RoPE的语义评分机制。
  • �� 语义相关性评分:确保视觉令牌仅基于其与驾驶指令的语义相关性进行评分。

实验设计

实验在NAVSIM v2基准上进行,使用了LLaVA-v1.5-7B和Vicuna-7B LLM。模型在trainval分割上预训练1个epoch,然后在navtrain上微调1个epoch。实验评估了ETA-VLA在Navtest和Navhard基准上的性能,主要指标为EPDMS。

结果分析

ETA-VLA在NAVSIM v2上实现了与最先进基线相当的驾驶性能,同时将计算FLOPs减少约32%。该方法修剪了85%的视觉令牌,推理FLOPs减少61%,但在NAVSIM v2基准上仍保留了94%的原始准确率。

应用场景

ETA-VLA可以直接应用于自动驾驶系统中,特别是在需要高效处理多视图历史帧的场景中。通过减少计算复杂度,该方法使得在嵌入式硬件上运行成为可能。

局限与展望

ETA-VLA在处理极端复杂场景时可能会遇到性能下降的问题,因为稀疏化策略可能会丢失重要的视觉信息。此外,该方法在实时应用中可能需要进一步优化以满足高频率更新的需求。

通俗解读 非专业人士也能看懂

想象你在驾驶一辆汽车,而你的眼睛和大脑需要同时处理来自多个方向的视觉信息。ETA-VLA就像是一个聪明的助手,它帮助你过滤掉不重要的信息,只保留那些对驾驶决策至关重要的部分。就像你在开车时会专注于前方的道路,而不是路边的广告牌一样,ETA-VLA通过稀疏化策略减少了需要处理的信息量,从而提高了效率。

简单解释 像给14岁少年讲一样

想象你在玩一个赛车游戏,你需要同时关注赛道、对手和速度表。ETA-VLA就像是游戏中的一个超级助手,它帮助你自动过滤掉那些不重要的细节,只保留那些对赢得比赛至关重要的信息。这样,你就可以更快地做出反应,赢得比赛!这就像是你在学校考试时,有一个助手帮你划重点,让你更有效率地复习。

术语表

ETA-VLA (高效令牌适应)

一种通过时间融合和稀疏化提高视觉语言动作模型效率的框架。

用于减少计算复杂度并提高自动驾驶模型的效率。

TFM (时间融合模块)

在视觉编码器特征上操作,通过变换器和可学习权重自适应地融合多帧历史特征。

用于压缩时间维度并保留关键运动线索。

ILSA (内部LLM稀疏聚合器)

在LLM内部进行细粒度的令牌稀疏化,采用无RoPE的语义评分机制。

确保视觉令牌仅基于其与驾驶指令的语义相关性进行评分。

RoPE (旋转位置嵌入)

一种用于编码相对位置的嵌入方法。

在ETA-VLA中被替代以消除距离偏差。

EPDMS (扩展预测驾驶模型评分)

评估自动驾驶系统的安全性、效率和舒适性的综合评分。

用于验证ETA-VLA的驾驶性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在更复杂的场景中优化稀疏化策略,以确保不丢失关键视觉信息?
  • 2 在不同硬件平台上,如何进一步提高ETA-VLA的适应性和实时性能?

应用场景

近期应用

自动驾驶系统

ETA-VLA可以直接应用于自动驾驶系统中,特别是在需要高效处理多视图历史帧的场景中。

远期愿景

多模态融合

未来可以结合其他感知模式(如雷达或激光雷达)进行多模态融合,以提高自动驾驶系统的鲁棒性。

原文摘要

The integration of Vision-Language-Action (VLA) models into autonomous driving systems offers a unified framework for interpreting complex scenes and executing control commands. However, the necessity to incorporate historical multi-view frames for accurate temporal reasoning imposes a severe computational burden, primarily driven by the quadratic complexity of self-attention mechanisms in Large Language Models (LLMs). To alleviate this bottleneck, we propose ETA-VLA, an Efficient Token Adaptation framework for VLA models. ETA-VLA processes the past $n$ frames of multi-view images and introduces a novel Intra-LLM Sparse Aggregator (ILSA). Drawing inspiration from human driver attention allocation, ILSA dynamically identifies and prunes redundant visual tokens guided by textual queries and temporal consistency. Specifically, we utilize a text-guided scoring mechanism alongside a diversity-preserving sparsification strategy to select a sparse subset of critical tokens, ensuring comprehensive awareness of the driving scene. Extensive experiments on the NAVSIM v2 demonstrate that ETA-VLA achieves driving performance comparable to state-of-the-art baselines while reducing computational FLOPs by approximately 32\%. Notably, our method prunes 85% of visual tokens and reduces inference FLOPs by 61\%, but still retaining 94% of the original accuracy on the NAVSIM v2 benchmark.

cs.RO cs.AI