RT-VLA: Real-Time Vision-Language-Action Models via Knowledge Distillation

TL;DR

RT-VLA通过多层次蒸馏,将SImLingo模型的驾驶与推理能力压缩成实时高效模型。

cs.CV 🔴 高级 2026-06-12 43 次浏览
Xiangyu Huang Zhenlin Hua Han Zhou Shounak Sural Ragunathan Rajkumar
自主驾驶 视觉-语言模型 知识蒸馏 实时推理 可解释性

核心发现

方法论

RT-VLA采用多层次监督蒸馏策略,将大型教师模型SimLingo的视觉特征、查询表示、路径点预测和语言输出逐步迁移至轻量学生模型。模型由EVA-02视觉编码器和简化的语言模块组成,通过对视觉特征的对齐、路径点和语言 logits 的蒸馏,实现性能与效率的平衡。训练过程中,结合离线语言分析实现后验解释,确保在不增加实时推理延迟的前提下,保留推理和解释能力。

关键结果

  • 与教师模型SimLingo相比,RT-VLA在Vision-only模式下推理速度提升44.8倍(从1544ms降至34.48ms),在Vision+Language模式下提升7.9倍(从1544ms降至196ms),同时保持85.19的驾驶得分,接近教师模型的85.07。模型在Bench2Drive数据集上表现出优异的闭环驾驶能力和推理性能。
  • 在安全关键场景中,RT-VLA能提前响应交通变化,显著提升反应速度,验证其在复杂城市环境中的实用性。离线语言解释模块能在事故后提供详细场景描述,增强模型的可解释性和安全性。
  • 通过逐层蒸馏和后续的策略微调,模型在保持高性能的同时,大幅降低推理延迟,为实际部署提供可能。实验还显示,蒸馏显著改善模型的推理稳定性和解释能力。

研究意义

本研究突破了VLA模型在实时性和可解释性上的瓶颈,将复杂的端到端视觉-语言推理融入轻量模型中,为自动驾驶行业提供了高效、可扩展的解决方案。其创新的多层次蒸馏策略,为未来多模态模型的压缩与部署提供了新思路,有望推动自主驾驶技术的商业化落地,改善交通安全与效率。

技术贡献

提出多层次监督蒸馏框架,结合视觉特征、查询表示、路径点和语言 logits的逐层迁移,显著提升模型推理速度。引入离线语言分析支持后验解释,确保模型在高速决策中仍具备良好的推理和解释能力。创新性地将知识蒸馏应用于多模态自主驾驶模型,突破了传统单一输出蒸馏的限制,为模型压缩和性能提升提供了新途径。

新颖性

首次将多层次监督蒸馏应用于端到端VLA模型,兼顾推理性能与实时效率。区别于以往仅蒸馏输出分布的方法,本研究通过视觉特征、路径点和语言 logits的逐层迁移,实现模型的深层知识压缩。引入离线后验解释机制,增强模型的可解释性,填补了自主驾驶中模型压缩与推理解释的空白。

局限性

  • 模型依赖模拟环境训练,可能在真实场景中存在域偏差,影响鲁棒性。由于未结合多模态传感器,面对恶劣天气或复杂光照条件时表现尚待验证。
  • 安全性方面,模型未明确引入安全约束或鲁棒性优化,仍存在潜在风险。未来需结合安全优化策略,提升在极端场景下的可靠性。
  • 模型在复杂长尾场景中的表现仍有限,需引入多样化训练数据和安全保障机制,以实现更广泛的应用。

未来方向

未来将结合多模态传感器(如LiDAR)提升环境感知能力,探索安全性增强机制,优化模型在极端条件下的鲁棒性。还计划引入主动学习和在线微调策略,持续改善模型的适应性和解释能力,推动模型在真实世界中的落地应用。

AI 总览摘要

随着自动驾驶技术的不断发展,端到端视觉-语言-行动(VLA)模型展现出强大的潜力,能够实现视觉感知、语言推理与行为决策的融合。然而,现有的VLA模型普遍面临推理延迟过高的问题,限制了其在实际道路环境中的部署。为解决这一瓶颈,本文提出RT-VLA,一种基于多层次知识蒸馏的轻量化模型,成功将大型教师模型SimLingo的能力迁移到紧凑的学生模型中。

RT-VLA通过对视觉特征、路径点预测和语言 logits的逐层蒸馏,显著降低了推理时间,同时保持了与教师模型相媲美的驾驶和推理性能。在Vision-only模式下,推理速度提升44.8倍,达到每帧34.48毫秒;在Vision+Language模式下,提升7.9倍,达到196毫秒。这一突破使得模型能够满足实时驾驶的需求,为自动驾驶的商业化提供了技术支撑。

此外,RT-VLA引入离线语言分析机制,实现对安全关键场景的后验解释,增强模型的可解释性和安全性。在Bench2Drive数据集上的评估显示,模型在保持85.19的驾驶得分的同时,显著提升了推理效率。实验还验证了多层次蒸馏和策略微调对性能的促进作用。

整体而言,RT-VLA在保证高性能的基础上,大幅降低了推理成本,为未来自主驾驶模型的部署提供了新思路。未来工作将结合多模态传感器、强化安全性和在线学习,推动模型在复杂真实环境中的应用落地。

深度分析

研究背景

近年来,端到端自主驾驶模型逐渐成为研究热点,代表性方法包括DriveCoT、TransFuser和SimLingo等。这些模型通过深度学习实现感知、推理与控制的统一,提升了系统的整体性能。然而,复杂的模型结构带来高延迟,限制了在实际道路中的应用。尤其是VLA模型,结合视觉与语言的推理能力,虽提升了决策的解释性,但推理速度成为瓶颈,亟需高效的模型压缩方案。

核心问题

现有VLA模型在保证推理能力的同时,推理延迟过高,难以满足实时驾驶需求。复杂的模型架构导致推理时间长,影响反应速度,增加安全风险。如何在保持推理性能的基础上大幅降低延迟,是当前的核心难题。此外,模型的可解释性不足,也限制了其在安全关键场景的应用。

核心创新

本研究提出多层次知识蒸馏策略,将教师模型的视觉特征、路径点和语言 logits逐层迁移到轻量学生模型中,显著提升推理速度。引入离线后验解释机制,实现安全场景的事后分析,增强模型的可解释性。不同于传统单一输出蒸馏方法,本方案结合多模态特征的深层迁移,突破了模型压缩与解释的双重瓶颈,推动了自主驾驶模型的实用化。

方法详解

  • �� 设计多层次蒸馏框架,将教师模型的视觉特征、查询表示、路径点和语言 logits逐层迁移到学生模型。• 采用EVA-02作为视觉编码器,简化模型结构,提升效率。• 构建对齐模块,将不同模型的特征和序列长度统一,为蒸馏提供基础。• 在训练中结合路径点、视觉特征和语言的多任务损失,确保模型在推理和解释方面的能力。• 引入离线语言微调,通过模拟推理场景,提升模型的后验解释能力。• 采用两阶段训练策略,先优化驾驶性能,再专注于语言解释,确保两者兼得。

实验设计

在Bench2Drive数据集上进行评估,模型在220条路线中测试,采用驾驶得分、推理时间和评论质量三项指标。训练使用SimLingo的训练数据,验证集占比5%。对比基线包括原始SimLingo和简化版本,重点考察推理速度与性能的折中。通过消融实验验证多层次蒸馏和微调的效果。模型在不同场景中表现出优异的响应速度和决策能力,验证其实用性。

结果分析

RT-VLA在推理速度上实现44.8倍提升(从1544ms降至34.48ms),在Vision+Language模式下提升7.9倍(从1544ms降至196ms),同时保持85.19的驾驶得分,几乎与教师模型持平。评论质量也接近原模型,验证了知识蒸馏在性能和效率上的平衡。实验证明,蒸馏和微调显著改善模型的鲁棒性和解释能力,为实际部署提供了可能。

应用场景

该模型适用于自动驾驶系统中的实时决策,尤其在复杂城市环境中,能快速响应交通变化。其低延迟特性保证了车辆的安全性和响应速度,适合部署在智能交通管理和自动驾驶车辆中。未来还可结合多模态传感器,提升环境感知能力,推动行业应用落地。

局限与展望

模型依赖模拟数据训练,可能在真实环境中表现不佳。未结合LiDAR等多模态信息,面对恶劣天气或复杂光照条件时鲁棒性不足。安全性方面,未引入鲁棒性优化措施,存在潜在风险。未来需加强安全保障和多模态融合,提升模型的实际适应性。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,厨师(模型)需要准备各种食材(信息),并按照食谱(任务)做出美味的菜肴(决策)。传统厨师用很多时间逐一检查每个食材,等待所有准备工作完成后再开始烹饪,这样速度很慢。而RT-VLA就像一个聪明的助手,提前学习厨师的做菜技巧,把重要的步骤和食材信息压缩成小本子(模型参数),在厨房里快速反应,只在需要详细解释时才翻开本子,提供详细的菜谱说明。这样既保证了菜的质量,又大大节省了时间,能在繁忙的厨房里快速出菜,确保每道菜都美味可口。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的电子游戏,里面有很多任务和提示。以前的游戏AI需要花很多时间思考每个动作,反应很慢,玩起来不顺畅。现在,科学家们发明了一种聪明的助手(RT-VLA),它提前学会了很多技巧,把复杂的思考过程变得很快。它可以在你刚遇到问题时迅速做出反应,还能在你需要解释为什么这么做时,告诉你详细的理由。这个助手不仅快,还能解释自己的动作,帮助你更好理解游戏规则。这样,你在游戏中就能更顺利、更安全地完成任务,体验也更好。

原文摘要

Vision-Language-Action (VLA) models have shown strong potential for end-to-end autonomous driving by jointly modeling visual perception, language reasoning, explainability and action prediction. However, their large vision-language backbones and reasoning modules introduce substantial inference latency and thereby prevent their deployment in the unforgiving reality of the road networks. We propose RT-VLA, a lightweight, distilled VLA model that transfers the driving and reasoning capabilities of the state-of-the-art SimLingo model into a compact student through multi-level supervised distillation. RT-VLA preserves language-based reasoning and supports post-hoc explanation through offline language analysis of safety-critical driving moments without adding latency to real-time control. Compared to the SimLingo teacher, RT-VLA maintains competitive closed-loop driving and language reasoning performance while reducing inference time by 44.8X in vision-only mode and 7.9X in vision+language mode. These results suggest that supervised distillation is a practical approach for building real-time, explainable VLA-style autonomous driving models.

cs.CV cs.LG cs.RO