Think at 5 Hz, Act at 20 Hz: Asynchronous Fast-Slow Vision-Language-Action Inference for Closed-Loop Driving
提出异步快慢视觉语言动作推理架构,将路线完成率从37.0提升至94.0。
核心发现
方法论
该研究提出了一种异步快慢架构,使用冻结的7B视觉语言骨干作为慢系统,处理导航指令和视觉历史。轻量级动作专家作为快系统,每个仿真刻度访问缓存和当前相机帧以回归路径点。通过随机陈旧性训练专家,确保训练与异步执行对齐。
关键结果
- 在CARLA的LangAuto-Short路线中,该系统在每50毫秒的仿真刻度上产生新鲜控制,将路线完成率从37.0提升至94.0。
- 在相同专家的帧跳过消融实验中,专家自身提高驾驶得分,而每刻度的新鲜度将完成率从82.1提高到94.0,并减少三分之一的红灯违规。
- 专家在单个城镇训练后,零样本迁移到两个未见过的城镇,保持84-94%的路线完成率,而基线仅为31-41%。
研究意义
该研究通过异步快慢架构解决了大语言模型在自动驾驶中的推理延迟问题,显著提高了路线完成率和减少了交通违规。这一架构的提出为自动驾驶领域提供了一种新的解决方案,特别是在需要实时控制的场景中。
技术贡献
该研究的技术贡献在于提出了一种异步快慢架构,将大语言模型的推理与实时控制分离,通过缓存机制实现了低延迟的控制输出。这一方法在不压缩或重新训练骨干网络的情况下,显著提高了系统的效率和性能。
新颖性
该研究首次提出了异步快慢架构,将视觉语言模型的场景理解与实时动作推理分离,解决了传统方法中推理延迟与控制速率不匹配的问题。
局限性
- 该方法在长路线的危险协商上不具备迁移能力,可能需要更长的训练数据。
- 系统在模拟环境中测试,实际道路上的安全性尚未验证。
未来方向
未来工作可以包括在更复杂的交通场景中测试该架构,探索长路线训练数据的影响,以及在实际道路环境中的应用。
AI 总览摘要
自动驾驶技术的快速发展面临着如何在复杂环境中实时决策的挑战。现有的大语言模型虽然在场景理解和指令执行上表现出色,但其推理延迟与车辆所需的控制速率不匹配,导致部分控制输出忽略了最新的观察结果。
本文提出了一种异步快慢架构,通过将视觉语言模型的推理与实时控制分离,解决了这一问题。具体而言,冻结的7B视觉语言骨干作为慢系统,处理导航指令和视觉历史,而轻量级动作专家作为快系统,每个仿真刻度访问缓存和当前相机帧以回归路径点。通过随机陈旧性训练专家,确保训练与异步执行对齐。
实验结果表明,该系统在CARLA模拟器中显著提高了路线完成率,并减少了交通违规。这一研究为自动驾驶领域提供了一种新的解决方案,特别是在需要实时控制的场景中。然而,该方法在长路线的危险协商上不具备迁移能力,未来工作可以包括在更复杂的交通场景中测试该架构。
深度分析
研究背景
自动驾驶技术近年来取得了显著进展,尤其是在视觉语言模型的应用上。这些模型能够理解自然语言指令并解释其决策过程。然而,现有方法在实时控制中面临推理延迟的问题,导致部分控制输出忽略了最新的观察结果。
核心问题
核心问题在于如何在保持高效场景理解的同时,实现实时控制。大语言模型的推理延迟与车辆所需的控制速率不匹配,导致部分控制输出忽略了最新的观察结果。
核心创新
本文提出了一种异步快慢架构,通过将视觉语言模型的推理与实时控制分离,解决了推理延迟与控制速率不匹配的问题。该架构使用冻结的7B视觉语言骨干作为慢系统,轻量级动作专家作为快系统。
方法详解
- �� 使用冻结的7B视觉语言骨干作为慢系统,处理导航指令和视觉历史。
- �� 轻量级动作专家作为快系统,每个仿真刻度访问缓存和当前相机帧以回归路径点。
- �� 通过随机陈旧性训练专家,确保训练与异步执行对齐。
实验设计
实验在CARLA模拟器的LangAuto-Short路线中进行,使用冻结的7B视觉语言骨干和轻量级动作专家。通过随机陈旧性训练专家,确保训练与异步执行对齐。实验结果表明,该系统在每50毫秒的仿真刻度上产生新鲜控制,将路线完成率从37.0提升至94.0。
结果分析
实验结果表明,该系统在CARLA模拟器中显著提高了路线完成率,并减少了交通违规。专家在单个城镇训练后,零样本迁移到两个未见过的城镇,保持84-94%的路线完成率,而基线仅为31-41%。
应用场景
该架构可应用于需要实时控制的自动驾驶场景,特别是在复杂的城市交通环境中。通过减少推理延迟和提高控制精度,该方法有望提高自动驾驶系统的安全性和效率。
局限与展望
该方法在长路线的危险协商上不具备迁移能力,可能需要更长的训练数据。系统在模拟环境中测试,实际道路上的安全性尚未验证。
通俗解读 非专业人士也能看懂
想象你在一个厨房里,慢系统就像一个厨师,负责理解食谱和准备食材,而快系统则像一个助手,负责快速执行厨师的指令。厨师可能需要时间来理解复杂的食谱,但助手可以在每个步骤中快速行动,确保菜肴按时完成。通过这种方式,厨房能够在不牺牲质量的情况下高效运作。
简单解释 像给14岁少年讲一样
想象你在玩一个赛车游戏,你的任务是驾驶赛车在城市中穿行。游戏中有一个聪明的助手,它能理解你给出的路线指令,并帮助你快速做出转弯和刹车的决定。这个助手就像是你游戏中的超级大脑,确保你不会错过任何一个红绿灯。这种方法让你在游戏中表现得更好,就像这篇论文中的系统在自动驾驶中表现出色一样!
术语表
视觉语言模型 (Vision-Language Model)
结合视觉和语言信息进行推理的模型,通常用于理解复杂的场景和指令。
在本文中用于处理导航指令和视觉历史。
异步架构 (Asynchronous Architecture)
一种将不同任务分离并在不同时间点执行的架构,旨在提高系统效率。
用于分离视觉语言模型的推理与实时控制。
CARLA模拟器
一个用于自动驾驶研究的开源城市驾驶模拟器,提供复杂的交通环境。
用于测试该系统的路线完成率和交通违规情况。
随机陈旧性训练
一种训练方法,通过引入随机延迟模拟系统在实际应用中的陈旧性。
用于训练动作专家,确保训练与异步执行对齐。
路径点回归
根据当前环境和历史信息预测车辆未来路径的技术。
动作专家使用该技术在每个仿真刻度上生成新鲜控制。
开放问题 这项研究留下的未解疑问
- 1 如何在长路线的复杂交通场景中保持高效的实时控制?
- 2 该架构在实际道路环境中的安全性和可靠性如何?
应用场景
近期应用
城市自动驾驶
通过减少推理延迟和提高控制精度,该方法有望在复杂的城市交通环境中提高自动驾驶系统的安全性和效率。
远期愿景
全自动驾驶
该架构有潜力成为全自动驾驶系统的一部分,通过进一步优化和验证,可能实现完全自主的城市驾驶。
原文摘要
Large language models bring instruction following and scene reasoning to end-to-end driving, but their inference latency collides with the control rate a vehicle requires. Existing closed-loop agents hide this gap by invoking the model on alternate simulation ticks and replaying the previous command in between, so half of all control outputs ignore the newest observations. We present a fast-slow architecture that removes this compromise. A frozen 7B vision-language backbone acts as the slow system, digesting navigation instructions and visual history at low frequency while exposing its per-layer key-value cache as a standing representation of the scene. A lightweight action expert acts as the fast system, attending to this cache and to the current camera frame at every simulation tick to regress waypoints in a single forward pass. Since the cache lags behind the world at deployment, we train the expert under randomized staleness, aligning training with asynchronous execution. On LangAuto-Short routes in CARLA, our system produces fresh control at every 50 ms simulation tick and lifts route completion from 37.0 to 94.0 over the frame-skipping baseline. A frame-skip ablation with the same expert separates the two factors at work: the expert raises the driving score on its own, while per-tick freshness raises completion from 82.1 to 94.0 and cuts red-light violations by a third. Trained on a single town, the expert transfers zero-shot to two unseen towns, holding 84-94% route completion where the baseline reaches 31-41%. It reduces open-loop waypoint error by nearly a factor of four compared to the backbone's own action head, at a per-tick model cost of 32 ms that is independent of history length on a single consumer GPU.