ASSCG: Just-Right Gating over Chattering for Fast-Slow LLM Planning in Autonomous Driving

TL;DR

ASSCG通过RWKV骨干实现快慢系统自适应门控,在nuPlan Hard20上提升2.28分并减少60%延迟。

cs.RO 🔴 高级 2026-06-24 39 次浏览
Sining Ang Yuan Chen Liu Haiyan Xuanyao Mao Jason Bao Xuliang Bingchuan Sun Yan Wang
自动驾驶 大语言模型 快慢系统 强化学习 资源优化

核心发现

方法论

ASSCG是一种架构无关的控制门,通过RWKV骨干网络实现帧级Query/Cache/Drop决策,结合监督微调和计算感知型GRPO强化学习优化,适配快慢系统的协作。

关键结果

  • 在nuPlan Hard20评估中,ASSCG集成到AsyncDriver后,得分提升至67.28(+2.28),平均推理延迟减少约60%。
  • 在NAVSIM上,基于RecogDrive的双系统中,ASSCG实现了91.4的PDMS分数(+0.6),平均速度提升约25%。
  • 通过实验验证,ASSCG在多个场景中有效平衡了规划质量与计算资源消耗。

研究意义

该研究解决了当前快慢规划系统中手动触发规则不够精准的问题,通过ASSCG实现了帧级的动态门控决策,显著提升了规划性能和计算效率。这一方法为自动驾驶领域的规划模块提供了新的设计思路,尤其是在资源受限的场景中。

技术贡献

提出了一个基于RWKV的自适应门控机制,能够在部分可观测的环境中进行长时间的上下文跟踪。通过引入Query、Cache和Drop三种动作,优化了快慢系统的协作效率。此外,采用了计算感知型GRPO强化学习算法,直接优化了任务级驾驶指标。

新颖性

ASSCG首次将RWKV用于快慢系统的门控决策,提出了Query/Cache/Drop三分法,解决了现有触发规则过于简单或不准确的问题,显著提升了规划效率和性能。

局限性

  • 在训练中需要依赖于高质量的监督标签,可能限制了方法的通用性。
  • 对于极端复杂的场景,ASSCG的性能可能受限于快慢系统的基础能力。
  • RWKV的表现可能受制于其参数规模和训练数据的多样性。

未来方向

未来可以探索ASSCG在更多快慢系统架构中的适配性,优化其对极端场景的鲁棒性,并结合更多的多模态输入提升决策能力。

AI 总览摘要

自动驾驶的规划模块需要在复杂的动态环境中做出实时决策,而大语言模型(LLM)因其强大的推理能力被引入以提供更高层次的指导。然而,LLM的高计算成本使得其在每帧调用并不现实。现有的快慢系统规划方法通常依赖于手工设计的触发规则,这些规则要么过于频繁调用慢系统,要么在错误的时间调用,导致资源浪费或性能下降。

为了解决这一问题,本文提出了自适应慢系统控制门(ASSCG),通过RWKV骨干网络实现帧级的Query、Cache和Drop决策。ASSCG通过监督微调和计算感知型GRPO强化学习进行训练,并成功应用于两种快慢系统架构:AsyncDriver和基于RecogDrive的双系统。在nuPlan Hard20评估中,ASSCG将AsyncDriver的得分提升至67.28(+2.28),同时推理延迟减少了60%;在NAVSIM上,ASSCG提升了PDMS分数至91.4(+0.6),平均速度提高了25%。

该研究展示了ASSCG在优化快慢系统协作中的潜力,为自动驾驶领域的规划模块设计提供了新思路。然而,ASSCG在极端复杂场景中的表现仍有待进一步优化,未来可以探索其在多模态输入和更多架构中的应用。

深度分析

研究背景

近年来,自动驾驶规划技术取得了显著进展,尤其是在基于学习的规划和标准化基准测试方面。然而,现有的规划器在处理复杂、动态的长尾交互场景时仍然面临困难。与此同时,大语言模型(LLM)因其强大的常识推理和跨领域迁移能力,逐渐被用于自动驾驶决策中。这些模型可以通过指令调优,内化交通规则和场景先验知识,为规划提供更具上下文感知的指导。

核心问题

尽管LLM在推理能力上表现出色,但其推理延迟和计算成本使得在每帧调用变得不切实际。现有的快慢规划系统通常依赖于固定间隔或基于复杂度的触发规则,但这些规则要么忽略了场景的时间变化,要么依赖于不准确的复杂度代理,导致资源浪费或性能下降。

核心创新

本文提出了ASSCG,一种架构无关的自适应门控机制,能够在帧级别动态决定是否调用慢系统。其核心创新包括:

  • �� 引入Query、Cache和Drop三种动作,实现对慢系统的精确调度。
  • �� 使用RWKV骨干网络,支持长时间上下文跟踪和低延迟决策。
  • �� 采用计算感知型GRPO强化学习算法,直接优化任务级驾驶指标。

方法详解

ASSCG的核心方法包括以下步骤:

  • �� 使用Vector Map Encoder提取场景特征,并通过RWKV骨干网络进行时间上下文建模。
  • �� 在每帧生成Query、Cache或Drop动作,分别对应调用慢系统、复用缓存或忽略缓存。
  • �� 通过监督微调初始化门控策略,随后使用计算感知型GRPO算法进行强化学习优化。
  • �� 在快慢系统中集成ASSCG,通过跨注意力机制将慢系统的高层指导与快系统的低层规划结合。

实验设计

实验在nuPlan Hard20和NAVSIM数据集上进行,分别评估ASSCG在AsyncDriver和RecogDrive双系统中的表现。实验设置包括多种固定查询间隔的基线,以及对ASSCG的消融实验。主要评估指标包括规划得分(如nuPlan分数、PDMS)和计算效率(如推理延迟、平均速度)。

结果分析

实验结果表明,ASSCG在nuPlan Hard20上将AsyncDriver的得分提升至67.28(+2.28),推理延迟减少60%。在NAVSIM上,ASSCG提升了RecogDrive的PDMS分数至91.4(+0.6),平均速度提高25%。此外,消融实验验证了RWKV骨干在长时间上下文建模中的优势。

应用场景

ASSCG适用于需要平衡高效性和高性能的自动驾驶场景,尤其是在计算资源有限的情况下。其灵活的门控机制也可扩展至其他需要快慢协作的领域,如机器人控制和工业自动化。

局限与展望

ASSCG的性能依赖于高质量的训练数据和标签,在数据稀缺或质量较低的场景中可能表现受限。此外,其对极端复杂场景的适应性仍需进一步研究。未来可以探索多模态输入和更复杂场景下的表现。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你有一个快速切菜的助手(快系统),它可以快速切菜,但有时会犯错。你还有一个厨师顾问(慢系统),他经验丰富,但需要时间思考。你需要决定什么时候请教厨师顾问,什么时候让助手继续工作。

ASSCG就像一个聪明的厨房经理,它会根据菜肴的复杂程度和时间需求,决定是否需要请教厨师顾问。如果当前的菜肴很简单,ASSCG会让助手继续工作(Cache)。如果需要新的建议,它会叫来厨师顾问(Query)。如果发现厨师的建议可能有误,它会忽略这些建议(Drop)。

通过这种方式,ASSCG帮助厨房更高效地运作,既能保证菜肴的质量,又不会浪费时间和资源。这就像在自动驾驶中,ASSCG帮助快慢系统高效协作,确保车辆既安全又快速地到达目的地。

简单解释 像给14岁少年讲一样

想象你在玩一个赛车游戏,你有两个助手。一个是速度超快的AI,它能快速告诉你怎么转弯,但有时候会出错。另一个是超级聪明的AI,它能给出更好的建议,但需要时间思考。

你不能一直用慢的AI,因为那样会让你的车变得很慢。但如果你只用快的AI,它可能会让你撞车!所以你需要一个聪明的系统来决定什么时候用哪个AI。

ASSCG就是这样的系统!它会观察赛道,决定什么时候用快的AI,什么时候请教慢的AI。如果赛道很简单,它会让快的AI继续工作。如果赛道变得复杂,它会叫来慢的AI帮忙。如果慢的AI的建议可能出错,它会忽略这些建议。

这样,你的赛车既能跑得快,又不会出问题!是不是很酷?

术语表

ASSCG (自适应慢系统控制门)

一种动态门控机制,用于在帧级别决定是否调用慢系统。

在快慢系统协作中优化资源使用和性能。

RWKV (递归加权关键值)

一种轻量级递归网络,用于长时间上下文建模。

作为ASSCG的骨干网络,用于生成门控决策。

Query (查询)

调用慢系统以刷新缓冲区的动作。

在需要新的高层指导时使用。

Cache (缓存)

复用缓冲区中的慢系统指导,而不重新查询。

在Equivalent Interval中避免冗余计算。

Drop (丢弃)

忽略缓冲区内容,防止过时指导影响规划。

在Failure Interval中避免错误干预。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升ASSCG在极端复杂场景中的鲁棒性?
  • 2 如何减少对高质量监督标签的依赖以提升通用性?
  • 3 是否可以将ASSCG扩展至其他多模态快慢系统?

应用场景

近期应用

自动驾驶规划优化

在资源受限的自动驾驶场景中,提升规划效率和性能。

机器人路径规划

应用于机器人领域,实现高效的路径规划和动态调整。

远期愿景

通用智能协作系统

扩展至多模态AI系统,实现更广泛的智能协作。

原文摘要

Large language models (LLMs) can improve autonomous driving planning but are costly to query online, and existing fast-slow planners often rely on hand-designed triggering rules that either over-call the slow system or call it at the wrong times. We formulate slow-system invocation as a resource-aware sequential decision problem and propose the Adaptive Slow-System Control Gate (ASSCG), which makes frame-level Query/Cache/Drop decisions to refresh, reuse, or suppress slow guidance. ASSCG uses an RWKV backbone for efficient long-horizon gating and is trained with supervised fine-tuning followed by GRPO-style compute-aware reinforcement fine-tuning. We apply ASSCG to two different fast-slow architectures: (i) AsyncDriver on nuPlan Hard20 closed-loop evaluation, where ASSCG improves score to 67.28 (+2.28) while reducing average end-to-end inference latency by 60%; and (ii) a RecogDrive-based dual system that we build by replacing its original VLM-2B module with a lightweight ViT-based fast planner and adding an LLM slow planner, evaluated on NAVSIM, where ASSCG achieves 91.4 PDMS (+0.6) and increases average speed by 25%. The project page, including video visualizations and additional results, is available at https://williamxuanyu.github.io/asscg/.

cs.RO cs.CV