核心发现
方法论
ASSCG是一种架构无关的控制门,通过RWKV骨干网络实现帧级Query/Cache/Drop决策,结合监督微调和计算感知型GRPO强化学习优化,适配快慢系统的协作。
关键结果
- 在nuPlan Hard20评估中,ASSCG集成到AsyncDriver后,得分提升至67.28(+2.28),平均推理延迟减少约60%。
- 在NAVSIM上,基于RecogDrive的双系统中,ASSCG实现了91.4的PDMS分数(+0.6),平均速度提升约25%。
- 通过实验验证,ASSCG在多个场景中有效平衡了规划质量与计算资源消耗。
研究意义
该研究解决了当前快慢规划系统中手动触发规则不够精准的问题,通过ASSCG实现了帧级的动态门控决策,显著提升了规划性能和计算效率。这一方法为自动驾驶领域的规划模块提供了新的设计思路,尤其是在资源受限的场景中。
技术贡献
提出了一个基于RWKV的自适应门控机制,能够在部分可观测的环境中进行长时间的上下文跟踪。通过引入Query、Cache和Drop三种动作,优化了快慢系统的协作效率。此外,采用了计算感知型GRPO强化学习算法,直接优化了任务级驾驶指标。
新颖性
ASSCG首次将RWKV用于快慢系统的门控决策,提出了Query/Cache/Drop三分法,解决了现有触发规则过于简单或不准确的问题,显著提升了规划效率和性能。
局限性
- 在训练中需要依赖于高质量的监督标签,可能限制了方法的通用性。
- 对于极端复杂的场景,ASSCG的性能可能受限于快慢系统的基础能力。
- RWKV的表现可能受制于其参数规模和训练数据的多样性。
未来方向
未来可以探索ASSCG在更多快慢系统架构中的适配性,优化其对极端场景的鲁棒性,并结合更多的多模态输入提升决策能力。
AI 总览摘要
自动驾驶的规划模块需要在复杂的动态环境中做出实时决策,而大语言模型(LLM)因其强大的推理能力被引入以提供更高层次的指导。然而,LLM的高计算成本使得其在每帧调用并不现实。现有的快慢系统规划方法通常依赖于手工设计的触发规则,这些规则要么过于频繁调用慢系统,要么在错误的时间调用,导致资源浪费或性能下降。
为了解决这一问题,本文提出了自适应慢系统控制门(ASSCG),通过RWKV骨干网络实现帧级的Query、Cache和Drop决策。ASSCG通过监督微调和计算感知型GRPO强化学习进行训练,并成功应用于两种快慢系统架构:AsyncDriver和基于RecogDrive的双系统。在nuPlan Hard20评估中,ASSCG将AsyncDriver的得分提升至67.28(+2.28),同时推理延迟减少了60%;在NAVSIM上,ASSCG提升了PDMS分数至91.4(+0.6),平均速度提高了25%。
该研究展示了ASSCG在优化快慢系统协作中的潜力,为自动驾驶领域的规划模块设计提供了新思路。然而,ASSCG在极端复杂场景中的表现仍有待进一步优化,未来可以探索其在多模态输入和更多架构中的应用。
深度分析
研究背景
近年来,自动驾驶规划技术取得了显著进展,尤其是在基于学习的规划和标准化基准测试方面。然而,现有的规划器在处理复杂、动态的长尾交互场景时仍然面临困难。与此同时,大语言模型(LLM)因其强大的常识推理和跨领域迁移能力,逐渐被用于自动驾驶决策中。这些模型可以通过指令调优,内化交通规则和场景先验知识,为规划提供更具上下文感知的指导。
核心问题
尽管LLM在推理能力上表现出色,但其推理延迟和计算成本使得在每帧调用变得不切实际。现有的快慢规划系统通常依赖于固定间隔或基于复杂度的触发规则,但这些规则要么忽略了场景的时间变化,要么依赖于不准确的复杂度代理,导致资源浪费或性能下降。
核心创新
本文提出了ASSCG,一种架构无关的自适应门控机制,能够在帧级别动态决定是否调用慢系统。其核心创新包括:
- �� 引入Query、Cache和Drop三种动作,实现对慢系统的精确调度。
- �� 使用RWKV骨干网络,支持长时间上下文跟踪和低延迟决策。
- �� 采用计算感知型GRPO强化学习算法,直接优化任务级驾驶指标。
方法详解
ASSCG的核心方法包括以下步骤:
- �� 使用Vector Map Encoder提取场景特征,并通过RWKV骨干网络进行时间上下文建模。
- �� 在每帧生成Query、Cache或Drop动作,分别对应调用慢系统、复用缓存或忽略缓存。
- �� 通过监督微调初始化门控策略,随后使用计算感知型GRPO算法进行强化学习优化。
- �� 在快慢系统中集成ASSCG,通过跨注意力机制将慢系统的高层指导与快系统的低层规划结合。
实验设计
实验在nuPlan Hard20和NAVSIM数据集上进行,分别评估ASSCG在AsyncDriver和RecogDrive双系统中的表现。实验设置包括多种固定查询间隔的基线,以及对ASSCG的消融实验。主要评估指标包括规划得分(如nuPlan分数、PDMS)和计算效率(如推理延迟、平均速度)。
结果分析
实验结果表明,ASSCG在nuPlan Hard20上将AsyncDriver的得分提升至67.28(+2.28),推理延迟减少60%。在NAVSIM上,ASSCG提升了RecogDrive的PDMS分数至91.4(+0.6),平均速度提高25%。此外,消融实验验证了RWKV骨干在长时间上下文建模中的优势。
应用场景
ASSCG适用于需要平衡高效性和高性能的自动驾驶场景,尤其是在计算资源有限的情况下。其灵活的门控机制也可扩展至其他需要快慢协作的领域,如机器人控制和工业自动化。
局限与展望
ASSCG的性能依赖于高质量的训练数据和标签,在数据稀缺或质量较低的场景中可能表现受限。此外,其对极端复杂场景的适应性仍需进一步研究。未来可以探索多模态输入和更复杂场景下的表现。
通俗解读 非专业人士也能看懂
想象你在厨房里做饭。你有一个快速切菜的助手(快系统),它可以快速切菜,但有时会犯错。你还有一个厨师顾问(慢系统),他经验丰富,但需要时间思考。你需要决定什么时候请教厨师顾问,什么时候让助手继续工作。
ASSCG就像一个聪明的厨房经理,它会根据菜肴的复杂程度和时间需求,决定是否需要请教厨师顾问。如果当前的菜肴很简单,ASSCG会让助手继续工作(Cache)。如果需要新的建议,它会叫来厨师顾问(Query)。如果发现厨师的建议可能有误,它会忽略这些建议(Drop)。
通过这种方式,ASSCG帮助厨房更高效地运作,既能保证菜肴的质量,又不会浪费时间和资源。这就像在自动驾驶中,ASSCG帮助快慢系统高效协作,确保车辆既安全又快速地到达目的地。
简单解释 像给14岁少年讲一样
想象你在玩一个赛车游戏,你有两个助手。一个是速度超快的AI,它能快速告诉你怎么转弯,但有时候会出错。另一个是超级聪明的AI,它能给出更好的建议,但需要时间思考。
你不能一直用慢的AI,因为那样会让你的车变得很慢。但如果你只用快的AI,它可能会让你撞车!所以你需要一个聪明的系统来决定什么时候用哪个AI。
ASSCG就是这样的系统!它会观察赛道,决定什么时候用快的AI,什么时候请教慢的AI。如果赛道很简单,它会让快的AI继续工作。如果赛道变得复杂,它会叫来慢的AI帮忙。如果慢的AI的建议可能出错,它会忽略这些建议。
这样,你的赛车既能跑得快,又不会出问题!是不是很酷?
术语表
ASSCG (自适应慢系统控制门)
一种动态门控机制,用于在帧级别决定是否调用慢系统。
在快慢系统协作中优化资源使用和性能。
RWKV (递归加权关键值)
一种轻量级递归网络,用于长时间上下文建模。
作为ASSCG的骨干网络,用于生成门控决策。
Query (查询)
调用慢系统以刷新缓冲区的动作。
在需要新的高层指导时使用。
Cache (缓存)
复用缓冲区中的慢系统指导,而不重新查询。
在Equivalent Interval中避免冗余计算。
Drop (丢弃)
忽略缓冲区内容,防止过时指导影响规划。
在Failure Interval中避免错误干预。
开放问题 这项研究留下的未解疑问
- 1 如何进一步提升ASSCG在极端复杂场景中的鲁棒性?
- 2 如何减少对高质量监督标签的依赖以提升通用性?
- 3 是否可以将ASSCG扩展至其他多模态快慢系统?
应用场景
近期应用
自动驾驶规划优化
在资源受限的自动驾驶场景中,提升规划效率和性能。
机器人路径规划
应用于机器人领域,实现高效的路径规划和动态调整。
远期愿景
通用智能协作系统
扩展至多模态AI系统,实现更广泛的智能协作。
原文摘要
Large language models (LLMs) can improve autonomous driving planning but are costly to query online, and existing fast-slow planners often rely on hand-designed triggering rules that either over-call the slow system or call it at the wrong times. We formulate slow-system invocation as a resource-aware sequential decision problem and propose the Adaptive Slow-System Control Gate (ASSCG), which makes frame-level Query/Cache/Drop decisions to refresh, reuse, or suppress slow guidance. ASSCG uses an RWKV backbone for efficient long-horizon gating and is trained with supervised fine-tuning followed by GRPO-style compute-aware reinforcement fine-tuning. We apply ASSCG to two different fast-slow architectures: (i) AsyncDriver on nuPlan Hard20 closed-loop evaluation, where ASSCG improves score to 67.28 (+2.28) while reducing average end-to-end inference latency by 60%; and (ii) a RecogDrive-based dual system that we build by replacing its original VLM-2B module with a lightweight ViT-based fast planner and adding an LLM slow planner, evaluated on NAVSIM, where ASSCG achieves 91.4 PDMS (+0.6) and increases average speed by 25%. The project page, including video visualizations and additional results, is available at https://williamxuanyu.github.io/asscg/.