NoRD: A Data-Efficient Vision-Language-Action Model that Drives without Reasoning

TL;DR

NoRD模型在Waymo和NAVSIM上实现了高效的视觉-语言-动作学习,仅使用60%数据,无需推理。

cs.AI 🔴 高级 2026-02-25 3 次浏览
Ishaan Rawal Shubh Gupta Yihan Hu Wei Zhan
自动驾驶 视觉语言模型 数据效率 强化学习 算法优化

核心发现

方法论

NoRD采用了一种无需推理的视觉-语言-动作模型,通过Dr. GRPO算法优化,减少了数据需求。模型首先在有限数据上进行监督微调,然后通过Dr. GRPO进行强化学习后训练,克服了传统GRPO在高方差样本上的优化困难。

关键结果

  • 在Waymo数据集上,NoRD在使用不到12,000个样本的情况下,取得了7.709的RFS评分,表现优于大多数需要推理的模型。
  • 在NAVSIM数据集上,NoRD在使用不到90,000个样本的情况下,达到了85.6的PDM评分,接近于最先进的模型。
  • 通过Dr. GRPO优化,NoRD在高方差样本上实现了11.68%的性能提升。

研究意义

NoRD显著降低了自动驾驶模型对大规模数据和推理标注的依赖,提升了数据效率。这一研究为自动驾驶领域提供了一种更为经济高效的解决方案,尤其在数据获取困难的场景下,具有重要的应用价值。

技术贡献

NoRD通过引入Dr. GRPO算法,解决了传统GRPO在高方差样本上的优化难题,实现了无需推理的高效学习。该方法在减少数据需求的同时,保持了与最先进模型相当的性能。

新颖性

NoRD首次在无需推理的情况下实现了与推理模型相当的性能,通过Dr. GRPO算法有效地优化了弱SFT策略,突破了传统方法的局限。

局限性

  • NoRD在极端驾驶场景下的表现仍需进一步验证,特别是在数据极度稀缺的情况下。
  • 模型在训练过程中仍需大量计算资源,可能限制其在资源有限环境中的应用。

未来方向

未来的研究可以探索在更复杂的驾驶场景中应用NoRD,并优化其在资源受限环境中的表现。此外,进一步减少训练数据需求也是一个重要方向。

AI 总览摘要

NoRD模型通过引入Dr. GRPO算法,解决了传统视觉-语言-动作模型对大规模数据和推理标注的依赖问题。该模型在Waymo和NAVSIM数据集上表现出色,使用的数据量仅为传统方法的60%。

NoRD的核心技术在于其数据效率和无需推理的设计。通过在有限数据上进行监督微调,然后使用Dr. GRPO进行强化学习后训练,NoRD克服了传统GRPO在高方差样本上的优化困难。

实验结果显示,NoRD在Waymo数据集上取得了7.709的RFS评分,在NAVSIM数据集上达到了85.6的PDM评分,均接近于最先进的推理模型。这表明NoRD在数据效率和性能之间实现了良好的平衡。

深度分析

研究背景

视觉-语言-动作模型在自动驾驶领域取得了显著进展,但其对大规模数据和推理标注的依赖限制了其应用。传统方法如AutoVLA和RecogDrive需要大量的数据和推理标注来实现高性能。

核心问题

现有的视觉-语言-动作模型在数据和推理标注上的高需求导致了高昂的成本和复杂的训练过程。这限制了其在资源有限环境中的应用。

核心创新

NoRD通过引入Dr. GRPO算法,减少了数据需求并消除了对推理标注的依赖。与传统方法相比,NoRD在数据效率和性能上实现了突破。

方法详解

  • �� 使用有限数据进行监督微调
  • �� 采用Dr. GRPO进行强化学习后训练
  • �� 通过k-disc tokenization提高数据效率
  • �� 在Waymo和NAVSIM数据集上进行测试

实验设计

实验在Waymo和NAVSIM数据集上进行,评估指标包括RFS和PDM评分。使用的基线模型包括AutoVLA和RecogDrive。

结果分析

NoRD在Waymo数据集上取得了7.709的RFS评分,在NAVSIM数据集上达到了85.6的PDM评分,均接近于最先进的推理模型。

应用场景

NoRD可用于自动驾驶系统,特别是在数据获取困难的场景中。其高效的数据使用和无需推理的设计使其在资源有限的环境中具有优势。

局限与展望

NoRD在极端驾驶场景下的表现仍需进一步验证,特别是在数据极度稀缺的情况下。未来的研究可以探索在更复杂的驾驶场景中应用NoRD。

通俗解读 非专业人士也能看懂

想象一个工厂,传统的自动驾驶模型就像需要大量原材料和复杂工序的生产线,而NoRD则像一个高效的自动化车间,只需少量原料就能生产出高质量的产品。通过减少对数据和推理的依赖,NoRD实现了更高的生产效率。

简单解释 像给14岁少年讲一样

想象你在玩一个赛车游戏,传统的自动驾驶模型就像需要大量金币和复杂操作的赛车,而NoRD则像一个省钱又简单操作的赛车,只需少量金币就能赢得比赛。NoRD通过减少对数据和推理的依赖,实现了更高的效率和性能。

术语表

视觉-语言-动作模型 (Vision-Language-Action Model)

一种结合视觉、语言和动作信息的模型,用于自动驾驶等复杂任务。

在NoRD中用于实现高效的自动驾驶。

Dr. GRPO

一种优化算法,用于解决传统GRPO在高方差样本上的优化困难。

在NoRD中用于强化学习后训练。

PDM评分 (PDM Score)

一种评估自动驾驶模型性能的指标,考虑了安全性、舒适性等因素。

用于评估NoRD在NAVSIM数据集上的表现。

RFS评分 (Rated Feedback Score)

一种评估自动驾驶模型在Waymo数据集上性能的指标。

用于评估NoRD在Waymo数据集上的表现。

k-disc tokenization

一种提高数据效率的技术,通过将轨迹分段并聚类来减少数据量。

在NoRD中用于提高数据效率。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端驾驶场景中进一步提高NoRD的性能?现有方法在数据极度稀缺的情况下表现不佳。
  • 2 如何在资源有限的环境中进一步优化NoRD的计算效率?

应用场景

近期应用

自动驾驶系统

NoRD可用于自动驾驶系统,特别是在数据获取困难的场景中。其高效的数据使用和无需推理的设计使其在资源有限的环境中具有优势。

远期愿景

智能交通系统

NoRD的高效设计可用于构建更智能的交通系统,减少交通事故,提高交通效率。

原文摘要

Vision-Language-Action (VLA) models are advancing autonomous driving by replacing modular pipelines with unified end-to-end architectures. However, current VLAs face two expensive requirements: (1) massive dataset collection, and (2) dense reasoning annotations. In this work, we address both challenges with NORD (No Reasoning for Driving). Compared to existing VLAs, NORD achieves competitive performance while being fine-tuned on <60% of the data and no reasoning annotations, resulting in 3x fewer tokens. We identify that standard Group Relative Policy Optimization (GRPO) fails to yield significant improvements when applied to policies trained on such small, reasoning-free datasets. We show that this limitation stems from difficulty bias, which disproportionately penalizes reward signals from scenarios that produce high-variance rollouts within GRPO. NORD overcomes this by incorporating Dr. GRPO, a recent algorithm designed to mitigate difficulty bias in LLMs. As a result, NORD achieves competitive performance on Waymo and NAVSIM with a fraction of the training data and no reasoning overhead, enabling more efficient autonomous systems. Website: https://nord-vla-ai.github.io/

cs.AI cs.CV