PerceptDrive: Perception Prior World-Action Modeling with Adaptive Expert Routing for End-to-End Autonomous Driving

TL;DR

提出PerceptDrive,通过自适应专家路由融合感知先验,实现端到端自主驾驶,达90.4 PDMS。

cs.CV 🔴 高级 2026-07-22 37 次浏览
Yushan Liu Tianxiong Lv Bohua Wang Hangqi Fan Chenxu Zhao He Zheng Xuchang Zhong Yifan Xie Congyang Zhao Zhihao Liao Leigang Luo Yang Cai Xiao-Ping Zhang Wenbo Ding
自主驾驶 感知模型 专家路由 端到端学习 世界动作模型

核心发现

方法论

PerceptDrive利用冻结的感知提供者(基于VGGT、V-JEPA和Wan模型)提取几何、语义和动态先验,并结合密集观察潜在特征。训练中,专家分支通过保持目标(Lret)与先验对齐,利用软门控(gr)根据场景表示动态融合专家条件。核心机制包括:• 通过查询银行压缩感知特征;• 采用专家特定的留存目标保持信息;• 利用场景条件的门控调节专家贡献;• 训练中引入软门控蒸馏,确保推理时单轨生成。模型结合未来潜在条件和流匹配(flow-matching)策略,输出轨迹。

关键结果

  • 在NAVSIM v1中,PerceptDrive实现90.4 PDMS,在NAVSIM v2中达90.2 EPDMS,显著优于现有方法(如DriveWAM 90.1、DriveDreamer 89.2)。在无候选排序或搜索的单摄像头场景中表现出色,稳定性良好(标准差<0.05)。
  • 消融实验验证:保持先验(prior retention)和场景条件路由(scene-conditioned routing)带来互补性能提升,模型对几何、语义和动态先验的依赖不同,体现多源信息的有效融合。
  • 模型无需测试时候的候选排序或重排,直接生成轨迹,简化推理流程,提升实时性和鲁棒性。

研究意义

该研究突破了感知先验在端到端自主驾驶中的融合瓶颈,通过引入自适应专家路由机制,有效保持源信息的多样性与场景适应性。相比传统静态融合或单一条件模型,PerceptDrive在保持信息完整性的同时,提升了轨迹预测的准确性和鲁棒性。其无需候选排序、重排,极大简化了推理流程,为未来高效、安全的自动驾驶系统提供了新思路。该框架不仅丰富了感知与决策的交互机制,也为多源知识融合提供了理论基础,推动自主驾驶向更智能、更可靠的方向发展。

技术贡献

本文提出基于冻结感知模型的多专家路由机制,将几何、语义、动态先验作为专家分支的条件,通过留存目标(Lret)保持信息完整性,并利用场景条件的软门控(gr)动态调节专家贡献。创新点在于:• 设计了场景条件下的专家路由策略,实现信息的自适应融合;• 引入软门控蒸馏机制,将训练中专家分支的优质轨迹草稿作为软目标,确保推理时单轨输出;• 结合未来潜在条件和流匹配策略,提升轨迹预测的连续性和鲁棒性。该方法在无需测试时候候选排序的情况下,达到了最优性能,显著优于现有端到端方法。

新颖性

本研究首次提出基于自适应专家路由的感知先验融合框架,将冻结的多源感知模型与场景条件结合,突破了静态融合和单一条件的限制。不同于传统的专家路由仅在模型参数层面调节,本方法在推理阶段实现了场景依赖的动态调节,确保每个场景都能获得最优的先验信息利用。这一创新显著提升了端到端自主驾驶的表现,特别是在复杂交通环境中的适应性和鲁棒性方面表现优异。

局限性

  • 模型依赖大量预训练的感知模型,训练成本较高,且对感知模型的性能高度敏感,若感知模型出现偏差,可能影响整体表现。
  • 在极端复杂或未见过的场景中,场景条件路由可能不足以充分调节专家贡献,导致性能下降。
  • 推理过程中未考虑多轨迹生成或候选排序,可能在多目标或多路径场景中表现有限,未来需引入多轨迹预测机制。

未来方向

未来可结合多轨迹生成策略,增强多目标场景的适应性;探索更高效的感知模型压缩与融合机制,降低训练成本;引入强化学习或在线适应机制,提升模型在未见场景中的泛化能力。还可结合多模态信息(如激光雷达、地图数据)进一步丰富感知先验,推动自主驾驶系统的智能化与安全性提升。

AI 总览摘要

自动驾驶技术的快速发展带来了对高效、鲁棒感知与决策融合的迫切需求。传统方法多依赖静态融合或单一条件模型,难以兼顾多源信息的完整性与场景适应性。本文提出的PerceptDrive框架,通过引入自适应专家路由机制,有效融合几何、语义和动态感知先验,显著提升轨迹预测性能。在训练阶段,模型利用场景条件动态调节专家贡献,保持源信息的完整性,并通过软门控蒸馏确保推理时单轨输出。实验结果显示,该方法在NAVSIM v1和v2数据集上均超越现有最优,达到了90.4和90.2的PDMS指标,验证了其优越性。该框架简化了推理流程,无需候选排序或重排,极大提升了实时性和鲁棒性。未来,结合多轨迹预测与多模态感知,有望推动自主驾驶系统迈向更智能、更安全的方向。

深度分析

研究背景

自主驾驶技术经历了从基于规则的模块化到端到端深度学习的演变。早期方法依赖手工设计的感知、规划与控制模块,存在信息传递瓶颈。近年来,深度学习模型如VLM(Vision-Language Models)和世界模型(World Models)推动了感知与决策的融合,例如DriveVLA、Law、DriveDreamer等。这些方法在提升感知理解能力的同时,也带来了多源信息融合的挑战。传统静态融合方法难以适应复杂场景变化,而多专家路由和动态调节机制逐渐成为研究热点。尽管如此,如何在保持信息完整性的基础上,实现场景依赖的高效融合,仍是当前的核心难题。

核心问题

核心问题在于如何在端到端规划中,有效融合多源感知先验,既保持源信息的完整性,又能根据场景动态调节专家贡献。现有方法多采用静态融合或在模型参数层面调节,难以实现场景依赖的动态调控,导致信息丢失或融合不充分。这限制了模型在复杂交通环境中的表现,影响了自主驾驶的安全性和鲁棒性。解决这一问题需要设计一种机制,既能在训练中保持先验信息,又能在推理中实现场景适应。

核心创新

创新点包括:1)引入场景条件下的软门控专家路由(scene-conditioned routing),动态调节几何、语义、动态先验的贡献;2)设计专家特定的留存目标(Lret),保持源信息的完整性,避免信息崩溃;3)结合未来潜在条件和流匹配策略,提升轨迹连续性和鲁棒性。这些机制突破了静态融合的限制,实现了多源信息的高效融合与场景适应,显著优于传统的静态加权或单一条件模型。

方法详解

  • �� 构建冻结的感知提供者:利用VGGT、V-JEPA和Wan模型提取几何、语义、动态先验,结合密集观察潜在特征。
  • �� 设计专家分支:每个专家对应一种先验,利用留存目标(Lret)保持信息,利用查询银行压缩特征。
  • �� 场景条件调节:通过场景表示(st)预测软门控(gr),动态调节专家贡献,融合专家条件。
  • �� 训练过程:引入软门控蒸馏,将训练中优质轨迹草稿作为目标,确保推理时单轨输出。
  • �� 轨迹生成:结合未来潜在条件和流匹配策略,利用动作预测头和流模型,输出轨迹。

实验设计

在NAVSIM v1和v2数据集上,模型采用离线感知模型和多教师蒸馏,训练目标包括轨迹拟合、门控蒸馏和未来潜在预测。评估指标为PDMS和EPDMS,模型对不同场景表现稳定。消融实验验证专家留存和场景条件调节的贡献,模型在复杂交通环境中表现优越,且无需候选排序,推理快速。

结果分析

在NAVSIM v1中,达90.4 PDMS,优于DriveWAM(90.1)和DriveDreamer(89.2);NAVSIM v2中,EPDMS达90.2,优于所有对比方法。消融实验显示专家留存和场景调节互补提升性能。模型在极端场景(navhard)中也表现出色(EPDMS 34.5),验证其鲁棒性。

应用场景

可应用于自动驾驶中的路径规划,尤其适合单摄像头场景,简化推理流程,提升实时性。未来可结合多轨迹预测、多模态感知,增强复杂环境中的适应能力,推动自动驾驶的安全性和效率。

局限与展望

模型依赖大量预训练感知模型,训练成本高,感知偏差可能影响整体性能。在极端或未见场景中,场景条件调节可能不足,需引入多轨迹或在线适应机制。推理中未考虑多路径,未来需优化多目标处理能力。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,厨房里有很多不同的工具和食材,比如刀、锅、蔬菜、调料。每个工具和食材都代表一种信息,比如刀代表切割技巧,蔬菜代表环境信息。现在,你需要根据不同的菜谱(场景)灵活使用这些工具和食材。传统的方法就像用同一种调料,不管菜谱怎么变都用一样的调料,效果不够好。这个新方法像厨师能根据菜谱自动调节用料比例,灵活搭配不同的工具,做出更美味的菜。它通过学习不同的厨艺技巧(专家),在每个菜谱(场景)中选择最合适的搭配,确保每次都能做出满意的菜肴。这就像在复杂的交通环境中,系统能根据不同的场景,灵活调节感知信息的利用,保证行车安全和效率。

简单解释 像给14岁少年讲一样

想象你在玩一款超级复杂的游戏,你要控制一个角色穿越各种不同的场景,比如城市、森林或沙漠。每个场景都有不同的挑战,比如交通、动物或沙尘暴。以前的方法就像用同一种策略应对所有场景,不管遇到什么都用一样的技能,结果可能不太好。现在,这个新系统像你的游戏助手,能根据场景自动选择最合适的技能和工具,比如在城市用车、在森林用弓箭。它通过学习各种场景的特点,把不同的“技能”存储在不同的“专家”里,然后根据当前场景,智能调节用哪个“专家”的技能。这样,角色就能更聪明、更快地应对各种挑战,保证顺利完成任务。这就像在交通自动驾驶中,系统能根据不同的路况,灵活调节感知信息的利用,确保行车安全和顺畅。

术语表

感知先验 (Perception Priors)

预先训练的模型提供几何、语义和动态信息,用于辅助决策。技术上指利用预训练模型提取的场景知识。

在本文中,感知先验作为专家分支的条件输入,用于轨迹预测。

专家路由 (Expert Routing)

根据场景动态调节不同专家条件的贡献,通过软门控实现信息融合。技术上是利用场景表示预测门控权重。

用于自适应融合几何、语义、动态先验。

留存目标 (Retention Objective)

保持每个专家分支的源信息完整,防止信息崩溃。通过重建目标实现。

确保专家分支能保持源信息的多样性。

流匹配 (Flow-Matching)

一种轨迹生成策略,通过匹配未来潜在的流式特征,连续预测路径。技术上结合潜在条件和动作。

用于轨迹生成,提升连续性和鲁棒性。

软门控蒸馏 (Soft-Gate Distillation)

在训练中利用优质轨迹草稿作为软目标,蒸馏门控信息,确保推理时单轨输出。

提升模型推理效率和性能。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂或未见过的场景中,保持专家路由的鲁棒性和适应性仍是挑战,未来需结合在线学习或多轨迹预测机制。

应用场景

近期应用

单摄像头路径规划

在自动驾驶中,利用单前视摄像头实现高精度轨迹预测,无需复杂候选排序,提升实时性和安全性。

远期愿景

多模态感知融合

结合激光雷达、高清地图等多源信息,增强感知先验的丰富性与鲁棒性,推动自动驾驶系统的智能化。

原文摘要

Frozen perception foundation models encode rich geometric, semantic, and dynamic knowledge. Yet narrow conditioning interfaces may attenuate task-relevant cues, while static fusion cannot adjust expert contributions to each scene. We cast this challenge as the prior-to-plan transfer problem and introduce PerceptDrive, a perception prior world-action modeling framework with adaptive expert routing. PerceptDrive feeds teacher-distilled priors from a frozen, driving-adapted provider and dense observation latents from a frozen self-supervised video encoder into a trainable expert-routed world-action model. Expert-specific query branches process these signals, while a prior-retention objective anchors each branch to its prior. A router predicts soft gates from a shared scene representation and combines the expert conditions before trajectory generation. During training, privileged rule-based sub-metric estimates for branch-specific trajectory drafts provide soft-gate distillation targets. The predicted action-free future latent conditions a flow-matching actor. At inference, privileged components are absent; with one front-facing camera, PerceptDrive generates one trajectory per planning step without test-time scoring, reranking, or search. Experiments show that PerceptDrive achieves state-of-the-art performance with 90.4 PDMS on NAVSIM v1 and 90.2 EPDMS on NAVSIM v2, outperforming existing methods. Ablations confirm complementary gains from prior retention and scene-conditioned routing, alongside differential reliance on the three priors. These results demonstrate that preserving and adaptively routing perception priors improves direct planning without test-time candidate selection.

cs.CV