ARTEMIS: Autoregressive End-to-End Trajectory Planning with Mixture of Experts for Autonomous Driving
ARTEMIS用自回归+MoE在NAVSIM上达87.0 PDMS、83.1 EPDMS。
核心发现
方法论
ARTEMIS把自动驾驶建模为序列生成:先用Transfuser+ResNet-34把8视角相机和LiDAR融合为BEV特征,再以自回归方式逐点生成8个未来轨迹点。规划模块引入MoE,采用1个共享专家+5个专门专家、top-k=2路由,并用batch reallocation按激活专家重排样本,提升训练效率。随后用语义运动优化与跨注意力细化轨迹,并以L1+NLL联合训练。
关键结果
- 在NAVSIM的navtest上,ARTEMIS(ResNet-34)取得87.0 PDMS;在IL-based方法中表现最强之一,并在EP、NC、C等关键项上很稳健。
- 在扩展指标下达到83.1 EPDMS,优于Hydra-MDP++的80.6;具体为NC 98.3、DAC 95.1、EP 81.5、TTC 97.4、C 100、TL 99.8、DDC 98.6、LK 96.5、EC 98.3。
- 与Transfuser 84.0 PDMS、Hydra-MDP++ 86.6 PDMS相比,ARTEMIS提升明显;但PDMS整体仍低于DiffusionDrive的88.1,说明其优势更集中在更强的序列建模与扩展评测鲁棒性。
研究意义
这项工作把MoE首次系统引入端到端自动驾驶规划,并证明“逐点生成+专家分流”能处理驾驶中的多模态与歧义。它回应了两类长期痛点:一是单次输出难以追踪环境变化,二是单网络很难覆盖不同场景的策略差异。对研究界,它把LLM中成熟的MoE思想迁移到驾驶;对工业界,它提供了更可扩展的规划架构。
技术贡献
技术上,ARTEMIS的关键贡献不只是“更深的网络”,而是把规划过程改写为条件自回归概率分解 p(Y|S)=∏p(y_t|y_{<t},S),并让MoE在每一步做场景自适应路由。其MoE采用共享专家+私有专家结构,结合top-k稀疏激活与batch reallocation,兼顾容量与效率。再加上语义运动优化和cross-attention refinement,形成从感知到轨迹的闭环细化链路。
新颖性
新颖性在于:作者明确宣称这是首个把MoE用于端到端自动驾驶规划的工作。不同于anchor-based、diffusion-based的“一次性”生成,ARTEMIS用自回归逐点决策保留时间依赖;不同于单网络端到端,它允许不同专家专门处理直行、左转、环岛、进出匝道等模式,减少“错误指令牵引”带来的轨迹退化。
局限性
- 模型依赖NAVSIM场景与其评测协议,训练集仅1192个场景,虽然困难但规模仍有限,泛化到更大城市域或长尾极端天气仍未被直接证明。
- MoE带来更高的系统复杂度:虽然作者用batch reallocation加速训练,但路由、重排、专家融合仍增加实现难度,且推理时的实际延迟和车载部署成本文中未充分展开。
- 论文未采用expert balance loss,虽有利于保留专家专长,但也可能带来路由偏置和专家利用不均的问题,需要更系统的消融与稳定性分析。
未来方向
未来可从三方面推进:一是把MoE与更强世界模型结合,让专家不仅看当前BEV,也能显式建模交互动态;二是在更大规模、多城市、多天气数据上验证跨域泛化;三是研究轻量化路由、专家裁剪与在线推理优化,使其更接近量产车算力约束。
AI 总览摘要
ARTEMIS试图解决一个老问题:自动驾驶不只是“看见路”,更要“边看边想、一步一步地决定怎么走”。传统模块化系统会在感知、预测、规划之间层层传递误差;许多端到端模型虽然省去了中间环节,却常把整条轨迹一次性输出,像是闭着眼把整段路先画完,难以及时反映环境变化。作者把这件事重新表述为一个条件序列生成问题,并引入自回归规划,让每个未来点都建立在前一个点之上。
系统的核心由三部分组成:Transfuser式感知模块把8路相机和LiDAR融成BEV特征;自回归规划模块用1个共享专家和5个专门专家做MoE路由,top-k=2,并通过batch reallocation把激活相同专家的样本重新分组以提升训练效率;最后,轨迹细化模块再用语义运动优化和跨注意力把初始轨迹抛光,尽量满足平滑、可行驶区域和运动学约束。其形式化目标可写成 p(Y|S)=∏_t p(y_t|y_{<t},S),这使轨迹不再是静态图,而是连续决策的结果。
在NAVSIM上,ARTEMIS用ResNet-34骨干取得87.0 PDMS、83.1 EPDMS:在扩展指标里,NC 98.3、DAC 95.1、EP 81.5、TTC 97.4、LK 96.5、EC 98.3,说明它不只“能开”,而且更稳、更像人。更重要的是,它在左转、直行、环岛、车道进入等场景中,能把不同专家的偏好显式分开,再由路由器融合出更合理的轨迹。这让MoE从大语言模型中的“算力分流器”,变成了驾驶中的“策略分诊台”。
深度分析
研究背景
自动驾驶长期沿着两条路线演进:模块化方案把感知、预测、规划拆开,便于解释却容易累积误差;端到端方案直接从传感器到轨迹,减少接口损失,但早期多为一次性输出,难以跟随动态交通变化。近年来,Transfuser、UniAD、VADv2、Hydra-MDP、DiffusionDrive等工作分别从多模态融合、统一建模、anchor规划和扩散生成切入,推进了端到端驾驶的性能边界。ARTEMIS站在这些进展之上,试图把“序列性”和“多专家专长”合并起来,补上静态生成范式的短板。
核心问题
核心问题是:如何在端到端框架中同时处理时序依赖、场景多样性和驾驶行为多模态。一次性预测往往把所有未来点平铺展开,容易忽略前后点之间的强耦合;单网络则会在直行、转弯、环岛、并线等不同策略之间“平均化”,导致模糊指令下轨迹质量下降。论文还指出,navtrain中控制指令分布明显不均,且存在少量指令与真实专家轨迹不一致的样本,因此仅按显式命令路由会伤害专家学习。
核心创新
ARTEMIS的创新可以概括为三层。第一,把规划改成自回归生成:用历史轨迹、当前ego状态和时间步嵌入逐点生成 waypoint,保留因果顺序。第二,把MoE引入驾驶规划:1个共享专家负责通用知识,5个私有专家负责场景特化,top-k=2稀疏激活让模型在容量和效率间折中。第三,把训练效率问题显式处理:batch reallocation根据专家激活模式重排样本,把同专家样本聚在一起,减少无效计算。最后再用语义运动优化与cross-attention refinement把轨迹从“能生成”提升到“更可执行”。
方法详解
- �� 感知输入:使用8视角相机与LiDAR,前视图像和点云经Transfuser风格双分支编码,ResNet-34提取视觉特征,再融合成BEV表示F_bev。
- �� 自回归状态:只编码当前ego state s0(控制命令、2D速度、加速度),避免直接依赖历史ego轨迹引发causal confusion。
- �� 时间建模:对未来第t步加入时间嵌入T E_t;位置嵌入P E_t只在初始化时加入一次,避免重复注入噪声。
- �� 规划生成:把T E_t、Q_s和历史规划查询拼接为C_t,送入带padding mask的Transformer编码器,再进入MoEBlock得到Q_{t+1}。
- �� MoE路由:router网络R为两层MLP,先降维再输出专家分数;每步选top-k=2专家,按索引排序并重组batch。
- �� Batch reallocation:用π_i重排F_bev与Q_t,依据连续相同专家索引形成块{E^i_j,n^i_j},再分别经共享专家E_shared和私有专家E_private处理,最后逆排序并按g_ij加权融合。
- �� 概率轨迹:每个时刻由多层MLP预测(y,x,heading)分布参数,采样 y_t ~ N(μ_t,σ_t^2),形成初始4秒、2Hz轨迹。
- �� 轨迹细化:先做semantic kinematic optimization,使用BEV语义图、GRU轨迹编码和可学习约束权重;再用级联cross-attention融合agent query与ego query。
- �� 训练:两阶段训练,先训感知与辅助任务,再端到端联合优化;损失为L_perception=λ_semL_sem+λ_classL_class+λ_boxL_box,L_planning=λ_trajL_traj+λ_NLLL_NLL+L_perception。
实验设计
实验在NAVSIM上进行。该数据集从OpenScene中筛出更困难场景,训练集1192个场景、测试集136个场景。每个样本含8视角相机、5个LiDAR融合数据、地图标注和3D框;模型使用4帧、2秒历史与当前信息,预测4秒、8个未来点。评测采用PDMS及EPDMS。实现上,感知网络用Transfuser+ResNet-34,MoE设5个私有专家和1个共享专家,top-k=2,batch size 128,A100×2,初始学习率2e-4,weight decay 1e-4。损失权重在两阶段分别设置为(10,10,5)与(1,1,0.5,15,0.2)。
结果分析
主结果表明ARTEMIS具有很强竞争力。原始指标上,它在navtest获得87.0 PDMS,NC 98.3、DAC 95.1、EP 81.4、TTC 94.3、C 100;相较Transfuser的84.0和Hydra-MDP++的86.6有明显提升。扩展指标上,ARTEMIS达到83.1 EPDMS,超过Hydra-MDP++的80.6,并在TTC 97.4、LK 96.5、EC 98.3等维度表现突出。需要注意,DiffusionDrive在原始PDMS上为88.1,说明ARTEMIS并非绝对最高,但它在同类IL-based框架中表现非常强,且对复杂场景更稳健。作者的可视化显示,不同专家会偏向直行、右转、环岛等不同策略,路由融合能选出更合理的轨迹。
应用场景
- �� 车载规划模块:可嵌入乘用车或Robotaxi系统,利用自回归方式逐步修正轨迹,对路口和多策略场景更友好。
- �� 研究基线平台:适合用于比较自回归、MoE、扩散式规划的优劣,帮助团队做模块化到端到端的迁移。
局限与展望
- �� 长尾与域外场景:雪天、强遮挡、极端交通参与者行为是否仍稳定,仍需更大规模验证。
- �� 端侧部署:MoE路由、样本重排和多专家推理的真实延迟、显存占用与功耗开销还需工程化压缩。
通俗解读 非专业人士也能看懂
把自动驾驶想成一个外卖小哥送餐。老式做法像是先把“找路”“看路”“决定左转还是直走”分给三个人,三个人之间不停传纸条;纸条一多,就容易抄错地址。另一种做法是让一个人一下子把整张路线图画完,但天气、红绿灯、前车动作一变,他画好的图就可能不合适了。
ARTEMIS更像一个会边骑边想的外卖小哥:先看眼前这一小段路,再决定下一步怎么走,走完一步再决定下一步。更聪明的是,它不是把所有活都交给同一个人,而是配了几位“特长不同的同事”——有的擅长直行,有的擅长转弯,有的擅长复杂路口。遇到不同情况,系统会把任务交给最合适的人。
这样做的好处是,路线更连贯,也更能应付复杂情况。论文里它在NAVSIM上拿到87.0 PDMS和83.1 EPDMS,说明既能开得稳,也能在更严格的考核里保持好表现。简单说,ARTEMIS不是一次性“画完整条路”,而是“边看边走边改”,还会让最擅长的人来处理最难的片段。
简单解释 像给14岁少年讲一样
想象你在玩一款超真实的赛车游戏。普通AI有点像“我先把整圈怎么跑一次想完”,然后直接一口气冲出去。可问题是,前面突然来辆车、路口红灯变了、旁边车道堵了,它就会有点懵。ARTEMIS不一样,它像那种边开边观察、每过一小段再决定下一步的高手玩家!
更酷的是,它不是一个“万能选手”包打天下,而是请来了几位专长不同的队友:有的擅长直行,有的擅长左转,有的特别会过环岛。系统会先看看现在是什么情况,再把任务分给最合适的队友。这样就像游戏里不同角色各司其职,效率更高,翻车更少。
论文里它在NAVSIM测试里拿到87.0 PDMS、83.1 EPDMS,说明成绩很能打。尤其在复杂路口、环岛、进出车道这些容易“脑子打结”的地方,它的表现更稳。你可以把它理解成:不是一次性写好整篇作文,而是每写一句都看一下题目和上下文,所以更不容易跑偏。
所以,ARTEMIS厉害的点不是“更会猜”,而是“更会边想边改”!这对自动驾驶特别重要,因为真实道路根本不会老老实实按剧本演,对吧?
术语表
Autoregressive Trajectory Planning(自回归轨迹规划)
一种逐步生成未来轨迹点的方法,当前点依赖前面已经生成的点和当前环境。技术上对应条件概率分解 p(Y|S)=∏_t p(y_t|y_{<t},S)。
用于ARTEMIS的规划主干,替代一次性输出整条轨迹。
Mixture of Experts, MoE(专家混合)
由多个专门网络组成,路由器按输入特征选择部分专家参与计算的架构。它可以提升模型容量,同时保持推理/训练的稀疏性。
ARTEMIS用1个共享专家和5个私有专家处理不同驾驶场景。
BEV, Bird’s-Eye View(鸟瞰视图特征)
把多传感器信息映射到俯视平面上的统一表示,便于表示车道、障碍物和可行驶区域。它比单纯图像更适合规划任务。
感知模块输出F_bev,作为规划与细化的共享环境表征。
PDMS(Predictive Driving Model Score)
NAVSIM提出的驾驶评分,用No-Collision、Drivable Area Compliance、Time-to-Collision、Comfort和Ego Vehicle Progress等指标综合计算。分数越高表示规划越好。
ARTEMIS在navtest上达到87.0 PDMS。
EPDMS(Extended Predictive Driving Model Score)
PDMS的扩展版本,加入Lane Keeping、Extended Comfort、Driving Direction Compliance和Traffic Light Compliance等指标,更全面衡量驾驶质量。
ARTEMIS取得83.1 EPDMS,并在LK和EC上表现突出。
开放问题 这项研究留下的未解疑问
- 1 MoE是否真的学到了稳定、可解释的驾驶“子技能”,还是只是对数据偏差做了隐式分桶?需要更细粒度的专家可视化、路由可解释性和跨数据集验证来回答。
- 2 batch reallocation在训练期有效,但它对推理延迟、车端部署和多车协同场景是否划算,仍缺少定量结论。未来需要把算法收益与系统开销一起评估。
应用场景
近期应用
城市路口规划
可直接用于十字路口、T字路口和环岛等复杂场景,利用不同专家分别处理直行、转弯和并线策略,降低单一路径预测失误。
自动驾驶研究基线
适合用作自回归规划、MoE路由和轨迹细化的统一基线,帮助研究者在NAVSIM或类似平台上比较不同生成范式。
远期愿景
可扩展多专家驾驶系统
长期看可发展为面向多城市、多天气、多传感器配置的驾驶大模型,通过专家拆分吸收长尾经验,并在车端做轻量化路由。
原文摘要
This paper presents ARTEMIS, an end-to-end autonomous driving framework that combines autoregressive trajectory planning with Mixture-of-Experts (MoE). Traditional modular methods suffer from error propagation, while existing end-to-end models typically employ static one-shot inference paradigms that inadequately capture the dynamic changes of the environment. ARTEMIS takes a different method by generating trajectory waypoints sequentially, preserves critical temporal dependencies while dynamically routing scene-specific queries to specialized expert networks. It effectively relieves trajectory quality degradation issues encountered when guidance information is ambiguous, and overcomes the inherent representational limitations of singular network architectures when processing diverse driving scenarios. Additionally, we use a lightweight batch reallocation strategy that significantly improves the training speed of the Mixture-of-Experts model. Through experiments on the NAVSIM dataset, ARTEMIS exhibits superior competitive performance, achieving 87.0 PDMS and 83.1 EPDMS with ResNet-34 backbone, demonstrates state-of-the-art performance on multiple metrics.