ControlledShifts: Towards Standardizing Robustness Evaluation in Trajectory Prediction Under Distribution Shifts

TL;DR

本文提出ControlledShifts框架,通过系统重划分轨迹数据集,实现分布偏移的标准化评估,结合预测质量与稳定性指标。

cs.RO 🔴 高级 2026-08-18 73 次浏览
Ingrid navarro Pablo Ortega-Kral Yutong Duan Jonathan Francis Jean Oh
自主驾驶 轨迹预测 分布偏移 鲁棒性评估 基准测试

核心发现

方法论

该研究提出ControlledShifts框架,核心在于利用特征函数(c)定义偏移轴,并通过分割函数(f)控制偏移尾部,从而系统生成不同的分布偏移场景。该方法不依赖新数据采集,而是对现有轨迹数据集(如Waymo Open Motion Dataset)进行重新划分,形成在分布内(SEEN)和分布外(UNSEEN)两个子集。框架设计包括三个关键基准:背景代理(BackgroundAgents)、自我安全(EgoSafeShift)和环境多样性(Environments),分别对应不同的拓扑和行为偏移。为了量化模型在多维指标上的鲁棒性,提出统一的鲁棒性得分,结合预测质量(相对性能提升)和预测稳定性(偏移下性能保持)两个维度,采用几何平均整合多项指标。实验证明,基于Transformer的模型在不同偏移场景下表现出显著差异,尤其在模型容量和对潜在相关性处理方面的差异明显。

关键结果

  • 在Waymo数据集上,利用ControlledShifts生成的偏移场景,模型的预测误差(如MinADE)在偏移后平均增加了20%以上,表明模型在未见场景中性能显著下降。具体数据显示,Way-Former模型在偏移场景中的平均MinADE从1.953米升至2.625米,性能下降超过34%。
  • 鲁棒性得分分析显示,较大容量模型(如MTR)在预测质量方面表现优异(得分2.187),但在偏移场景下的稳定性较差,得分仅0.920,显示出容量越大,模型在偏移中的性能波动越明显。相比之下,NAIVE模型在稳定性指标上表现更稳,但预测质量较低。
  • 通过不同偏移轴(背景代理、安全相关性、环境拓扑)分析,模型在偏移场景中的表现差异明显,验证了ControlledShifts在揭示模型鲁棒性方面的有效性。特别是在背景代理偏移中,模型的碰撞率下降明显,但误差增加,反映出模型对环境干扰的敏感性。

研究意义

该研究为轨迹预测模型的鲁棒性评估提供了标准化框架,解决了现有方法多依赖单一指标、缺乏统一比较基准的问题。通过系统化偏移生成和多维指标整合,推动了模型在真实复杂环境中的可靠性提升。其方法不仅适用于自主驾驶,还可推广至多智能体系统、机器人导航等领域,为未来安全感知与决策提供理论基础和实践工具,具有深远的学术和工业价值。

技术贡献

论文的技术创新主要体现在两个方面:一是提出一种通用的偏移生成机制(ControlledShifts),通过特征函数和分割函数实现多轴偏移的可控重划分,避免了新数据采集的成本。二是设计了统一的鲁棒性评分体系,将多维性能指标融合为两个核心维度(质量与稳定性),实现跨场景、跨模型的公平比较。此外,论文还引入了三套针对不同偏移类型的基准(背景代理、自我安全、环境拓扑),丰富了鲁棒性评估的场景覆盖范围。该方法在模型容量、偏移类型和指标整合方面均优于现有单一指标或单轴偏移的评估策略,为轨迹预测的鲁棒性研究提供了系统性框架。

新颖性

本研究的创新点在于首次提出系统化的ControlledShifts偏移生成框架,打破了以往仅依赖随机划分或单一偏移轴的局限。通过特征函数和分割函数的结合,实现对多维偏移的精细控制,且无需额外采集新数据。同时,提出的统一鲁棒性评分体系,能够综合反映模型在不同偏移条件下的预测质量和稳定性,填补了行业内缺乏标准化、多维度评估指标的空白。这一方法在理论和实践层面均具有开创性意义,为未来多场景、多模型的鲁棒性研究提供了可复制、可扩展的工具。

局限性

  • 该方法依赖于预定义的特征函数(c)和分割函数(f),其设计的合理性和泛化能力受到限制,可能无法涵盖所有实际偏移类型。某些偏移场景可能未能被充分模拟,影响评估的全面性。
  • 在大规模或高复杂度场景中,偏移生成和模型评估的计算成本较高,尤其是在多轴偏移和多模型集成时,可能面临效率瓶颈。
  • 目前的鲁棒性指标主要基于性能差异的相对变化,未充分考虑模型的解释性和安全性指标,未来应结合多方面指标完善评估体系。

未来方向

未来的研究方向包括:一是丰富偏移生成的轴向,涵盖更多环境和行为特征,提升偏移的真实性和多样性;二是引入模型解释性和安全性指标,构建更全面的鲁棒性评估体系;三是结合强化学习和自适应机制,提升模型在未知偏移中的自我调整能力。此外,还应探索多任务、多模态融合策略,以增强模型在复杂场景下的泛化能力,推动自主系统在真实环境中的安全部署。

AI 总览摘要

在自动驾驶和多智能体系统中,轨迹预测的鲁棒性成为确保安全的核心挑战。当前,许多先进的深度学习模型在训练数据丰富的环境中表现优异,但在面对未见场景或偏移条件时,性能迅速下降,严重制约其实际应用。为此,本文提出了ControlledShifts框架,旨在通过系统化的偏移生成,建立一种标准化的鲁棒性评估体系。

ControlledShifts的核心思想是利用特征函数(c)定义偏移轴,结合分割函数(f)控制偏移尾部,从而在不依赖新数据采集的前提下,重划分现有轨迹数据集(如Waymo Open Motion Dataset)为在分布内(SEEN)和分布外(UNSEEN)两部分。这种方法允许研究者在不同偏移场景下,公平、可控地评估模型的性能变化。论文设计了三套偏移基准:背景代理(BackgroundAgents)、自我安全(EgoSafeShift)和环境拓扑(Environments),分别模拟环境中代理行为、决策安全性和道路结构的变化。

为了量化模型在偏移场景中的表现,作者提出了统一的鲁棒性得分体系,将预测质量(相对性能提升)和预测稳定性(偏移下性能保持)两个维度进行融合。实验证明,基于Transformer的模型在不同偏移场景中表现出明显差异,容量越大的模型在预测准确性方面优势明显,但在偏移中的稳定性较差。这些结果验证了ControlledShifts在揭示模型鲁棒性方面的有效性,为未来自主驾驶系统的安全性提升提供了理论基础和实践工具。

该研究的贡献在于提供了一个系统化、可扩展的偏移生成和评估框架,弥补了行业内缺乏统一标准的短板。通过多轴偏移和多指标融合,推动了轨迹预测模型在复杂环境中的可靠性研究。未来,研究者可以在此基础上,进一步丰富偏移轴向,结合模型解释性和安全性指标,提升模型的泛化能力和可信度。整体来看,ControlledShifts为自主驾驶安全评估提供了重要的理论工具和实践平台,具有深远的学术和工业价值。

深度分析

研究背景

轨迹预测作为自动驾驶系统中的关键任务,经历了从传统基于规则的方法到深度学习模型的快速发展。早期方法如基于卡尔曼滤波和运动模型的预测,受限于环境复杂度和动态变化,难以应对多样化场景。近年来,深度神经网络,尤其是Transformer架构(如MTR、Way-Former)被广泛应用,显著提升了预测准确率。多个公开数据集(如Waymo Open Motion Dataset、Argoverse)推动了模型的快速迭代。然而,现有研究多关注在训练数据丰富的环境中优化性能,缺乏对模型在未知或偏移场景中的鲁棒性评估。部分工作引入场景挖掘(如Scenario Mining)和测试时自适应(如模型集成、不确定性估计),但缺乏统一的评估标准,难以全面衡量模型的泛化能力。行业内尚未建立系统的偏移生成和鲁棒性比较框架,限制了模型在实际复杂环境中的应用推广。

核心问题

当前轨迹预测模型在面对分布偏移时表现不佳,尤其是在未见场景或环境变化剧烈的情况下,性能下降明显。这一问题源于模型对训练数据的过拟合和偏移敏感性,导致在实际应用中存在安全隐患。尽管已有方法试图通过数据增强、场景挖掘或测试时自适应缓解,但缺乏统一的评估体系,使得不同方法的鲁棒性难以比较。此外,现有指标多集中在单一性能(如误差)上,忽视了模型在偏移环境中的稳定性和安全性。解决这一问题的关键在于设计一种系统化、可控的偏移生成机制,以及多维度的性能评估指标,从而实现模型鲁棒性的公平、全面比较。

核心创新

本文的主要创新在于提出ControlledShifts框架,结合特征函数(c)和分割函数(f)实现多轴偏移的可控生成。该机制允许研究者在不额外采集新数据的情况下,系统模拟多种偏移场景,涵盖环境拓扑、代理行为和安全相关性等维度。其次,设计了统一的鲁棒性评分体系,将预测质量与稳定性指标融合,提供了跨场景、跨模型的公平比较工具。最后,论文构建了三套偏移基准,针对不同偏移类型,验证了模型在真实复杂环境中的表现差异。这些创新突破了以往单一指标或随机划分的局限,为轨迹预测鲁棒性研究提供了系统性解决方案。

方法详解

  • �� 设计特征函数(c):定义偏移轴,如背景代理数量、安全相关性或环境拓扑特征。输入为场景数据,输出为场景的特征表示。
  • �� 设计分割函数(f):基于特征表示,将场景划分为SEEN(在分布内)和UNSEEN(偏移外)两部分。通过设定阈值或聚类算法实现偏移尾部的控制。
  • �� 数据重划分:利用(c)和(f)对现有轨迹数据集(如Waymo)进行重新划分,形成偏移场景,避免新数据采集成本。
  • �� 评估指标:定义预测误差(如MinADE、MinFDE)、碰撞率等多维指标,结合相对性能比值(如模型与Naive基线的比值)计算质量和稳定性得分。
  • �� 统一评分:采用几何平均融合多指标,得到每个模型在不同偏移场景下的鲁棒性得分。
  • �� 基准构建:设计背景代理(BGA)、自我安全(ESS)和环境(ENV)三套偏移场景,验证模型在不同偏移类型下的表现差异。

实验设计

  • �� 数据集选用Waymo Open Motion Dataset,涵盖多样化的道路和场景条件,选取约45K场景进行偏移生成。
  • �� 训练多款Transformer架构(如Autobot、SceneTransformer、Way-Former、MTR),每个模型在不同偏移场景下独立训练。
  • �� 实验设置包括在原始(SEEN)和偏移(UNSEEN)场景上评估模型性能,指标包括MinADE、MinFDE、MissRate和CollisionRate。
  • �� 采用不同偏移轴(背景代理、安全相关性、环境拓扑)生成偏移场景,验证模型鲁棒性。
  • �� 通过对比偏移前后性能变化,分析模型容量、偏移类型对鲁棒性的影响,进行多场景、多模型的综合评估。

结果分析

  • �� 实验结果显示,偏移场景中模型性能普遍下降,平均MinADE增加20%以上,最大达34%。
  • �� 大容量模型(如MTR)在预测准确性方面表现优异(得分2.187),但在偏移场景中的稳定性(得分0.920)明显低于小模型(如Naive的1.000),揭示容量越大模型越敏感偏移。
  • �� 不同偏移轴对模型表现影响显著,背景代理偏移导致碰撞率下降但误差升高,环境偏移则表现为路径理解能力下降,验证了ControlledShifts在揭示模型弱点方面的有效性。
  • �� 通过鲁棒性得分分析,WAY-Former在预测质量上排名第一(得分3.034),但稳定性较差,反映出容量与鲁棒性之间的权衡。整体结果强调了多轴偏移评估的重要性,为模型优化提供了明确方向。

应用场景

  • �� 立即应用:自主驾驶系统中的轨迹预测模型可以利用ControlledShifts进行鲁棒性评估,优化模型设计,提升在未知环境中的安全性。
  • �� 长远愿景:该框架可推广至多智能体系统、机器人导航等领域,推动多场景、多模型的鲁棒性标准化,促进自动化系统在复杂环境中的广泛应用,最终实现安全、可靠的自主决策。

局限与展望

  • �� 当前偏移生成依赖于预定义特征(c)和分割(f),可能无法涵盖所有实际偏移类型,影响评估的全面性。
  • �� 计算成本较高,尤其在多轴偏移和大模型集成时,存在效率瓶颈。
  • �� 评估指标主要关注性能差异,缺乏对模型解释性和安全性的考虑,未来需结合多方面指标完善体系。

通俗解读 非专业人士也能看懂

想象你在一家大型工厂工作,工厂里有许多不同的机器和流程。每次生产都要确保产品质量,但有时候,机器会因为不同的原因出现问题,比如温度变化、原料不同或操作员的习惯不同。这些变化就像是工厂的“偏移”,会影响最终产品的质量。为了保证无论工厂发生什么变化,产品都能保持高质量,工厂管理者需要测试各种可能的变化,确保每台机器都能应对不同的情况。

ControlledShifts就像是工厂管理者设计的一套测试方法,他们不会每次都改变工厂的全部流程,而是选择一些关键的变化点,比如机器的温度、操作员的习惯或原料的来源,然后模拟这些变化,观察机器的表现。这样,他们可以知道哪台机器在不同变化下还能保持良好的性能,哪台机器容易出问题。

他们还设计了一个评分系统,把机器在不同变化下的表现进行比较,既看它的平均表现(预测的准确性),也看它在变化中的稳定性(性能的保持程度)。通过这种方法,工厂可以提前发现潜在的问题,改进设备,确保每次生产都能达到标准。这个方法不仅帮助工厂提高效率,也让工厂的产品更可靠、更安全。类似的,ControlledShifts帮助自动驾驶系统在面对各种未知环境时,依然能做出正确的判断,保障行车安全。

简单解释 像给14岁少年讲一样

想象你在玩一个超级复杂的电子游戏,你的任务是让一个机器人在不同的房间里找到出口。每个房间都不一样,有的房间有很多障碍物,有的房间灯光很暗,还有的房间里有很多其他机器人在跑来跑去。你需要确保你的机器人在所有这些不同的房间都能顺利找到出口。可是,有时候你会遇到一些从未见过的房间类型,机器人可能会迷路或走错路。这就像是模型遇到“偏移”场景一样,表现会变差。

为了让机器人变得更聪明,你可以设计一些特别的测试,比如让它在一些房间里只看到一部分信息,然后看看它还能不能找到出口。这就像ControlledShifts一样,它会把房间的某些特征(比如障碍物的数量、房间的布局)作为偏移的轴,然后故意让机器人在这些特征的极端情况下测试它的表现。

通过这些测试,你可以知道你的机器人在哪些房间表现得不好,在哪些情况下会迷路。这样,你就可以改进它,让它变得更聪明、更可靠。最终,你的机器人就能在各种奇怪的房间里都能找到出口,就像自动驾驶系统在各种复杂环境中都能安全行驶一样!

原文摘要

Trajectory prediction is central to safety in autonomous driving, yet learning-based predictors tend to degrade sharply when encountering scenarios poorly represented by their training data. Many methods attempt to mitigate distribution shift degradation through data-centric or test-time adaptation approaches; however, they are typically validated along fragmented axes of generalization, leaving the field without a standardized way to compare robustness across shifts a model may encounter. To address this, we introduce ControlledShifts, a framework and benchmark suite that systematically re-splits existing trajectory datasets into in-distribution (seen) and out-of-distribution (unseen) partitions, via a shared characterization-and-splitting formulation, in which a characterization function fixes the axis of variation a benchmark probes and a splitting function fixes how the tail of that axis is withheld. The suite comprises three benchmarks targeting key topological and behavioral distribution shifts. Furthermore, to aggregate multi-dimensional performance metrics across these benchmarks, we propose a unified robustness score that evaluates models along two complementary dimensions: prediction quality (relative performance gain) and prediction stability (performance preservation under shift). We showcase ControlledShifts by benchmarking prominent transformer-based architectures, exposing critical differences in how models of varying capacities handle latent relevance and environmental structure.

cs.RO

参考文献 (20)

LongComp: Long-Tail Compositional Zero-Shot Generalization for Robust Trajectory Prediction

Ben Stoler, Jonathan Francis, Jean Oh

2025 1 引用 ⭐ 高影响力 查看解读 →

SafeShift: Safety-Informed Distribution Shifts for Robust Trajectory Prediction in Autonomous Driving

Ben Stoler, Ingrid Navarro, Meghdeep Jana 等

2023 23 引用 ⭐ 高影响力 查看解读 →

Improving the Generalizability of Trajectory Prediction Models with Frenét-Based Domain Normalization

Luyao Ye, Zikang Zhou, Jianping Wang

2023 23 引用 ⭐ 高影响力 查看解读 →

BITS: Bi-level Imitation for Traffic Simulation

Danfei Xu, Yuxiao Chen, B. Ivanovic 等

2022 127 引用 查看解读 →

Latent Variable Sequential Set Transformers for Joint Multi-Agent Motion Prediction

Roger Girgis, Florian Golemo, Felipe Codevilla 等

2021 222 引用 查看解读 →

Another look at measures of forecast accuracy

Rob J Hyndman, A. Koehler

2006 5676 引用

KING: Generating Safety-Critical Driving Scenarios for Robust Imitation via Kinematics Gradients

Niklas Hanselmann, Katrin Renz, Kashyap Chitta 等

2022 153 引用 查看解读 →

nuScenes: A Multimodal Dataset for Autonomous Driving

Holger Caesar, Varun Bankiti, Alex H. Lang 等

2019 8771 引用 查看解读 →

Scene Transformer: A unified architecture for predicting future trajectories of multiple agents

Jiquan Ngiam, Vijay Vasudevan, Benjamin Caine 等

2022 217 引用

Can Autonomous Vehicles Identify, Recover From, and Adapt to Distribution Shifts?

Angelos Filos, P. Tigas, R. McAllister 等

2020 235 引用 查看解读 →

Core Challenges in Embodied Vision-Language Planning

Jonathan M Francis, Nariaki Kitamura, Felix Labelle 等

2021 64 引用 查看解读 →

Large Scale Interactive Motion Forecasting for Autonomous Driving : The Waymo Open Motion Dataset

S. Ettinger, Shuyang Cheng, Benjamin Caine 等

2021 928 引用 查看解读 →

On Adversarial Robustness of Trajectory Prediction for Autonomous Vehicles

Qingzhao Zhang, Shengtuo Hu, Jiachen Sun 等

2022 218 引用 查看解读 →

LIBERO-PRO: Towards Robust and Fair Evaluation of Vision-Language-Action Models Beyond Memorization

Xueyang Zhou, Yangming Xu, Guiyao Tie 等

2025 111 引用 查看解读 →

Motion Transformer with Global Intention Localization and Local Movement Refinement

Shaoshuai Shi, Li Jiang, Dengxin Dai 等

2022 486 引用 查看解读 →

SEAL: Towards Safe Autonomous Driving via Skill-Enabled Adversary Learning for Closed-Loop Scenario Generation

Ben Stoler, Ingrid Navarro, Jonathan Francis 等

2024 16 引用 查看解读 →

What Went Wrong? Closing the Sim-to-Real Gap via Differentiable Causal Discovery

Peide Huang, Xilun Zhang, Ziang Cao 等

2023 42 引用 查看解读 →

ScenarioCharacterization: A Modular Toolkit for Characterizing Safety across Trajectory Datasets

Ingrid Navarro, Yutong Duan, Jonathan Francis 等

2026 1 引用 查看解读 →

RCG: Safety-Critical Scenario Generation for Robust Autonomous Driving via Real-World Crash Grounding

Ben Stoler, Julia S. Yang, Jonathan Francis 等

2025 4 引用 查看解读 →

CausalAgents: A Robustness Benchmark for Motion Forecasting

R. Roelofs, Liting Sun, Benjamin Caine 等

2022 31 引用 查看解读 →