CausalAgents: A Robustness Benchmark for Motion Forecasting using Causal Relationships

TL;DR

提出CausalAgents基准,通过删除非因果代理评估运动预测模型鲁棒性,观察25-38%的minADE变化。

cs.LG 🔴 高级 2022-07-08 61 次浏览
Rebecca Roelofs Liting Sun Ben Caine Khaled S. Refaat Ben Sapp Scott Ettinger Wei Chai
自主驾驶 鲁棒性 因果关系 深度学习 运动预测

核心发现

方法论

本研究在Waymo开放运动数据集(WOMD)中,通过人工标注识别因果代理,即影响驾驶行为的代理。利用这些标签,构建删除非因果代理的扰动场景,评估多种前沿深度学习模型(如SceneTransformer、MultiPath++、Wayformer)在不同扰动下的性能变化。提出两种指标:逐例绝对minADE变化和基于IoU的轨迹集合相似性,量化模型对扰动的敏感性。实验中,通过增加训练数据和引入随机删除非因果代理的增强策略,显著提升模型鲁棒性。

关键结果

  • 所有模型在非因果扰动下表现出显著性能下降,minADE相对变化达25-38%。例如,SceneTransformer在删除非因果代理后,平均minADE变化为0.067m,而原始为0.250m。多模型对删除因果代理尤为敏感,部分场景minADE提升超过1米。通过增加训练集规模和目标数据增强,模型鲁棒性得到改善,平均Abs(∆)降低约30%。
  • 模型对删除非因果代理的敏感性与模型架构和场景复杂度相关。SceneTransformer的边际模型表现出较低的绝对敏感度,而MultiPath++-All模型对整体性能的相对变化较小。此外,模型在远离车辆的代理删除时表现出较强鲁棒性,但对邻近因果代理的敏感性更高。
  • 提出基于IoU的轨迹集合差异指标,验证扰动引起的轨迹变化,发现大部分场景轨迹变化有限,但仍存在长尾分布,部分例子变化超过1米,显示模型在特定场景下的脆弱性。

研究意义

本研究首次系统性地引入基于人类标注的因果关系作为运动预测模型鲁棒性评估标准,填补了现有方法对模型对场景中非因果因素敏感性缺乏系统检测的空白。通过构建扰动场景,揭示模型在面对潜在的干扰因素时的脆弱性,为自主驾驶系统的安全性提供了关键保障。研究成果有助于推动深度学习模型在复杂交通环境中的可靠应用,促进未来鲁棒性提升技术的发展。

技术贡献

本文提出了基于因果关系的扰动构建方法,利用人工标注识别因果代理,从而系统评估模型对非因果干扰的敏感性。引入两种新指标:逐例绝对minADE变化和轨迹IoU差异,量化模型鲁棒性。通过在多模型上验证,发现增加训练数据和目标数据增强能有效缓解模型敏感性。该方法结合人类因果理解与自动化评估,为运动预测模型的安全性提升提供了新思路。

新颖性

本工作首次将人类标注的因果关系引入运动预测模型鲁棒性评估,采用删除非因果代理的扰动策略,突破了传统仅依赖统计或模拟噪声的局限。提出的两项指标能更全面反映模型对场景中潜在干扰的敏感性,具有较强的实用性和推广价值。相比已有的鲁棒性评估方法,本研究强调因果关系的理解,为未来模型的因果推理和安全保障提供基础。

局限性

  • 依赖人工标注的因果关系,标注成本高且存在主观偏差,难以规模化应用到大规模数据集。
  • 扰动策略主要集中在删除非因果代理,未考虑复杂场景中的多因果交互和动态变化,限制了评估的全面性。
  • 模型鲁棒性提升策略虽有效,但在极端交通场景或极端扰动下的表现仍需验证,未来需结合多模态信息和多任务学习进一步增强。
  • 实验主要在静态场景和特定模型架构下进行,泛化到不同交通环境和模型类型仍需后续验证。

未来方向

未来将探索自动化因果关系识别技术,降低标注成本,扩展到多模态数据。结合强化学习和因果推理,提升模型在极端场景下的鲁棒性。还计划引入多源信息融合,增强模型对复杂交通交互的理解能力,推动自主驾驶系统的安全性和可靠性持续提升。

AI 总览摘要

随着自动驾驶技术的快速发展,运动预测模型在确保行车安全中扮演着关键角色。然而,现有模型在面对复杂交通场景中的潜在干扰时,表现出明显的脆弱性。传统评估方法多依赖静态测试集,难以全面反映模型在实际环境中的鲁棒性。为此,本文提出了CausalAgents基准,通过人工标注识别交通场景中的因果代理,利用删除非因果代理的扰动策略,系统评估模型对潜在干扰的敏感性。实验结果显示,主流深度学习模型在此扰动下的性能变化高达25-38%,揭示了模型在实际应用中的潜在风险。研究还提出两种新指标:逐例绝对minADE变化和轨迹IoU差异,有效量化模型对扰动的敏感性。通过增加训练数据和引入目标数据增强策略,模型鲁棒性得到显著改善。这一工作不仅为运动预测模型的安全性提供了新的评估工具,也为未来结合因果推理和深度学习的鲁棒性提升提供了理论基础。未来,自动化因果关系识别、多模态融合和强化学习将成为提升自主驾驶系统安全性的关键方向。该基准的开放发布,将推动学界和产业界共同构建更安全、更可靠的自动驾驶技术生态。

深度解读

原文摘要

As machine learning models become increasingly prevalent in motion forecasting for autonomous vehicles (AVs), it is critical to ensure that model predictions are safe and reliable. However, exhaustively collecting and labeling the data necessary to fully test the long tail of rare and challenging scenarios is difficult and expensive. In this work, we construct a new benchmark for evaluating and improving model robustness by applying perturbations to existing data. Specifically, we conduct an extensive labeling effort to identify causal agents, or agents whose presence influences human drivers' behavior in any format, in the Waymo Open Motion Dataset (WOMD), and we use these labels to perturb the data by deleting non-causal agents from the scene. We evaluate a diverse set of state-of-the-art deep-learning model architectures on our proposed benchmark and find that all models exhibit large shifts under even non-causal perturbation: we observe a 25-38% relative change in minADE as compared to the original. We also investigate techniques to improve model robustness, including increasing the training dataset size and using targeted data augmentations that randomly drop non-causal agents throughout training. Finally, we release the causal agent labels (at https://github.com/google-research/causal-agents) as an additional attribute to WOMD and the robustness benchmarks to aid the community in building more reliable and safe deep-learning models for motion forecasting.

cs.LG cs.AI cs.RO