Pedestrian Crossing Intent Classification From Event-Based Vision Using Convolutional Spiking Neural Networks With Temporal Augmentation

TL;DR

使用卷积脉冲神经网络和时间增强技术进行行人过街意图分类,准确率达95.83%。

cs.CV 🔴 高级 2026-09-11 1 次浏览
Henok Teklu Mustafa Sakhai Maciej Wielgosz Matej Mertik
自动驾驶 事件视觉 脉冲神经网络 时间增强 行人意图预测

核心发现

方法论

该研究提出了一种端到端的管道,通过v2e模拟器将JAAD数据集中的驾驶视频转换为动态视觉传感器事件流,并结合CARLA模拟的DVS-PedX数据集进行训练。使用卷积脉冲神经网络(Conv-SNN)进行二元分类,采用漏积分发火神经元和替代梯度学习,应用类平衡损失函数和JAAD数据集的6倍过采样。

关键结果

  • 在JAAD DVS测试集上,模型达到了95.83%的准确率和0.9695的F1分数,显示出在真实驾驶场景中的高效性。
  • 在正常天气条件下的CARLA DVS上,准确率为97.79%,F1分数为0.9478,证明了模型在模拟环境中的鲁棒性。
  • 在恶劣天气条件下的CARLA DVS上,准确率为94.78%,F1分数为0.8369,表明模型在挑战性条件下的适应性。

研究意义

该研究在自动驾驶领域具有重要意义,通过提高行人过街意图预测的准确性,提升了自动驾驶车辆的安全性。相比传统的基于帧的RGB视频方法,该方法在时间分辨率和能效方面具有显著优势,尤其是在处理运动模糊和高动态范围场景时。

技术贡献

该研究的技术贡献在于首次将卷积脉冲神经网络应用于事件视觉数据的行人意图预测,提供了新的理论保证和工程可能性。通过引入时间一致的DVS增强技术,解决了以往方法在时间一致性上的不足。

新颖性

该方法首次将JAAD数据集的RGB视频转换为DVS事件流,并结合卷积脉冲神经网络进行意图分类,填补了事件视觉感知与SNN分类器在行人意图预测中的空白。

局限性

  • 该方法在处理非常复杂的场景时可能出现性能下降,因为模型的参数量较大,可能导致计算开销增加。
  • 在极端天气条件下,DVS传感器可能无法捕捉到足够的事件,影响模型的预测能力。

未来方向

未来的研究可以探索在更大规模的数据集上进行训练,以提高模型的泛化能力。此外,可以研究在嵌入式平台上的实时部署,以验证其在实际应用中的性能。

AI 总览摘要

在自动驾驶领域,预测行人是否会过街是确保车辆安全的关键。然而,传统的基于帧的RGB视频方法在处理运动模糊和高动态范围场景时存在局限性。

本研究提出了一种新的方法,利用卷积脉冲神经网络(Conv-SNN)和时间增强技术,通过将JAAD数据集的驾驶视频转换为动态视觉传感器(DVS)事件流,并结合CARLA模拟的DVS-PedX数据集进行训练,实现了对行人过街意图的高效分类。

实验结果表明,该方法在JAAD DVS测试集上达到了95.83%的准确率,并在不同天气条件下的CARLA DVS上表现出色,显示出其在实际驾驶场景中的应用潜力。尽管如此,该方法在极端复杂场景下的性能仍需进一步验证。

深度分析

研究背景

自动驾驶技术的发展需要对行人意图进行准确预测。传统方法主要依赖于RGB视频数据,但在处理动态场景时存在局限性。近年来,事件视觉传感器(DVS)因其高时间分辨率和低能耗而受到关注。

核心问题

核心问题在于如何在实时条件下准确预测行人是否会过街。传统方法在处理运动模糊和高动态范围场景时表现不佳,且计算开销大。

核心创新

本研究的核心创新在于将卷积脉冲神经网络应用于事件视觉数据,通过时间一致的DVS增强技术提高了模型的预测准确性和鲁棒性。

方法详解

  • �� 将JAAD数据集的视频转换为DVS事件流
  • �� 使用CARLA模拟的DVS-PedX数据集进行多源训练
  • �� 采用卷积脉冲神经网络进行分类
  • �� 应用类平衡损失函数和6倍过采样技术

实验设计

实验使用JAAD和CARLA DVS-PedX数据集,采用70/15/15的分层分割协议进行训练和测试。模型在CPU上进行训练,参数量为1.07M。

结果分析

在JAAD DVS测试集上,模型达到了95.83%的准确率。在正常和恶劣天气条件下的CARLA DVS上,分别达到了97.79%和94.78%的准确率。

应用场景

该方法可直接应用于自动驾驶车辆的行人意图预测,尤其适用于处理动态场景和复杂天气条件。

局限与展望

模型在处理极端复杂场景时可能性能下降,计算开销较大,未来需优化模型以适应嵌入式平台。

通俗解读 非专业人士也能看懂

想象一个智能交通系统,像一个超级聪明的交通灯。传统的交通灯只能根据预设的时间变化,而这个智能交通灯能实时观察行人,判断他们是否要过马路。它使用一种特殊的“眼睛”,可以看到快速变化的细节,不会被光线变化或运动模糊影响。这种“眼睛”就是动态视觉传感器(DVS)。而它的大脑则是一个聪明的神经网络,能够快速做出判断。这种系统不仅能提高交通效率,还能大大提升行人的安全性。

简单解释 像给14岁少年讲一样

想象你在玩一个超级酷的赛车游戏,游戏里的车能自动驾驶!但它需要知道什么时候有人要过马路。传统的方法就像用老旧的相机拍照,速度慢还容易模糊。而新的方法就像给车装上了超级快的摄像头,能看到每一个细微的动作变化。然后,车里的智能系统会像超聪明的助手,快速判断行人是否要过马路,让车子安全停下。是不是很神奇?

术语表

动态视觉传感器 (Dynamic Vision Sensor)

一种能够检测像素级别亮度变化的传感器,具有高时间分辨率和低能耗的特点。

用于生成事件流以替代传统RGB视频。

卷积脉冲神经网络 (Convolutional Spiking Neural Network)

一种结合卷积层和脉冲神经元的网络结构,模拟生物神经元的通信机制。

用于处理DVS事件流并进行意图分类。

漏积分发火神经元 (Leaky-Integrate-and-Fire Neuron)

一种神经元模型,通过累积输入电流并在达到阈值时发放脉冲。

在Conv-SNN中用于处理时间信息。

替代梯度学习 (Surrogate Gradient Learning)

一种用于训练脉冲神经网络的技术,通过平滑近似替代不可微的脉冲函数。

用于优化Conv-SNN的训练过程。

时间增强 (Temporal Augmentation)

一种数据增强技术,通过一致的时序变换提高模型的鲁棒性。

用于DVS数据的训练以保持时间一致性。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂场景下提高模型的预测准确性?现有方法在处理复杂背景和多行人交互时表现不佳,需要更高效的特征提取技术。
  • 2 如何在嵌入式平台上实现实时部署?现有模型计算开销较大,需优化以适应资源受限的环境。

应用场景

近期应用

自动驾驶车辆

提高行人过街意图预测的准确性,增强车辆的安全性和反应速度。

智能交通系统

通过实时监测行人动态,提高交通信号灯的智能化水平。

远期愿景

智慧城市

通过集成先进的视觉传感技术,提升城市交通管理的智能化和自动化水平。

原文摘要

Anticipating whether a pedestrian will cross the road is safety-critical for autonomous vehicles, requiring real-time inference under challenging conditions including motion blur, high dynamic range, and class imbalance. Conventional frame-based deep networks process redundant RGB data at fixed frame rates, limiting their temporal resolution and energy efficiency. In this work we present an end-to-end pipeline that (i) converts real-world driving footage from the Joint Attention in Autonomous Driving (JAAD) dataset into synthetic dynamic vision sensor (DVS) event streams using the v2e simulator, (ii) augments training with the CARLA-simulated DVS sequences of the DVS-PedX dataset under both normal and adverse weather conditions, and (iii) trains a novel convolutional spiking neural network (Conv-SNN) with clip-consistent DVS augmentation to classify pedestrian crossing intent as binary: crossing or non-crossing. We detail all architectural decisions, the exact leaky-integrate-and-fire neuron dynamics with surrogate-gradient learning, the class-balanced loss formulation, JAAD oversampling at 6x, and a 70/15/15 stratified splitting protocol. The trained model achieves 95.83% accuracy and F1 = 0.9695 on the JAAD DVS test set, 97.79% accuracy and F1 = 0.9478 on normal CARLA DVS, and 94.78% accuracy and F1 = 0.8369 on adverse-weather CARLA DVS, all from a 1.07M-parameter architecture trained on CPU. Compared to prior frame-based approaches on JAAD, our method closes or surpasses the reported accuracy while operating natively on sparse temporal representations. We include a thorough analysis of the convergence behaviour across all 15 training epochs, domain transfer characteristics, and a quantitative comparison with representative related work.

cs.CV cs.AI