EvDistill: Asynchronous Events to End-task Learning via Bidirectional Reconstruction-guided Cross-modal Knowledge Distillation

TL;DR

EvDistill用双向重建与跨模态蒸馏,在无标注事件上实现DDD17 58.02% mIoU。

cs.CV 🔴 高级 2021-11-24 24 次浏览
Lin Wang Yujeong Chae Sung-Hoon Yoon Tae-Kyun Kim Kuk-Jin Yoon
事件相机 知识蒸馏 跨模态学习 语义分割 目标识别

核心发现

方法论

EvDistill以有标签图像训练教师网络T,以无标签、无配对事件训练学生Sev;核心包括双向模态重建BMR、分布适配DA、亲和图知识蒸馏AG-KD,以及可选APS学生Saps。BMR通过GT→S和GS→T构造跨模态样本,并由任务损失与KD端到端优化。总目标为L=LCE+LBMR+λ1LDA+λ2LAG+λ3LMD。

关键结果

  • 在DDD17上,50ms事件窗口的多通道表示达到58.02% mIoU,超过EvSegNet的54.81%;10ms和250ms分别为49.21%与52.01%,较EvSegNet提高约7.5%和9.5%。
  • 在DDD17的APS分支上,EvDistill达到72.63% mIoU,而使用APS伪标签的EvSegNet为64.98%;MVSEC上事件与APS分别达55.09%和68.85%,较基线提高8.8%和11.2%。
  • 方法不使用事件标注;多通道事件表示优于两通道体素网格的57.16%。在低照度和过曝场景中,事件流仍能保留运动边缘与结构信息。

研究意义

论文缓解了事件视觉长期受限于标注稀缺的问题:事件数据无需像素级标签,也无需与大规模图像严格配对,即可继承图像教师的语义能力。它把事件相机的HDR、低运动模糊优势与成熟图像模型结合,对自动驾驶、机器人和高速感知具有现实价值。

技术贡献

BMR以双向生成器连接源域图像与目标域事件,并用动态语义一致性KL[T(GT→S(e))||Sev(e)]让重建模块受终端任务反向约束。DA通过条件对抗分布匹配减少模态偏移;AG-KD不强行对齐异质特征,而匹配空间节点相似度Auv=FuᵀFv/(||Fu||2||Fv||2),更适合稀疏事件。

新颖性

与依赖配对数据、共同标签或APS伪标签的跨模态KD不同,EvDistill针对无配对、无标注事件提出训练期桥接方案。其关键不是直接复制图像特征,而是联合重建、类别分布匹配和空间亲和关系蒸馏,且BMR在推理阶段可移除。

局限性

  • 论文主要在DDD17、MVSEC和E2VID上验证;E2VID缺少真实标注,因此只能定性展示,跨相机、跨任务泛化仍未充分量化。
  • BMR包含生成器、判别器和对抗训练,训练复杂且可能受事件稀疏、噪声、时间窗口及生成质量影响;论文未给出完整消融和部署能耗数据。

未来方向

后续可研究更稳健的事件表示、跨传感器和跨域适配,以及无需APS的纯事件训练。还应报告完整消融、实时延迟、能耗和更多检测、跟踪任务,并探索时序模型或脉冲神经网络。

AI 总览摘要

事件相机只记录像素亮度变化,因此具有高动态范围和低运动模糊,却缺少大规模、高质量标注。传统事件分割方法如EvSegNet依赖APS图像生成伪标签,标签质量和图像域差距限制了性能;事件重建方法又会增加推理延迟。

EvDistill将大规模有标签图像作为源模态,将无标签、无配对事件作为目标模态。教师网络T处理图像,学生Sev处理事件;BMR用GT→S与GS→T建立双向桥接,DA匹配模态类别分布,AG-KD匹配空间位置间的相似关系,APS存在时再用Saps与Sev互蒸馏。重建模块只在训练中使用,推理时移除。

结果显示,DDD17上50ms多通道事件输入达到58.02% mIoU,优于EvSegNet的54.81%;10ms和250ms分别达到49.21%和52.01%。APS分支达到72.63%,高于64.98%;MVSEC事件和APS分别达到55.09%与68.85%。这些结果说明,跨模态知识可以在没有事件标签和配对样本的条件下迁移,同时保留事件相机在HDR、低照度和快速运动中的优势。

深度分析

研究背景

事件相机异步输出(u,t,p)事件,在HDR和快速运动下优于普通相机。DNN已用于DDD17、N-Caltech、MVSEC等任务,但事件标注昂贵且稀疏。EvSegNet用APS伪标签,Vid2E使用合成数据;事件重建工作如E2Vid改善视觉质量,却通常仍需标注或增加推理成本。

核心问题

目标是训练仅接收事件的学生网络,而训练数据没有事件标签,也没有与有标签图像配对。难点包括事件与图像的外观和统计分布差异、事件稀疏噪声、APS低质量伪标签,以及像素级分割对空间结构的一致性要求。

核心创新

  • ��BMR用GT→S和GS→T创造跨模态监督对,并以动态语义一致性端到端优化。•DA通过KL预测匹配和条件对抗分类器减少源域/目标域分布差异。•AG-KD匹配局部空间亲和图,而非直接复制异质特征。•MD让Sev与Saps互相约束;BMR训练后移除。

方法详解

  • ��输入:将事件流编码为多通道事件图;源数据XS={xs,ys},目标数据XT={e,xaps}。•教师:用有标签图像训练T;学生Sev学习事件,Saps可学习APS。•重建:GT→S生成图像表征,GS→T生成事件表征;有APS时加入L1像素损失与CycleGAN式对抗损失。•蒸馏:使用KL、DA和AG损失;AG在H×W节点及σ邻域上匹配ATuv与ASuv。•优化:L=LCE+LBMR+λ1LDA+λ2LAG+λ3LMD;推理仅保留学生。

实验设计

语义分割使用DDD17、MVSEC和E2VID,六类标签,指标为mIoU。DDD17测试10、50、250ms事件窗口,并比较EvSegNet、Vid2E、体素网格和多通道表示;训练不使用事件标注,已有伪标签仅用于测试比较。MVSEC评估户外白天与夜间;E2VID约4K训练、400测试事件图像,主要定性分析。

结果分析

DDD17多通道输入在50ms为58.02%,两通道体素网格为57.16%,EvSegNet为54.81%;10ms和250ms为49.21%与52.01%。APS达到72.63%,对比64.98%。MVSEC事件55.09%、APS 68.85%,分别高于伪标签基线50.53%和61.93%。E2VID定性结果显示可分割车辆、行人和交通灯。

应用场景

适用于自动驾驶中的低照度、逆光和高速场景,机器人导航、无人机和工业高速检测也可受益。部署前需拥有事件传感器及足够的有标签图像源域模型;若有APS,可训练Saps,但推理阶段可只运行Sev,实现低延迟事件感知。

局限与展望

方法依赖源域图像教师、生成器和对抗训练,训练成本与稳定性高于直接监督学习。事件窗口、相机分辨率和噪声会影响结果;E2VID没有定量真值,目标识别部分在所给文本中未报告具体数字。未来应验证更多传感器、城市和任务,并系统测量实时性、能耗与跨域鲁棒性。

通俗解读 非专业人士也能看懂

把EvDistill想成两所学校培养同一名学生。第一所学校拥有大量清晰照片和标准答案,训练出经验丰富的老师;第二所学校只有事件相机留下的“变化通知”,没有答案,也没有与照片一一对应的样本。普通做法会要求第二所学校先把通知还原成照片,既慢又容易出错。

EvDistill先安排两个翻译员:一个把事件变化翻成近似照片,另一个把照片翻成事件样式。老师和学生借助这些中间材料交流。系统不只比较最终答案,还比较哪些位置彼此相似,例如同一辆车上的各个点应该属于同一组。若有普通相机画面,两个学生还可以互相检查答案。

训练完成后,翻译员和老师都可以离开,只留下会读事件的学生。因此,车辆快速经过、画面过亮或过暗时,学生仍可能看清轮廓。DDD17上它达到58.02% mIoU,高于54.81%的旧方法。

简单解释 像给14岁少年讲一样

想象你要训练一个只看“画面变化提示”的机器人。普通相机会告诉你整张照片,但事件相机只在亮度改变时发消息:这里变亮了、那里变暗了。它在夜晚和高速运动中很厉害,可是很难给每条消息贴上“汽车”“道路”这样的标签。

EvDistill找来一位看过大量有答案照片的老师。学生只看事件消息,但训练时安排翻译员,把事件临时变成类似照片的东西,也把照片临时变成事件样式。老师不只告诉学生最后答案,还告诉它哪些位置应该属于同一个物体。这样,即使没有配对照片,学生也能学到“这片区域是一辆车”的规律。

有普通相机画面时,另一个学生也能和事件学生互相检查;考试时翻译员和老师都不用上场,事件学生自己工作。DDD17上它的成绩是58.02%,比旧方法54.81%好。就像玩赛车游戏时,屏幕突然过曝或汽车飞快冲过,事件相机仍能抓住关键动作!

术语表

Event camera(事件相机)

只在像素亮度变化超过阈值时输出事件(u,t,p),而不是连续图像。它具有HDR和低运动模糊优势。

作为目标模态输入Sev。

Knowledge Distillation(知识蒸馏)

让学生模型模仿更强教师模型的预测或结构信息。论文用KL散度、亲和图和互蒸馏传递知识。

图像教师向事件学生迁移语义能力。

BMR(双向模态重建)

用GT→S和GS→T在图像与事件之间生成中间表征。它在训练时建立无配对模态桥梁。

构造蒸馏样本并由任务损失优化。

Distribution Adaptation(分布适配)

通过预测匹配和对抗模态分类,使源域与目标域特征更难被区分。它缓解图像与事件的统计偏移。

DA损失中的LapsDA、LevDA和LmatchDA。

Affinity Graph KD(亲和图蒸馏)

以节点间余弦相似度构建局部图,并匹配教师与学生的空间关系。相比直接特征回归,它更适合异质模态。

公式(7)用于分割特征蒸馏。

mIoU(平均交并比)

各类别预测区域交集与并集之比的平均值,是语义分割常用指标。数值越高表示区域分类越准确。

DDD17和MVSEC的主要评测指标。

开放问题 这项研究留下的未解疑问

  • 1 论文尚未充分说明AG-KD、BMR、DA各组件的独立增益,也缺少完整超参数敏感性分析。
  • 2 E2VID没有真实标签,方法在不同事件传感器、天气和任务上的定量泛化仍待验证。
  • 3 生成器和对抗训练的能耗、收敛稳定性及实时部署成本尚未系统报告。

应用场景

近期应用

低照度自动驾驶

车辆可用事件流进行道路、车辆和植被分割,尤其适合夜间、逆光和APS过曝场景。部署需事件相机及预训练图像教师,训练阶段可使用无标注驾驶事件。

高速机器人视觉

机器人可用Sev捕捉快速移动物体和细小结构,减少运动模糊。完成蒸馏后仅运行事件学生,适合低延迟导航、抓取和工业检测。

远期愿景

跨传感器通用感知

未来可将BMR与时序模型、脉冲网络结合,使不同分辨率和事件协议的相机共享图像语义知识,推动全天候自动驾驶与无人机感知。

原文摘要

Event cameras sense per-pixel intensity changes and produce asynchronous event streams with high dynamic range and less motion blur, showing advantages over conventional cameras. A hurdle of training event-based models is the lack of large qualitative labeled data. Prior works learning end-tasks mostly rely on labeled or pseudo-labeled datasets obtained from the active pixel sensor (APS) frames; however, such datasets' quality is far from rivaling those based on the canonical images. In this paper, we propose a novel approach, called \textbf{EvDistill}, to learn a student network on the unlabeled and unpaired event data (target modality) via knowledge distillation (KD) from a teacher network trained with large-scale, labeled image data (source modality). To enable KD across the unpaired modalities, we first propose a bidirectional modality reconstruction (BMR) module to bridge both modalities and simultaneously exploit them to distill knowledge via the crafted pairs, causing no extra computation in the inference. The BMR is improved by the end-tasks and KD losses in an end-to-end manner. Second, we leverage the structural similarities of both modalities and adapt the knowledge by matching their distributions. Moreover, as most prior feature KD methods are uni-modality and less applicable to our problem, we propose to leverage an affinity graph KD loss to boost the distillation. Our extensive experiments on semantic segmentation and object recognition demonstrate that EvDistill achieves significantly better results than the prior works and KD with only events and APS frames.

cs.CV