Incremental Learning Techniques for Semantic Segmentation

TL;DR

提出输出与特征蒸馏及冻结编码器,在VOC上将增量分割mIoU提升至71.6%。

cs.CV 🟡 进阶级 2019-07-31 23 次浏览
Umberto Michieli Pietro Zanuttigh
增量学习 语义分割 知识蒸馏 灾难性遗忘 Pascal VOC2012

核心发现

方法论

论文将增量学习正式扩展到像素级语义分割。第k步加载旧模型Mₖ₋₁,用交叉熵LCE学习新旧类别,并以L=LCE+λDLD约束旧知识。作者比较输出蒸馏L′D、编码器冻结EF和中间特征L2蒸馏L″D,均不保存旧图像,仅依赖上一阶段模型。

关键结果

  • 在Pascal VOC2012增量加入tv/monitor时,直接微调mIoU仅65.1%,新类IoU为20.1%;输出蒸馏升至68.4%,冻结编码器加输出蒸馏达71.5%,特征蒸馏达71.6%,接近一次性训练的73.6%。
  • 一次加入最后5类时,输出蒸馏取得mIoU 68.5%,明显优于微调的38.7%;逐类加入5类时,EF+L′D达到75.2%,比微调55.7%高约20个百分点。
  • 消融显示冻结编码器本身可将单类增量mIoU提高5.4个百分点,输出蒸馏单独提高3.3个百分点;组合后为71.5%,说明表示稳定性与输出约束具有互补性。

研究意义

该工作回应了机器人、自动驾驶等系统持续接收新数据却无法保存旧数据的现实需求。与分类不同,分割图像同时包含新旧类别,旧类出现频率又受场景分布影响,因此遗忘更复杂。论文证明只保存最后模型即可维持相当高的旧类精度,为隐私受限、存储受限的视觉系统提供了可实施基线。

技术贡献

核心贡献是把知识蒸馏重构为密集预测形式:在像素位置上对旧类别使用旧模型softmax分布计算掩码交叉熵,并提出对编码器中间表示施加L2约束。与此同时,冻结DeepLab v2的ResNet-101编码器,允许解码器适应新类。该设计不需要样本回放、生成模型或历史模型集合,结构简单且可插入不同分割网络。

新颖性

论文据作者所知首次在标准Pascal VOC2012上研究不保存旧图像的通用增量语义分割。相比分类与检测中的蒸馏方法,以及依赖旧图像块的卫星分割工作,它处理的是多类别共存的密集标签,并同时探索输出空间和中间特征空间的保持机制。

局限性

  • 实验仅覆盖Pascal VOC2012、DeepLab v2和固定类别顺序,尚未证明方法在更大规模数据、域变化或长期多步增量中的稳定性。
  • 蒸馏依赖新图像中旧类的视觉分布;若新旧类别严重不相关,旧类缺少代表性像素,模型仍可能遗忘,且类别混淆会放大误差。
  • 论文未系统研究λD、类别不平衡校正及不同网络结构,组合两种蒸馏也未带来明显额外收益。

未来方向

后续可在Cityscapes、ADE20K等大规模数据上测试更多增量顺序,加入类别均衡、伪标签、域适应和不确定性估计。还应比较轻量化编码器、Transformer分割器及多阶段累计误差,并建立同时衡量新类学习、旧类保持和计算成本的统一协议。

AI 总览摘要

当视觉系统不断接收新类别时,普通深度网络往往会“学新忘旧”。语义分割比图像分类更棘手:一张图中可能同时出现新旧物体,而增量数据通常偏向新类别。直接微调因此会产生大量误报,旧知识迅速崩塌。

Michieli与Zanuttigh提出一种无需保存旧图像的增量分割框架。模型在每一步使用交叉熵学习新旧标签,同时从上一模型提取旧类别知识:输出蒸馏L′D约束像素级softmax分布,特征蒸馏L″D用L2距离保持编码器表示,另可冻结ResNet-101编码器,仅更新解码器。总损失为L=LCE+λDLD。

在Pascal VOC2012上,加入tv/monitor时,微调mIoU为65.1%,而冻结编码器加输出蒸馏达71.5%,中间特征蒸馏达71.6%;一次加入5类时,蒸馏达到68.5%,微调仅38.7%;逐类加入5类时,组合方法为75.2%,比微调55.7%高约20个百分点。结果表明,模型快照本身可以成为压缩的知识载体,但性能仍受类别相关性、数据规模和增量顺序限制。

深度分析

研究背景

灾难性遗忘长期存在于神经网络。Progressive Networks等结构扩展方法、冻结或减慢部分参数的方法,以及Learning without Forgetting等知识蒸馏方法,主要服务于分类和检测。旧样本回放可改善保持率,却带来隐私与存储问题;卫星分割工作还依赖图像块和二元分类。通用、多类别共存且不保存旧数据的密集分割仍缺乏标准方案。

核心问题

设初始类别集为S₀,第k步加入Uk,模型从Sk₋₁扩展到Sk。新训练集只含当前新类及偶然出现的旧类,且与旧训练集不重叠。由于新类像素占比更高,交叉熵梯度偏向新类,导致旧类被新类或背景取代。系统必须同时提升新类IoU,并让旧类性能接近增量前水平。

核心创新

第一,定义了适用于密集像素标签的增量学习设置。第二,提出输出层蒸馏L′D,在旧类上匹配旧模型softmax概率。第三,提出中间特征蒸馏L″D,以编码器特征L2距离保持表示。第四,研究冻结编码器EF,限制新知识主要由解码器吸收。方法不存储旧图像,也不需GAN或多个历史快照。

方法详解

  • �� 初始阶段:用Pascal VOC2012的Dtr₀训练DeepLab v2,主干为COCO预训练ResNet-101,得到M₀。
  • �� 增量输入:第k步载入冻结的Mₖ₋₁,训练包含Uk且可能含Sk₋₁像素的新图像。
  • �� 监督学习:对新旧类别计算LCE=−|D|⁻¹ΣY[c]logMₖ(X)[c]。
  • �� 输出蒸馏:L′D=−|D|⁻¹ΣMₖ₋₁(X)[c]logMₖ(X)[c],只累加旧类c。
  • �� 特征蒸馏:L″D=||Eₖ₋₁(X)−Eₖ(X)||²₂/|D|。
  • �� 优化:SGD、批量4、权重衰减10⁻⁴;初始学习率10⁻⁴,增量阶段5×10⁻⁵,均多项式衰减至10⁻⁶。

实验设计

数据为VOC2012训练集10582张、验证集1449张,含21类(含背景)。指标包括每类IoU、mPA、mCA和mIoU。实验设置包括加入最后1类tv/monitor、一次加入最后5类,以及将5类逐个加入。基线为直接微调;参考上限是所有21类一次性训练。作者比较L′D、L″D、EF及其组合,并报告约5小时的2080 Ti训练成本。

结果分析

单类增量中,微调65.1% mIoU且tv/monitor IoU仅20.1%;L′D为68.4%,EF为70.5%,EF+L′D为71.5%,L″D为71.6%,一次性训练为73.6%。五类同时加入时,微调38.7%,L′D为68.5%。五类顺序加入时,微调55.7%,EF+L′D为75.2%。冻结编码器与蒸馏分别提供正则化,组合通常最稳健。

应用场景

机器人、自动驾驶、移动测绘和工业视觉可在不上传或保存历史图像的情况下更新类别。部署前需有旧模型、新类别标注数据和可分解的编码器—解码器结构;若新场景仍包含旧目标,输出蒸馏尤其适用。隐私法规、边缘设备存储限制和持续感知任务是直接受益场景。

局限与展望

方法假设新数据至少包含新类,且旧类可能以相关场景形式出现;若分布变化大或旧类完全缺席,蒸馏监督会变弱。DeepLab v2、VOC类别规模和固定字母顺序不足以代表长期工业部署。训练仍需完整新数据和反向传播,λD选择未充分分析;未来应引入类别均衡、域适应、伪标签及更大规模多步评测。

通俗解读 非专业人士也能看懂

把模型想成一位负责给照片中每个像素贴标签的仓库管理员。最开始,他认识背景、汽车、猫等20类。后来公司要求他再认识电视。如果只给他看含电视的新照片并重新训练,他会把许多旧物品也误认为电视,因为最近的训练任务声音最大,这就是“学新忘旧”。

论文给管理员两张参考表。第一张是旧管理员留下的答案分布:即使旧照片没有保存,新照片中每个位置的旧类别判断仍可由旧模型给出,新管理员要尽量保持这些判断。第二张是旧管理员在仓库流程中形成的中间记录,新管理员也不能随意改变。还可以直接保留负责看图的前半部分,只训练负责贴标签的后半部分。

在VOC2012上,加电视类时,普通重训mIoU只有65.1%;使用特征保持达到71.6%,而所有类别一次训练是73.6%。逐步加入五类时,最佳方法达到75.2%,普通方法只有55.7%。这说明旧模型像一份压缩的工作经验,能帮助新模型学习而无需保留隐私照片。

简单解释 像给14岁少年讲一样

想象你在玩一个不断更新的游戏。第一季你学会识别20种怪物,第二季加入电视怪物。你如果只练第二季,可能会把椅子、马甚至背景都认成新怪物——因为游戏经验被新训练覆盖了!这就是神经网络的灾难性遗忘。

这篇论文的方法像让新玩家带着旧玩家的“攻略录像”练习。旧玩家不必把所有截图交出来,只要保留一个会判断的旧模型。新玩家看到新关卡时,一边学习新怪物,一边检查自己对旧怪物的判断有没有偏离。还可以锁住观察世界的能力,只更新最后的分类部分。

研究者在Pascal VOC2012上测试。只加入tv/monitor时,普通方法mIoU为65.1%,中间特征保持达到71.6%;一次加入5类时,普通方法只有38.7%,输出蒸馏达到68.5%。如果5类逐个加入,冻结观察部分并使用蒸馏达到75.2%,比普通方法55.7%高很多!

不过它也不是魔法。如果新关卡完全没有旧怪物,模型得到的旧信息会变少;如果游戏地图突然换风格,也可能失效。未来可以在更大的城市驾驶数据上测试,让模型学得更久、更稳,还要控制训练时间和存储量。

术语表

Semantic Segmentation(语义分割)

为图像中的每个像素指定语义类别,而不是只给整张图一个标签。它能同时描述同一图像中的多个物体。

论文研究的目标任务。

Incremental Learning(增量学习)

模型连续学习新类别或任务,同时尽量保持旧知识。其主要风险是灾难性遗忘。

论文将其形式化到像素级分割。

Knowledge Distillation(知识蒸馏)

让新模型模仿旧模型的输出或内部表示,以保留旧能力。这里不需要旧图像。

通过L′D和L″D实现。

Catastrophic Forgetting(灾难性遗忘)

学习新数据后,模型在旧类别上的性能显著下降。新类偏置和数据不平衡是重要原因。

直接微调的主要失败机制。

Intersection over Union(交并比,IoU)

预测区域与真实区域交集除以并集,是分割的类别级准确率指标。mIoU是各类IoU的平均值。

论文的核心评价指标。

开放问题 这项研究留下的未解疑问

  • 1 在长期、多阶段增量中,蒸馏误差会逐步累积吗?VOC实验只覆盖有限顺序,尚不能回答模型快照是否能永久保存全部旧知识。
  • 2 当新旧类别来自不同摄像机或城市时,旧类像素分布可能完全缺席。需要结合域适应、伪标签或不确定性建模验证鲁棒性。

应用场景

近期应用

边缘机器人视觉更新

机器人可保存旧DeepLab模型,在新环境标注少量新增目标后执行增量训练;无需回传历史图像,适合带宽、存储或隐私受限的设备。

自动驾驶类别扩展

车队可逐步加入施工标志、特殊车辆等类别,同时用输出蒸馏保持行人和道路识别。部署前需有新类标注数据及可更新的编码器—解码器模型。

远期愿景

持续学习城市感知系统

未来系统可随季节、地点和交通规则持续扩展分割词汇,模型快照作为压缩记忆。主要障碍是域变化、误差累积、类别均衡和严格安全评测。

原文摘要

Deep learning architectures exhibit a critical drop of performance due to catastrophic forgetting when they are required to incrementally learn new tasks. Contemporary incremental learning frameworks focus on image classification and object detection while in this work we formally introduce the incremental learning problem for semantic segmentation in which a pixel-wise labeling is considered. To tackle this task we propose to distill the knowledge of the previous model to retain the information about previously learned classes, whilst updating the current model to learn the new ones. We propose various approaches working both on the output logits and on intermediate features. In opposition to some recent frameworks, we do not store any image from previously learned classes and only the last model is needed to preserve high accuracy on these classes. The experimental evaluation on the Pascal VOC2012 dataset shows the effectiveness of the proposed approaches.

cs.CV cs.LG eess.IV