Open-vocabulary Object Detection via Vision and Language Knowledge Distillation

TL;DR

ViLD通过视觉和语言知识蒸馏,实现了基于文本描述的开放词汇目标检测,达成16.1 mask AP_r。

cs.CV 🔴 高级 2021-04-29 47 次浏览
Xiuye Gu Tsung-Yi Lin Weicheng Kuo Yin Cui
目标检测 知识蒸馏 开放词汇 视觉-语言模型 深度学习

核心发现

方法论

本文提出ViLD方法,结合预训练的开源视觉-语言模型(如CLIP)进行知识蒸馏,将文本和图像嵌入引入两阶段检测器。具体流程包括:用教师模型编码类别文本和候选区域,训练检测器的区域嵌入与教师嵌入对齐。采用ViLD-text利用类别文本的编码进行分类,ViLD-image通过预计算的图像嵌入进行区域特征蒸馏。结合两者,提升模型对未见类别的检测能力。训练过程中,采用交叉熵和L1损失,优化区域嵌入的表达能力。最终模型在LVIS数据集上,hold out所有稀有类别,获得16.1的mask AP_r,超越有监督方法3.8,使用ALIGN教师模型时,AP_r提升至26.3。模型还可迁移至PASCAL VOC、COCO等数据集,表现优异。

关键结果

  • 在LVIS上,ViLD以ResNet-50骨架实现16.1 mask AP_r,超越有监督模型3.8,使用ALIGN教师模型时达26.3,接近LVIS挑战赛冠军水平。
  • 迁移测试显示,ViLD在PASCAL VOC达72.2 AP50,COCO达36.6 AP,Objects365达11.8 AP,无需微调即可实现跨数据集良好性能。
  • 在COCO上,ViLD超越先前SOTA方法Zareian等2021的性能,novel AP提升4.8,总体AP提升11.4,验证了其强泛化能力。

研究意义

该研究突破了目标检测中类别标注依赖的瓶颈,利用丰富的互联网图像-文本对进行知识迁移,有效扩展检测词汇,推动零样本和开放词汇检测的发展。其技术方案兼具高效性和迁移性,为实际应用中的多类别识别提供了新思路,特别适用于场景多变、类别不断扩展的工业和科研需求。

技术贡献

核心技术在于引入基于预训练模型(如CLIP、ALIGN)的知识蒸馏机制,将文本和图像嵌入同时引入目标检测训练中,实现区域特征与多模态语义空间的对齐。提出ViLD-Text和ViLD-Image两种蒸馏策略,结合交叉熵和L1损失,提升模型对未见类别的泛化能力。模型架构灵活,可结合不同教师模型,显著优于传统有监督检测方法,尤其在稀有类别检测中表现突出。

新颖性

首次将大规模预训练的视觉-语言模型应用于目标检测的知识蒸馏,突破了类别标注依赖,提出多模态嵌入对齐机制,显著提升开放词汇检测性能。这在目标检测领域尚属首次实现大规模类别的零样本检测,推动了视觉识别从封闭类别向开放类别的转变。

局限性

  • 模型在极端类别偏少或样本极不平衡的场景下仍表现有限,尤其是对极稀有类别的检测能力受限。
  • 推理速度较慢,因每个候选区域需单独计算图像和文本嵌入,影响实时应用。
  • 对预训练模型依赖较大,若教师模型性能下降,整体效果也会受影响。

未来方向

未来可探索更高效的推理架构,减少计算成本;结合自监督学习提升对极少样本类别的检测能力;扩展多模态信息融合,增强模型对复杂场景的理解能力。同时,推动模型在实际场景中的部署和优化,解决实际应用中的实时性和鲁棒性问题。

AI 总览摘要

目标检测作为计算机视觉的核心任务,传统方法依赖大量类别标注,难以应对类别扩展和零样本识别的需求。随着互联网图像-文本对的丰富,如何利用这些资源实现开放词汇检测成为研究热点。本文提出ViLD,通过知识蒸馏技术,将预训练的开源视觉-语言模型(如CLIP和ALIGN)中的多模态语义信息引入目标检测框架。

ViLD的核心思想是用教师模型编码类别文本和候选区域的图像特征,将其作为目标检测的监督信号。具体实现包括:用文本编码器生成类别文本的嵌入,用图像编码器提取候选区域的特征,并通过对齐机制训练检测器的区域嵌入,使其与教师模型的多模态空间保持一致。模型同时结合ViLD-text和ViLD-image两种蒸馏策略,提升对未见类别的识别能力。

在LVIS数据集上,ViLD在hold out所有稀有类别时,达到了16.1的mask AP_r,超越有监督方法3.8。使用更强的ALIGN教师模型时,性能提升至26.3,显示出极强的泛化能力。迁移测试中,模型在PASCAL VOC、COCO和Objects365上表现优异,无需微调即可实现良好的检测效果,验证了其跨域适应性。

该研究不仅推动了开放词汇目标检测的发展,也为未来利用大规模预训练模型进行多任务、多模态学习提供了新思路。其技术方案兼具高效性和扩展性,为多类别识别在实际场景中的应用奠定了基础。未来,模型在推理速度、极少样本类别识别和多模态融合方面仍有提升空间,值得持续探索。

深度解读

原文摘要

We aim at advancing open-vocabulary object detection, which detects objects described by arbitrary text inputs. The fundamental challenge is the availability of training data. It is costly to further scale up the number of classes contained in existing object detection datasets. To overcome this challenge, we propose ViLD, a training method via Vision and Language knowledge Distillation. Our method distills the knowledge from a pretrained open-vocabulary image classification model (teacher) into a two-stage detector (student). Specifically, we use the teacher model to encode category texts and image regions of object proposals. Then we train a student detector, whose region embeddings of detected boxes are aligned with the text and image embeddings inferred by the teacher. We benchmark on LVIS by holding out all rare categories as novel categories that are not seen during training. ViLD obtains 16.1 mask AP$_r$ with a ResNet-50 backbone, even outperforming the supervised counterpart by 3.8. When trained with a stronger teacher model ALIGN, ViLD achieves 26.3 AP$_r$. The model can directly transfer to other datasets without finetuning, achieving 72.2 AP$_{50}$ on PASCAL VOC, 36.6 AP on COCO and 11.8 AP on Objects365. On COCO, ViLD outperforms the previous state-of-the-art by 4.8 on novel AP and 11.4 on overall AP. Code and demo are open-sourced at https://github.com/tensorflow/tpu/tree/master/models/official/detection/projects/vild.

cs.CV cs.AI cs.LG