Open-Vocabulary Semantic Segmentation with Mask-adapted CLIP

TL;DR

提出Mask-adapted CLIP,通过掩码区域微调提升开放词汇语义分割性能,达成29.6% mIoU。

cs.CV 🔴 高级 2022-10-09 38 次浏览
Feng Liang Bichen Wu Xiaoliang Dai Kunpeng Li Yinan Zhao Hang Zhang Peizhao Zhang Peter Vajda Diana Marculescu
计算机视觉 语义分割 多模态学习 预训练模型 掩码微调

核心发现

方法论

本文分析了两阶段开放词汇语义分割框架,发现预训练的CLIP模型在掩码区域表现不佳。通过从COCO Captions中采集掩码-类别对,利用弱监督匹配策略,收集了多样化的噪声数据集。采用掩码提示调优(mask prompt tuning)技术,将可学习的提示嵌入到CLIP的输入中,避免修改模型权重。全模型微调结合提示调优显著提升性能,最终在COCO训练集上,模型在ADE20K-150上达到了29.6%的mIoU,超越前沿8.5%。

关键结果

  • 在ADE20K-150数据集上,模型实现29.6%的mIoU,较之前最优方案提升8.5%。在ADE20K-847和Pascal Context-459上,分别达到9.0%和12.4%的mIoU,超越现有方法2.7%和3.4%。
  • 利用从COCO Captions中自动采集的多样化掩码-类别对,模型保持了良好的开放词汇泛化能力。掩码提示调优无需修改CLIP权重,适应多任务场景。

研究意义

本研究突破了预训练模型在掩码区域的适应瓶颈,实现了开源词汇语义分割的显著提升。模型无需特定数据集调优,即可在多样场景中实现与监督模型媲美的性能,为通用视觉理解提供新路径。其方法兼具高效性和泛化能力,有望推动多模态学习在实际应用中的广泛落地。

技术贡献

提出掩码提示调优(mask prompt tuning)技术,结合弱监督掩码-类别匹配策略,有效提升CLIP在掩码图像上的表现。通过全模型微调与提示调优结合,显著改善了两阶段方法的性能瓶颈。该方法无需修改CLIP原始权重,增强了多任务共享能力,为开源词汇语义分割设立新标杆。

新颖性

首次系统性地利用从图像描述中自动采集的噪声数据集,结合掩码提示调优技术,显著提升预训练模型在掩码区域的适应性。不同于传统的闭集标注或纯微调策略,本方法强调保持模型的泛化能力,突破了现有方法对数据集依赖的限制。

局限性

  • 当前模型在极端遮挡或复杂场景下仍存在性能下降,主要由于掩码生成与匹配的局限性。
  • 掩码提示调优虽无需修改模型权重,但在极少样本或类别偏少时效果有限。
  • 大规模噪声数据的采集与筛选仍需优化,以提升训练效率和模型鲁棒性。

未来方向

未来将探索更高效的掩码生成策略,结合自监督学习增强模型鲁棒性。同时,计划引入多模态信息融合,扩展至视频和三维场景理解,推动通用视觉AI的发展。

AI 总览摘要

本研究针对开放词汇语义分割中的性能瓶颈,提出了一种基于掩码适应的CLIP微调方法。传统两阶段方法依赖预训练模型在掩码区域的表现,受限于CLIP在掩码图像上的适应能力。作者通过从COCO Captions中自动采集噪声丰富的掩码-类别对,利用弱监督匹配策略,增强模型的泛化能力。为解决掩码区域中空白区域带来的域差异,提出掩码提示调优(mask prompt tuning),用可学习的提示替代零值掩码,显著提升模型性能。实验结果显示,在ADE20K-150数据集上,模型达到了29.6%的mIoU,超越前沿8.5%,在更复杂的场景中表现优异。这一方法无需修改CLIP原始权重,兼具多任务适应性,标志着开源词汇语义分割迈入新阶段。该研究不仅突破了模型泛化的限制,也为多模态视觉理解提供了新思路,未来有望在自动驾驶、机器人和智能监控等领域实现广泛应用。

深度分析

研究背景

语义分割作为计算机视觉的核心任务之一,经过深度学习的发展已取得显著进步。早期方法多依赖于固定类别的像素级标注,限制了模型的泛化能力。近年来,预训练模型如CLIP通过大规模图文数据学习到丰富的多模态特征,推动了开源词汇语义理解的发展。两阶段方法结合区域提议和预训练模型,已成为主流,但在掩码区域的表现仍受限。现有研究多关注闭集类别,缺乏对未知类别的泛化能力,且在掩码区域处理上存在域差异。本文基于此背景,旨在突破预训练模型在掩码图像上的性能瓶颈,推动通用视觉理解的边界。

核心问题

核心问题在于预训练的CLIP模型在掩码区域表现不佳,导致两阶段方法性能受限。掩码区域的空白和噪声区域与CLIP训练时的自然图像存在显著差异,造成域适应困难。此外,传统微调方法依赖于闭集标注,限制了模型的开放词汇能力。如何在保持模型泛化能力的同时,有效适应掩码区域,成为亟待解决的难题。该问题的解决对于实现真正的通用视觉理解具有重要意义,但技术难点在于如何利用丰富的图文描述信息,构建多样化的训练数据,以及设计高效的模型适应策略。

核心创新

本研究提出了掩码提示调优(mask prompt tuning),通过引入可学习的提示嵌入,缓解掩码区域中的域差异问题,避免修改CLIP原始权重。结合从图像描述中自动采集的噪声丰富的掩码-类别对,增强模型的开放词汇泛化能力。创新点包括:1)利用弱监督匹配策略自动采集多样化训练样本,突破闭集限制;2)设计掩码提示机制,有效利用空白区域信息;3)结合全模型微调与提示调优,提升性能同时保持多任务适应性。这些创新共同推动了开源词汇语义分割的性能极限。

方法详解

  • �� 采集数据:从COCO Captions中提取名词,利用预训练MaskFormer生成掩码区域,结合CLIP匹配图像区域与名词,自动构建噪声丰富的掩码-类别对。• 掩码微调:将掩码区域输入CLIP,使用可学习的提示嵌入替代空白区域的零值掩码,避免模型权重修改。• 全模型微调:在保持CLIP文本编码器冻结的基础上,微调图像编码器和掩码提示参数,提升掩码区域的识别能力。• 结合策略:将微调后的模型与原始MaskFormer结合,通过融合模块实现最终分割。• 训练细节:采用AdamW优化器,结合多尺度数据增强,训练120K轮,确保模型在多场景下的泛化能力。

实验设计

在COCO-Stuff和COCO Captions数据集上训练,评估在ADE20K、Pascal VOC和Pascal Context等公开数据集。采用mIoU作为主要指标,进行不同微调策略的对比,包括全模型微调、掩码提示调优及两者结合。通过消融实验验证噪声数据的贡献,以及提示调优对性能的提升。参数设置包括:学习率、批次大小、训练轮数等,确保模型在多任务环境中的鲁棒性。对比分析显示,掩码提示调优在保持模型泛化的同时,显著提升掩码区域分类准确率。

结果分析

模型在ADE20K-150上达29.6%的mIoU,超越前沿8.5%;在ADE20K-847和Pascal Context-459上分别实现9.0%和12.4%的新高,优于现有方法2.7%和3.4%。引入噪声丰富的图文匹配数据显著改善了模型的开放词汇能力。掩码提示调优无需修改CLIP权重,兼具多任务适应性。多场景测试验证了模型的强泛化能力,展现了在实际应用中的潜力。

应用场景

该方法可广泛应用于自动驾驶、智能监控、机器人感知等场景,实现无需大量标注的场景理解。通过利用图文描述,模型能识别未知类别,提升系统的适应性和智能水平。未来,结合视频和三维场景理解,有望推动全场景的通用视觉AI发展。

局限与展望

当前模型在极端遮挡和复杂背景下仍表现不足,主要受掩码生成和匹配的局限。噪声数据虽丰富,但在某些类别上仍存在偏差。模型训练成本较高,未来需优化采集策略和模型效率。

通俗解读 非专业人士也能看懂

想象你在一个工厂里,工人们每天都在组装不同的产品。有时候,工厂里会出现一些不完整的零件或被遮挡的部分,工人们需要根据描述判断这些零件属于什么。传统的方法就像是只认固定的零件类型,比如只认苹果或橙子,但遇到新零件就不知道了。现在,这个新方法像是给工人们提供了一个智能助手,它可以根据工厂的描述,自动学习识别各种不同的零件,即使是以前没见过的。这个助手通过不断学习不同的零件和描述,变得越来越聪明,甚至能在零件被遮挡或变形时,仍然准确识别。它还用一种特别的“提示”方式,帮助自己更好地理解那些被遮挡或空白的部分。最终,这个工厂的工人们可以更快、更准地完成任务,工厂也变得更智能、更高效。

简单解释 像给14岁少年讲一样

想象你在学校里,有一个超级聪明的朋友,他可以帮你认出任何你看到的东西。比如你看到一只奇怪的动物,他能告诉你那是只“狐狸”或者“猫”。以前,朋友只能认出一些常见的动物,但如果遇到新动物,他就不知道了。现在,这个新方法就像给朋友装上了一个超级大脑,让他可以通过听你描述的内容,学会认出各种新东西。比如你说“那是一只带有橙色毛发的动物”,朋友就会用这个信息,帮你认出那是只“橙色狐狸”。它还学会了在图片被遮挡或部分看不清时,依然能猜出是什么。这样一来,无论是图片里有遮挡,还是描述不完整,朋友都能帮你认出东西。这就像让普通的朋友变成了超级侦探,能认出各种新奇的东西,非常厉害!

原文摘要

Open-vocabulary semantic segmentation aims to segment an image into semantic regions according to text descriptions, which may not have been seen during training. Recent two-stage methods first generate class-agnostic mask proposals and then leverage pre-trained vision-language models, e.g., CLIP, to classify masked regions. We identify the performance bottleneck of this paradigm to be the pre-trained CLIP model, since it does not perform well on masked images. To address this, we propose to finetune CLIP on a collection of masked image regions and their corresponding text descriptions. We collect training data by mining an existing image-caption dataset (e.g., COCO Captions), using CLIP to match masked image regions to nouns in the image captions. Compared with the more precise and manually annotated segmentation labels with fixed classes (e.g., COCO-Stuff), we find our noisy but diverse dataset can better retain CLIP's generalization ability. Along with finetuning the entire model, we utilize the "blank" areas in masked images using a method we dub mask prompt tuning. Experiments demonstrate mask prompt tuning brings significant improvement without modifying any weights of CLIP, and it can further improve a fully finetuned model. In particular, when trained on COCO and evaluated on ADE20K-150, our best model achieves 29.6% mIoU, which is +8.5% higher than the previous state-of-the-art. For the first time, open-vocabulary generalist models match the performance of supervised specialist models in 2017 without dataset-specific adaptations.

cs.CV cs.LG