RbA: Segmenting Unknown Regions Rejected by All

TL;DR

本文提出RbA方法,通过区域级分类和“被所有类别拒绝”评分,有效检测未知区域,提升性能。

cs.CV 🔴 高级 2022-11-26 38 次浏览
Nazir Nayal Mısra Yavuz João F. Henriques Fatma Güney
语义分割 异常检测 区域分类 少 supervision 目标识别

核心发现

方法论

本文基于Mask2Former架构,利用区域级分类机制,分析对象查询的“类一对多”行为,提出RbA评分函数,将未知区域定义为被所有已知类别拒绝的事件。通过最小监督优化目标,增强未知区域检测能力。模型在Cityscapes、SMIYC等数据集上进行大量实验,验证了RbA在保持已知类别性能的同时,显著提升未知区域检测的准确率。核心在于利用掩码分类模型的空间平滑性和置信校准优势,将事件定义为所有已知类别的拒绝,从而降低边界和背景区域的误判率。

关键结果

  • 在SMIYC的异常轨道上,RbA实现了78.45%的AP,FPR降低至11.83%,比现有方法提升20%以上,显著改善未知区域检测效果。
  • 在Road Anomaly和Fishyscapes LaF数据集上,RbA的FPR分别降至6.92%和6.30%,同时保持在已知类别识别中的性能,无明显退化。
  • 通过少量合成外部异常数据的微调,RbA在多个场景中实现了优异的泛化能力,验证了其在实际应用中的潜力。

研究意义

该研究突破了传统像素级分类的局限,利用区域级掩码模型的空间平滑性和置信校准,提出新颖的拒绝事件定义,有效解决了边界模糊和背景噪声带来的误判问题。其无需大量外部异常数据,便能在保持已知类别性能的同时,显著提升未知区域检测能力,为自动驾驶、安防监控等领域的安全性提供了理论基础和实践方案。这一方法的提出,为未来开放集识别和异常检测提供了新的思路,推动了区域级语义理解的发展。

技术贡献

本文的核心技术创新在于将掩码分类模型的“类一对多”行为作为基础,定义出“被所有已知类别拒绝”的RbA评分函数,突破了像素级分类的局限。通过分析对象查询的行为特性,提出利用空间平滑性和置信校准,优化未知区域检测。引入少监督的微调策略,显著提升模型泛化能力。该方法兼容现有的掩码分类架构,且无需大量外部异常样本,极大降低了实际部署的成本和复杂度。

新颖性

本研究首次系统性地分析掩码分类模型中对象查询的“类一对多”行为,提出基于“被所有类别拒绝”的新颖外异常评分机制。不同于传统的最大概率或能量评分,RbA利用空间平滑性和模型的空间置信校准,有效降低边界和背景区域的误判,显著优于现有的异常检测方法。这一创新在保持已知类别识别性能的同时,极大改善了未知区域检测的准确性,填补了区域级语义理解在异常检测中的研究空白。

局限性

  • 该方法在极端复杂场景下仍可能受到遮挡或极小目标的影响,导致未知区域检测不够敏感。
  • 微调策略虽能提升泛化,但在极少监督情况下仍存在一定的性能波动,需进一步优化。
  • 模型对不同尺度和多类别复杂场景的适应性尚待验证,未来需结合多尺度特征增强鲁棒性。

未来方向

未来可结合多模态信息(如深度、雷达)进一步提升未知区域检测的鲁棒性。探索自监督和无监督学习策略,减少对少量外部异常样本的依赖。同时,结合动态场景理解和多任务学习,推动区域级语义理解在实际应用中的落地。还应研究模型在极端复杂环境中的表现,提升其泛化能力和实时性,为自动驾驶和智能监控提供更强的安全保障。

AI 总览摘要

随着自动驾驶和智能监控的快速发展,场景中的未知对象检测成为安全保障的关键环节。传统的语义分割模型依赖固定类别集,难以应对新颖或未标注的目标,导致误判和安全隐患。现有的异常检测方法多基于像素级分类,存在预测不平滑、边界模糊和误报率高的问题。本文提出一种基于掩码分类模型的区域级检测方法——RbA(Rejected by All),通过分析对象查询的“类一对多”行为,将未知区域定义为被所有已知类别拒绝的事件,从而实现更平滑、更准确的未知区域识别。实验结果显示,RbA在Cityscapes、SMIYC等多个公开数据集上均优于现有方法,不仅提升了未知区域检测的准确性,还保持了已知类别的识别性能。该方法无需大量外部异常样本,利用少量合成数据进行微调,展现出良好的泛化能力。其核心创新在于利用掩码模型的空间平滑性和置信校准优势,提出新颖的拒绝事件定义,为未来开放集识别提供了新的思路。未来,结合多模态信息和自监督学习,有望进一步推动该领域的发展,提升自动驾驶和智能监控系统的安全性。

深度分析

研究背景

语义分割技术经历了从像素级卷积网络到Transformer架构的演变,代表性工作包括FCN、DeepLab、MaskFormer等。尽管在封闭类别集上取得了显著成功,但在开放集环境中,模型常因过度自信而误判未知目标,导致安全风险。异常检测方法逐渐兴起,结合贝叶斯、能量评分等技术,但多依赖像素级分类,预测不平滑、边界模糊问题严重。近年来,区域级掩码模型如Mask2Former展现出空间平滑和置信校准优势,为未知区域检测提供新可能。

核心问题

现有方法在未知目标检测中存在预测不平滑、误报率高、边界模糊等问题。像素级分类的局限性导致模型在复杂场景中难以区分未知目标与背景,尤其在边界区域易产生误判。此外,依赖大量外部异常样本进行训练,成本高且泛化能力有限。如何利用区域级模型的空间平滑性,设计更鲁棒的未知区域检测机制,成为亟待解决的核心难题。

核心创新

提出RbA(Rejected by All)评分机制,基于掩码模型中对象查询的“类一对多”行为,将未知区域定义为被所有已知类别拒绝的事件,突破像素级分类的限制。利用空间平滑性和置信校准,降低边界和背景误判。引入少监督微调策略,结合合成外部异常数据,增强模型泛化能力。这一创新在保持已知类别性能的基础上,大幅提升未知区域检测的准确性,为区域级语义理解开辟新路径。

方法详解

  • �� 构建在Mask2Former架构基础上,利用区域级掩码预测和对象查询机制。
  • �� 分析对象查询的“类一对多”行为,发现其表现出类似多个独立二分类器的特性。
  • �� 定义RbA评分,将未知区域视为被所有已知类别拒绝的事件,计算公式为:RbA(x) = -∑σ(Lk(x)),其中σ为激活函数,Lk(x)为类别k的对数it。
  • �� 设计少监督的微调目标,通过合成异常样本优化RbA评分,提升未知区域检测能力。
  • �� 结合空间平滑性和置信校准,降低边界和背景误判,改善检测效果。

实验设计

  • �� 在Cityscapes训练,使用Swin-B作为骨架,单层Transformer解码器。
  • �� 在SMIYC、Road Anomaly和Fishyscapes等数据集上进行评估,比较FPR、AP、sIoU等指标。
  • �� 采用少量合成异常样本进行微调,验证模型泛化。
  • �� 进行消融实验,分析不同评分机制和微调策略的效果。

结果分析

  • �� 在SMIYC异常轨道,AP达78.45%,FPR降至11.83%,优于现有方法20%以上。
  • �� 在Road Anomaly和Fishyscapes LaF上,FPR分别为6.92%和6.30%,保持已知类别识别性能。
  • �� 微调后,模型在多场景中表现出良好的泛化能力,验证了其实用性。

应用场景

  • �� 自动驾驶:实时检测未知障碍物,提升行车安全。
  • �� 智能监控:识别异常行为或未标注对象,增强安全监控能力。

局限与展望

  • �� 在极端复杂环境中,遮挡或极小目标仍可能导致误判。
  • �� 微调策略依赖合成样本,可能在某些场景下表现不稳定。
  • �� 多尺度、多类别场景的适应性有待进一步验证。

通俗解读 非专业人士也能看懂

想象你在厨房做饭,菜谱上写了几种常见菜,但有时候会遇到一些没有写在菜谱上的奇怪食材。普通的厨师只知道那些菜,但面对新奇食材时可能会误判或忽略。现在,假设你用一种特别的厨具,可以识别每一种食材是否属于已知的菜系,或者是新奇的。这个厨具会根据每个食材的特征,判断它是不是“被所有菜系拒绝”的新食材。这样一来,你就能更准确地发现未知的食材,避免误用或遗漏。这个方法就像论文中的RbA,用区域级的识别机制,判断未知区域是否被所有已知类别拒绝,从而更好地识别新奇目标。

简单解释 像给14岁少年讲一样

想象你在学校里玩一个游戏,老师给你几种已知的宝藏(比如金子、宝石、金币),但有时候会出现一些新奇的宝藏。普通的游戏规则只认这些已知宝藏,遇到新宝藏时可能会误判成已知的。现在,假设你有一个神奇的检测器,它可以告诉你这个宝藏是不是“被所有已知宝藏拒绝”的,也就是说,它确认这个宝藏不属于任何已知类别。这样一来,你就能更准确地找到那些新奇的宝藏,不会把它们误判成已知的。论文里的方法也是一样,它用一种区域级的检测方式,判断某个区域是不是“被所有已知类别拒绝”,从而更好地发现未知的目标。这让自动驾驶汽车或监控系统变得更聪明、更安全,因为它们能更好地识别出新出现的危险或异常。

术语表

掩码分类 (Mask Classification)

一种将图像区域划分为不同掩码的技术,用于目标检测和语义理解,区别于像素级分类。

本文基于Mask2Former模型,利用掩码分类实现区域级目标识别。

对象查询 (Object Queries)

在Transformer架构中,用于引导模型关注特定目标的可学习向量,帮助实现目标区域的预测。

分析对象查询的“类一对多”行为,提出RbA评分机制。

RbA (Rejected by All)

一种基于区域的异常评分机制,定义为区域被所有已知类别拒绝的概率,提升未知目标检测。

核心创新,用于区分已知和未知区域。

区域级分类 (Region-level Classification)

将图像划分为多个区域,分别进行类别判定,增强空间平滑性和置信校准。

替代像素级分类,改善未知目标检测。

少监督微调 (Minimal Supervision Fine-tuning)

只用少量合成异常样本,微调模型部分参数以提升泛化能力。

验证模型在多场景中的应用潜力。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端复杂环境中保持高精度的未知区域检测仍是挑战,尤其在遮挡和极小目标场景下,模型的鲁棒性有待提升。未来需要结合多模态信息和更强的自监督机制,以实现更全面的场景理解和安全保障。

应用场景

近期应用

自动驾驶安全系统

利用RbA实时检测未知障碍物,提升自动驾驶在复杂环境中的安全性,减少误判和漏检。

智能监控预警

在安防系统中识别未标注的异常行为或目标,增强监控的智能化水平。

远期愿景

全场景自主感知

结合多模态数据,实现对各种未知目标的全面感知,推动自动驾驶和机器人自主导航的普及。

原文摘要

Standard semantic segmentation models owe their success to curated datasets with a fixed set of semantic categories, without contemplating the possibility of identifying unknown objects from novel categories. Existing methods in outlier detection suffer from a lack of smoothness and objectness in their predictions, due to limitations of the per-pixel classification paradigm. Furthermore, additional training for detecting outliers harms the performance of known classes. In this paper, we explore another paradigm with region-level classification to better segment unknown objects. We show that the object queries in mask classification tend to behave like one \vs all classifiers. Based on this finding, we propose a novel outlier scoring function called RbA by defining the event of being an outlier as being rejected by all known classes. Our extensive experiments show that mask classification improves the performance of the existing outlier detection methods, and the best results are achieved with the proposed RbA. We also propose an objective to optimize RbA using minimal outlier supervision. Further fine-tuning with outliers improves the unknown performance, and unlike previous methods, it does not degrade the inlier performance.

cs.CV