Natural Adversarial Examples

TL;DR

用对抗过滤构建ImageNet-A/O;DenseNet-121在A上仅约2%,OOD检测近随机。

cs.LG 🟡 进阶级 2019-07-17 27 次浏览
Dan Hendrycks Kevin Zhao Steven Basart Jacob Steinhardt Dawn Song
自然对抗样本 ImageNet-A ImageNet-O 分布偏移 OOD检测

核心发现

方法论

论文提出对抗过滤(adversarial filtration):从iNaturalist、Flickr、DuckDuckGo或ImageNet-22K收集候选图像,用ResNet-50及10-crop分类筛除易样本,再人工保留清晰、单标签且能诱发错误的图像。ImageNet-A保留200个ImageNet-1K类别中的困难样本;ImageNet-O则选择不属于ImageNet-1K、却被高置信度预测为已知类别的异常样本。

关键结果

  • ImageNet-A含7,500张图像,DenseNet-121准确率约2%,相较普通ImageNet图像约90%以上的准确率下降约90个百分点;AlexNet、SqueezeNet、VGG-19、ResNet-50等未参与过滤的架构也显著失败。
  • ImageNet-O含2,000张OOD图像,使用负最大softmax概率作为异常分数时,随机AUPR约16.67%;ResNet-50约16.20%,接近随机,说明模型会把未知概念误判为高置信度已知类别。
  • 增强方法收益有限:ResNet-50基线为2.17%,对抗训练降至1.68%,AugMix为3.8%、Cutout为4.4%、MoEx为5.5%、Mixup为6.6%、CutMix为7.3%;ImageNet-21K预训练后升至11.41%。

研究意义

研究表明,干净、自然、未经像素扰动的图像同样能够稳定击穿多种视觉模型。ImageNet-A揭示了标准测试集可能高估泛化能力,ImageNet-O则暴露了OOD检测在语义标签偏移下的脆弱性。论文把“模型是否真正理解对象”从抽象讨论转化为可复现实验基准,对安全视觉系统、医学影像和自动驾驶具有直接警示意义。

技术贡献

技术上,论文首次将对抗过滤系统用于图像数据集构建,并将其从“移除最容易样本”改为“集中选择最难样本”。通过固定ResNet-50过滤、第二轮限制重复混淆不超过15次及人工复核,得到错误密集且类别明确的数据集。ImageNet-O还将ImageNet-22K中非ImageNet-1K概念作为近分布异常源,避免传统OOD基准使用纹理、场景或噪声造成的过大域差异。

新颖性

相较L_p扰动、ImageNet-C腐蚀和ImageNetV2,本文使用真实世界、未修改图像,并证明错误可跨模型族迁移。ImageNet-A是面向分类分布偏移的自然对抗基准;ImageNet-O据作者所知是首个专为ImageNet模型构建的OOD检测数据集。

局限性

  • 数据集主要覆盖200个ImageNet-1K类别,且依赖研究生数月人工筛选,规模、类别覆盖和标注成本限制了自动扩展。
  • 过滤器基于ResNet-50,样本分布可能偏向其盲点;虽然能迁移到多种模型,但不能保证覆盖视觉Transformer或多模态模型。
  • ImageNet-O若允许使用ImageNet-22K训练会变得简单,因此其评估假设模型仅使用ImageNet-1K数据。

未来方向

未来应扩大类别和场景覆盖,研究针对视觉Transformer、多模态模型及真实视频的自然对抗集;同时结合形状偏置、因果表示、校准和不确定性建模。自动化人类复核、动态过滤器集成,以及按失效模式进行训练,可能比单纯增加数据或增强更有效。

AI 总览摘要

现代视觉模型在ImageNet上接近人类甚至被称为“超人类”,但这种成功可能建立在简单背景、纹理和构图线索之上。Hendrycks等人提出的核心问题是:当测试图像仍然清晰、自然,却来自更长尾的真实场景时,模型是否仍然可靠?

作者提出对抗过滤(adversarial filtration),用ResNet-50的10-crop预测删除容易识别的候选图像,再进行混淆多样性控制和人工审核。由此构建ImageNet-A与ImageNet-O:前者包含属于ImageNet类别但难以分类的7,500张自然图像,后者包含不属于ImageNet-1K、却被模型高置信度误认的2,000张异常图像。ImageNet-A与ImageNet常规测试集的FID分别约为50.25和50.40,显示分布差异显著;但研究生的人类准确率约90%。

结果极具冲击力:DenseNet-121在ImageNet-A上仅约2%,普通200类ImageNet图像上通常超过90%;OOD检测AUPR约16.20%,接近16.67%的随机水平。AugMix、Cutout、MoEx、Mixup和CutMix最高只将准确率提升至7.3%,对抗训练反而降至1.68%;ImageNet-21K预训练可提升至11.41%。这些发现说明模型共享背景依赖、纹理偏置和概念过度泛化等盲点,而架构改进可能比常规增强更有希望。

深度分析

研究背景

ImageNet推动了分类、检测和分割的发展,但标准测试集往往图像清晰、主体突出。Recht等人的ImageNetV2显示测试分布问题,Geirhos等人进一步指出模型偏好纹理而非形状;ImageNet-C则研究算法腐蚀。本文关注另一类更真实的挑战:自然图像本身未被修改,却因长尾场景和伪线索导致系统性错误。

核心问题

核心问题有二:第一,分类器能否识别分布偏移下仍属于已知类别的对象;第二,OOD检测器能否把语义上未知、但视觉上接近已知分布的图像判为异常。传统基准常用Places365、SUN、纹理集或噪声,域差异过大,容易高估检测能力。

核心创新

  • �� 首次将对抗过滤用于视觉数据集构建。
  • �� ImageNet-A专门选择人类清楚、模型困难的200类样本。
  • �� ImageNet-O从ImageNet-22K移除ImageNet-1K后筛选高置信度误判异常。
  • �� 通过混淆次数上限15次提高错误多样性。
  • �� 用真实图像测试跨架构迁移,而非依赖L_p像素扰动。

方法详解

  • �� 输入:iNaturalist、Flickr、DuckDuckGo中的200类候选图像,或ImageNet-22K非ImageNet-1K图像。
  • �� 过滤:两个ResNet-50分类器执行10-crop预测;正确分类或正确类置信度超过15%的ImageNet-A样本被删除。
  • �� OOD筛选:以负最大softmax概率为异常分数,保留被高置信度预测为ImageNet-1K类别的样本。
  • �� 多样化:限制任一类别混淆最多出现15次。
  • �� 质检:研究生人工确认单标签、清晰度和语义有效性,最终得到7,500张A和2,000张O。

实验设计

实验比较AlexNet、SqueezeNet、VGG-19、DenseNet-121和ResNet-50。分类指标为ImageNet-A top-1 accuracy;OOD指标为AUPR,随机水平约16.67%。改进实验固定ResNet-50架构,测试对抗训练、Style Transfer、AugMix、Cutout、MoEx、Mixup、CutMix,以及Places365和ImageNet-21K预训练。

结果分析

DenseNet-121在ImageNet-A上约2%,显示约90个百分点的巨大跌落;多种未参与过滤的模型同样失败,说明盲点具有跨架构共享性。ResNet-50基线为2.17%,CutMix最高7.3%,而对抗训练仅1.68%。Places365微调为1.56%;ImageNet-21K预训练升至11.41%,OOD AUPR从16.20%升至21.86%,但仍不可靠。

应用场景

ImageNet-A可用于发布前压力测试,尤其适合自动驾驶、机器人、安防和医学视觉系统。ImageNet-O可评估模型遇到未知物体时是否拒答,而不是给出危险的高置信度答案。实际部署需要额外的开放集验证、人工复核、置信度校准和持续收集长尾样本。

局限与展望

数据集依赖ResNet-50过滤和人工选择,可能遗漏其他模型的独特失效模式;200类子集也不能代表完整视觉世界。ImageNet-O还要求训练数据不包含ImageNet-22K,否则任务会被削弱。未来应扩展到更大类别、视频和视觉语言模型,并系统研究形状、因果特征与架构设计对鲁棒性的作用。

通俗解读 非专业人士也能看懂

把模型想成一个看过大量商品照片的仓库管理员。平时商品摆放整齐、背景固定,他能快速判断“这是鞋”或“这是苹果”。但如果鞋沾满泥、苹果出现在奇怪的货架上,管理员可能只看背景颜色或熟悉的摆放方式,于是把鞋认成别的东西。论文没有给照片加噪声,也没有偷偷改像素,而是从真实网站找来更少见、更复杂的照片,再用模型筛掉容易判断的部分。

ImageNet-A就像一场“困难商品识别考试”:答案仍是管理员学过的类别,但照片更像现实世界。人类大约能答对90%,DenseNet-121却只有约2%。ImageNet-O则像把管理员没见过的商品混进仓库,例如新奇物品;理想系统应说“不认识”,但模型常常自信地报出一个错误答案,检测效果接近猜硬币。

作者还测试了各种训练技巧。遮挡、混合图片和风格转换能带来一些帮助,但最高只有7.3%;使用更多ImageNet-21K数据升到11.41%,仍远未解决问题。这说明真正的改进可能需要改变“看东西的方法”,而不只是看更多相似照片。

简单解释 像给14岁少年讲一样

想象你在玩一个看图猜词游戏。训练时,游戏总给你很标准的图片:猫在室内、车在路上、雪铲旁边有雪。玩久以后,你可能不是在认猫,而是在认“室内背景”;不是在认雪铲,而是在认“白色雪地”。一旦图片换成奇怪角度、复杂背景或不常见场景,你就会翻车。

这篇论文给电脑做了一套专门的难题。研究者先从网上收集很多动物和物品照片,再让ResNet-50挑出最容易让电脑猜错的照片,并由人确认照片真的清楚、只有一个主要答案。这就是ImageNet-A,共7,500张。电脑平时能在相似测试题上答对九成以上,可在这里某些模型只答对约2%。

还有ImageNet-O,专门测试电脑能不能说“我不知道”。它放入电脑没学过、但外观很像已知东西的图片。结果模型经常非常自信地答错,AUPR约16.20%,几乎和随机猜测的16.67%一样。是不是很吓人?自信并不等于正确!

作者试了Mixup、CutMix、AugMix等训练方法,CutMix把准确率从2.17%提高到7.3%,ImageNet-21K预训练提高到11.41%,但仍然很低。真正的挑战,是让电脑学会关注物体本身,而不是背景、颜色和熟悉的套路。

术语表

Adversarial Filtration(对抗过滤)

用模型筛除容易样本,保留能稳定诱发错误的样本。它不修改图像像素,而是选择自然存在的困难实例。

用于构建ImageNet-A和ImageNet-O。

Natural Adversarial Example(自然对抗样本)

未经人工扰动、但能导致模型错误的真实图像。其困难通常来自长尾场景、背景线索或概念相似性。

论文的核心研究对象。

Out-of-Distribution, OOD(分布外)

不属于模型训练数据语义分布的输入。可靠系统应识别并降低置信度。

ImageNet-O专门评估OOD检测。

Maximum Softmax Probability(最大Softmax概率)

分类器所有类别概率中的最大值,常被用作模型信心。论文以其负值作为异常分数。

用于ImageNet-O检测。

AUPR(精确率-召回率曲线下面积)

衡量异常检测在不同阈值下精确率与召回率综合表现的指标。数值越高越好。

ImageNet-O随机水平约16.67%。

开放问题 这项研究留下的未解疑问

  • 1 为何不同卷积架构会共享相似盲点仍未完全解释;需要结合形状偏置、因果特征和表示可视化建立机制性理论。
  • 2 对抗过滤样本能否稳定迁移到视觉Transformer、视觉语言模型和真实视频系统,论文尚未系统验证。
  • 3 如何自动扩展人工筛选流程,同时保持单标签质量、错误多样性与现实代表性,是数据集建设的关键难题。

应用场景

近期应用

视觉模型发布前压力测试

研发团队可在常规ImageNet验证后加入ImageNet-A,检查模型是否依赖背景、纹理或固定构图。若准确率极低,应补充长尾数据、拒答机制和人工审核,而不能仅依据标准基准上线。

未知物体检测

自动驾驶、安防和机器人系统可用ImageNet-O测试高置信度误识别。部署时应结合负最大softmax概率、校准阈值和传感器冗余,降低陌生目标被错误分类的风险。

远期愿景

面向开放世界的鲁棒视觉

未来模型应学习对象形状、部件和因果关系,而非只记忆纹理与背景,并持续从真实失败案例中更新。该方向可推动更安全的开放集识别和跨环境泛化。

原文摘要

We introduce two challenging datasets that reliably cause machine learning model performance to substantially degrade. The datasets are collected with a simple adversarial filtration technique to create datasets with limited spurious cues. Our datasets' real-world, unmodified examples transfer to various unseen models reliably, demonstrating that computer vision models have shared weaknesses. The first dataset is called ImageNet-A and is like the ImageNet test set, but it is far more challenging for existing models. We also curate an adversarial out-of-distribution detection dataset called ImageNet-O, which is the first out-of-distribution detection dataset created for ImageNet models. On ImageNet-A a DenseNet-121 obtains around 2% accuracy, an accuracy drop of approximately 90%, and its out-of-distribution detection performance on ImageNet-O is near random chance levels. We find that existing data augmentation techniques hardly boost performance, and using other public training datasets provides improvements that are limited. However, we find that improvements to computer vision architectures provide a promising path towards robust models.

cs.LG cs.CV stat.ML