Swin Transformer V2: Scaling Up Capacity and Resolution

TL;DR

Swin Transformer V2以残差后归一化、余弦注意力和Log-CPB扩展至30亿参数,ImageNet-V2达84.0%。

cs.CV 🔴 高级 2021-11-19 21 次浏览
Ze Liu Han Hu Yutong Lin Zhuliang Yao Zhenda Xie Yixuan Wei Jia Ning Yue Cao Zheng Zhang Li Dong Furu Wei Baining Guo
Swin Transformer 视觉Transformer 自监督学习 高分辨率 大模型

核心发现

方法论

论文从容量、分辨率和数据三方面改造Swin Transformer:以res-post-norm抑制深层激活累积;以带可学习温度τ的scaled cosine attention替代点积注意力;以Log-CPB通过两层MLP生成任意相对坐标的位置偏置;再结合SimMIM、ZeRO、激活检查点和顺序注意力,训练658M参数的H模型及3B参数的G模型。

关键结果

  • SwinV2-G在ImageNet-V2达到84.0% top-1,比此前最佳83.3%高0.7个百分点;COCO test-dev达到63.1 box AP和54.4 mask AP,ADE20K达到59.9 mIoU,Kinetics-400达到86.8% top-1。
  • 模型仅使用约7000万张带标签图像,约为JFT-3B实践的1/40;同时支持1536×1536检测输入和320×320×8视频输入,显示容量扩展与高分辨率迁移可以统一实现。
  • 在Swin-T消融中,Log-CPB从8×8窗口迁移到24×24窗口时,ImageNet微调准确率达84.2%,而参数化偏置为83.2%;ADE20K的32窗口mIoU为47.8%,提升3.3个百分点。

研究意义

该工作把视觉Transformer从数亿参数和分类专用模型推进到30亿参数、跨任务通用骨干。它针对大模型训练中常被分开处理的稳定性、预训练—微调分辨率差异及标注数据饥渴问题,给出统一工程方案。结果表明,自监督预训练和窗口化结构能够显著降低视觉大模型成本,为检测、分割、视频理解以及未来视觉—语言联合建模提供基础。

技术贡献

res-post-norm将归一化移至残差分支输出端,减少层间幅值累积;scaled cosine attention以cos(q,k)/τ替代qᵀk/√d,使注意力对输入幅值不敏感;Log-CPB使用log(1+|Δ|)坐标降低跨窗口外推比例。配合ZeRO stage-1、激活检查点和顺序自注意力,论文在A100-40G上完成3B模型训练,形成算法与系统协同设计。

新颖性

创新不在于单独提出更大模型,而在于将稳定架构、连续位置函数、自监督学习和内存优化组合为可扩展体系。相较Swin V1的预归一化、点积注意力和插值位置偏置,Swin V2能直接处理任意窗口范围,并把大规模视觉预训练从依赖海量人工标签转向更高效的混合训练。

局限性

  • SwinV2-G预训练使用私有的ImageNet-22K-ext七千万图像,复现实验需要相似数据规模、算力和数据清洗流程。
  • 论文主要报告监督微调后的分类、检测、分割和动作识别,未充分证明零样本、少样本泛化,也未系统分析3B模型的推理延迟和能耗。
  • 部分比较存在训练分辨率、数据量和训练步数差异,因此不同模型之间的绝对优势不能完全视为严格控制变量下的结果。

未来方向

未来可研究更开放的数据和更低成本的多模态预训练,评估Log-CPB在非规则视觉输入、3D视觉及长视频中的迁移能力,并建立参数规模、数据量、分辨率和能耗之间的系统缩放规律。

AI 总览摘要

语言模型的规模扩展已带来持续收益,但视觉模型长期受训练不稳定、分辨率迁移失效和标注数据不足限制。Swin Transformer V2针对这些瓶颈,尝试把视觉骨干扩展到语言模型式的大规模,同时保持检测、分割和视频识别所需的局部性与层级结构。

论文提出三项核心改造。res-post-norm把LayerNorm移到残差输出端,减轻深层激活不断累积;scaled cosine attention用归一化余弦相似度和可学习温度τ替代点积,避免注意力过度集中;Log-CPB让两层MLP根据log-spaced相对坐标生成连续位置偏置,从而把低分辨率预训练模型迁移到更大窗口。SimMIM减少标签依赖,ZeRO、激活检查点和顺序注意力则压低显存需求。

最终的SwinV2-G拥有30亿参数,可在A100-40G上支持1536×1536图像。它在ImageNet-V2取得84.0%,COCO取得63.1/54.4 box/mask AP,ADE20K取得59.9 mIoU,Kinetics-400取得86.8%。论文还称其仅使用约7000万张带标签图像,即JFT-3B实践的1/40。局限在于私有数据与高算力要求,以及对零样本能力和能耗缺乏系统评估;但其意义在于证明,视觉模型的容量、输入分辨率和任务通用性可以通过架构与系统协同共同扩展。

深度分析

研究背景

Swin Transformer在ImageNet、COCO和ADE20K上证明了层级结构、局部窗口和移位窗口的有效性。此前ViT-G、V-MoE和CoAtNet-7已将视觉模型推向十亿参数,但主要依赖JFT-3B并聚焦分类。视觉大模型要成为通用骨干,还必须解决深层训练不稳定、低分辨率预训练向高分辨率任务迁移困难,以及标签规模和显存成本过高等问题。

核心问题

预归一化残差结构会使主分支激活逐层累积,大模型中不同层的幅值差异可达10^4,658M模型甚至无法完成训练。原始参数化相对位置偏置只覆盖固定窗口,双三次插值在窗口大幅变化时常产生性能损失。此外,高分辨率注意力的激活、优化器状态和权重会共同造成显存瓶颈。

核心创新

第一,res-post-norm在残差输出合并前归一化,稳定信号传播;scaled cosine attention使用cos(q,k)/τ,τ为每层每头独立学习的标量。第二,Log-CPB由MLP G(Δx,Δy)生成连续偏置,并输入sign(x)log(1+|x|)坐标,降低外推比例。第三,SimMIM缓解标签饥渴;ZeRO stage-1、激活检查点和顺序自注意力共同支持3B模型与1536分辨率。

方法详解

  • �� 基础结构:保留Swin的四阶段层级、窗口注意力和移位窗口。
  • �� 稳定训练:将每个残差分支的LayerNorm置于输出端;SwinV2-H/G主干每6个Transformer块额外归一化一次。
  • �� 注意力:以cos(q_i,k_j)/τ+B_ij计算logit,τ>0.01且不跨头、层共享。
  • �� 位置编码:用两层ReLU MLP生成B(Δx,Δy),坐标变换为sign(x)log(1+|x|)。
  • �� 预训练:SwinV2-G先在ImageNet-22K-ext上用SimMIM训练20轮,再进行30轮分类预训练。
  • �� 系统:采用ZeRO、检查点和前两阶段的顺序注意力降低A100-40G显存压力。

实验设计

评测覆盖ImageNet-1K V1/V2、COCO、ADE20K和Kinetics-400;预训练数据包括ImageNet-22K、私有ImageNet-22K-ext及Object365 v2检测中间预训练。模型包括SwinV2-T/S/B/L、658M的H和3B的G。消融比较参数化、线性CPB和Log-CPB,并测试从8×8到24×24窗口以及不同图像分辨率的迁移。

结果分析

SwinV2-G在ImageNet-V2达到84.00%,超过此前83.33%;ImageNet-V1为90.17%。COCO为63.1 box AP、54.4 mask AP,ADE20K为59.9 mIoU,K400为86.8%。相较原Swin最佳结果,提升分别为约0.8、1.8/1.4、1.5和1.4个百分点。Swin-T消融显示,Log-CPB在大窗口迁移时优于线性CPB和双三次插值。

应用场景

该骨干可直接用于高分辨率目标检测、实例分割、语义分割和视频动作识别。COCO实验支持1536×1536输入,适合遥感、工业质检、医学影像和自动驾驶等细粒度场景;K400实验说明其层级时空特征也可迁移到视频。实际部署仍需蒸馏、剪枝或量化以降低3B模型成本。

局限与展望

模型训练依赖私有70M图像集和大规模A100集群,普通研究者难以完全复现。高分辨率带来显著计算与通信开销,激活检查点虽省显存却可能使训练慢约30%。论文未系统报告推理成本、公平数据比较、鲁棒性、偏差和零样本能力。后续应研究开放数据、参数高效迁移、稀疏化以及更严格的缩放规律。

通俗解读 非专业人士也能看懂

可以把Swin V2想成一座不断扩建的工厂。原来的工厂虽然能工作,但楼层越高,机器产生的震动越大,最后会失控;res-post-norm像在每个车间出口装减震器,让信号保持稳定。普通点积注意力好比让工人只盯着少数几个零件,容易过度集中;余弦注意力先把不同零件的大小统一,再决定它们的相似程度。

工厂还要处理不同大小的订单。以前只在小盒子上练习,换成大箱子时,位置规则只能靠拉伸,效果不理想。Log-CPB像一张可计算的地图,能根据零件之间的相对距离随时生成位置关系,而且用对数刻度让远距离变化更平滑。

最后,SimMIM让工厂先用遮住部分标签的图片自学,而不是给每张图片都配人工答案。这样,Swin V2用较少标注数据训练出30亿参数模型,并在分类、检测、分割和视频任务中取得很强成绩。

简单解释 像给14岁少年讲一样

想象你在玩一款需要识别物品、敌人和动作的游戏。普通模型像一个经验不错的小队,但地图一变大、任务一变复杂,它就容易迷路或卡死。Swin V2给这支小队升级了装备:res-post-norm像每走几关就校准一次指南针,避免误差越积越大;余弦注意力像先把所有队员的音量调到差不多,再判断谁在说重要信息。

游戏地图有时是小房间,有时是巨大场景。以前模型只熟悉小房间,换到大地图时只能把旧地图硬拉伸。Log-CPB让它学会按照距离规律推断新位置,因此窗口变大后仍能工作。

训练也很费资源。SimMIM先把图片的一部分遮住,让模型根据周围内容猜回来,就像做拼图;它不需要每张图片都有老师写答案。研究者还用ZeRO和检查点技术节省显存。

结果很惊人:最大模型有30亿个参数,在ImageNet-V2达到84.0%,COCO检测达到63.1 box AP,ADE20K分割达到59.9 mIoU,Kinetics-400动作识别达到86.8%。不过它需要很多显卡和数据,普通电脑暂时玩不起这套装备。

术语表

Swin Transformer (Swin变换器)

一种采用局部窗口和层级特征的视觉Transformer。它通过移位窗口在相邻区域间传递信息。

Swin V2继承其四阶段结构并扩展模型容量。

Residual Post-Norm (残差后归一化)

先计算残差分支,再对其输出进行LayerNorm后合并。它可抑制深层激活幅值累积。

论文用它替代Swin V1的pre-norm。

Scaled Cosine Attention (缩放余弦注意力)

用余弦相似度而非点积计算查询与键的关系,并除以可学习温度τ。该机制降低输入幅值对注意力的影响。

它用于稳定大模型训练。

Log-CPB (对数连续位置偏置)

用MLP根据连续相对坐标生成位置偏置,并将坐标变换到对数空间。它能适应任意窗口大小。

论文用它替代参数化偏置和双三次插值。

SimMIM

一种遮挡图像块并重建其内容的自监督预训练方法。它减少对人工分类标签的依赖。

SwinV2-G先用SimMIM预训练20轮。

ZeRO

将模型参数和优化器状态分片到不同GPU的内存优化技术。它降低数据并行中的冗余存储。

论文采用DeepSpeed ZeRO stage-1。

开放问题 这项研究留下的未解疑问

  • 1 3B模型是否能在开放、小规模数据上保持同等优势仍不清楚;需要公开数据、严格匹配训练预算和更完整的可复现实验。
  • 2 Log-CPB对长视频、3D点云和非规则图像网格的泛化尚未验证;这些场景需要新的空间坐标与效率设计。
  • 3 论文强调准确率,但推理延迟、能耗、数据偏差和零样本能力报告有限;未来应建立综合评测。

应用场景

近期应用

高分辨率工业质检

制造企业可将SwinV2作为检测或分割骨干,处理大尺寸产品图像中的细小缺陷。前提是准备领域数据并通过蒸馏、量化或较小模型降低部署成本。

遥感与医学影像分析

遥感建筑识别、病灶分割等任务需要高分辨率输入,Log-CPB有助于从低分辨率预训练迁移到大窗口。实际应用需进行隐私保护、领域校准和临床或测绘验证。

远期愿景

通用视觉—语言基础模型

Swin V2的容量与多任务骨干能力可作为视觉编码器,连接文本、视频和机器人系统。主要障碍是开放数据、跨模态对齐、能耗和安全评估。

原文摘要

Large-scale NLP models have been shown to significantly improve the performance on language tasks with no signs of saturation. They also demonstrate amazing few-shot capabilities like that of human beings. This paper aims to explore large-scale models in computer vision. We tackle three major issues in training and application of large vision models, including training instability, resolution gaps between pre-training and fine-tuning, and hunger on labelled data. Three main techniques are proposed: 1) a residual-post-norm method combined with cosine attention to improve training stability; 2) A log-spaced continuous position bias method to effectively transfer models pre-trained using low-resolution images to downstream tasks with high-resolution inputs; 3) A self-supervised pre-training method, SimMIM, to reduce the needs of vast labeled images. Through these techniques, this paper successfully trained a 3 billion-parameter Swin Transformer V2 model, which is the largest dense vision model to date, and makes it capable of training with images of up to 1,536$\times$1,536 resolution. It set new performance records on 4 representative vision tasks, including ImageNet-V2 image classification, COCO object detection, ADE20K semantic segmentation, and Kinetics-400 video action classification. Also note our training is much more efficient than that in Google's billion-level visual models, which consumes 40 times less labelled data and 40 times less training time. Code is available at \url{https://github.com/microsoft/Swin-Transformer}.

cs.CV