核心发现
方法论
论文从容量、分辨率和数据三方面改造Swin Transformer:以res-post-norm抑制深层激活累积;以带可学习温度τ的scaled cosine attention替代点积注意力;以Log-CPB通过两层MLP生成任意相对坐标的位置偏置;再结合SimMIM、ZeRO、激活检查点和顺序注意力,训练658M参数的H模型及3B参数的G模型。
关键结果
- SwinV2-G在ImageNet-V2达到84.0% top-1,比此前最佳83.3%高0.7个百分点;COCO test-dev达到63.1 box AP和54.4 mask AP,ADE20K达到59.9 mIoU,Kinetics-400达到86.8% top-1。
- 模型仅使用约7000万张带标签图像,约为JFT-3B实践的1/40;同时支持1536×1536检测输入和320×320×8视频输入,显示容量扩展与高分辨率迁移可以统一实现。
- 在Swin-T消融中,Log-CPB从8×8窗口迁移到24×24窗口时,ImageNet微调准确率达84.2%,而参数化偏置为83.2%;ADE20K的32窗口mIoU为47.8%,提升3.3个百分点。
研究意义
该工作把视觉Transformer从数亿参数和分类专用模型推进到30亿参数、跨任务通用骨干。它针对大模型训练中常被分开处理的稳定性、预训练—微调分辨率差异及标注数据饥渴问题,给出统一工程方案。结果表明,自监督预训练和窗口化结构能够显著降低视觉大模型成本,为检测、分割、视频理解以及未来视觉—语言联合建模提供基础。
技术贡献
res-post-norm将归一化移至残差分支输出端,减少层间幅值累积;scaled cosine attention以cos(q,k)/τ替代qᵀk/√d,使注意力对输入幅值不敏感;Log-CPB使用log(1+|Δ|)坐标降低跨窗口外推比例。配合ZeRO stage-1、激活检查点和顺序自注意力,论文在A100-40G上完成3B模型训练,形成算法与系统协同设计。
新颖性
创新不在于单独提出更大模型,而在于将稳定架构、连续位置函数、自监督学习和内存优化组合为可扩展体系。相较Swin V1的预归一化、点积注意力和插值位置偏置,Swin V2能直接处理任意窗口范围,并把大规模视觉预训练从依赖海量人工标签转向更高效的混合训练。
局限性
- SwinV2-G预训练使用私有的ImageNet-22K-ext七千万图像,复现实验需要相似数据规模、算力和数据清洗流程。
- 论文主要报告监督微调后的分类、检测、分割和动作识别,未充分证明零样本、少样本泛化,也未系统分析3B模型的推理延迟和能耗。
- 部分比较存在训练分辨率、数据量和训练步数差异,因此不同模型之间的绝对优势不能完全视为严格控制变量下的结果。
未来方向
未来可研究更开放的数据和更低成本的多模态预训练,评估Log-CPB在非规则视觉输入、3D视觉及长视频中的迁移能力,并建立参数规模、数据量、分辨率和能耗之间的系统缩放规律。
AI 总览摘要
语言模型的规模扩展已带来持续收益,但视觉模型长期受训练不稳定、分辨率迁移失效和标注数据不足限制。Swin Transformer V2针对这些瓶颈,尝试把视觉骨干扩展到语言模型式的大规模,同时保持检测、分割和视频识别所需的局部性与层级结构。
论文提出三项核心改造。res-post-norm把LayerNorm移到残差输出端,减轻深层激活不断累积;scaled cosine attention用归一化余弦相似度和可学习温度τ替代点积,避免注意力过度集中;Log-CPB让两层MLP根据log-spaced相对坐标生成连续位置偏置,从而把低分辨率预训练模型迁移到更大窗口。SimMIM减少标签依赖,ZeRO、激活检查点和顺序注意力则压低显存需求。
最终的SwinV2-G拥有30亿参数,可在A100-40G上支持1536×1536图像。它在ImageNet-V2取得84.0%,COCO取得63.1/54.4 box/mask AP,ADE20K取得59.9 mIoU,Kinetics-400取得86.8%。论文还称其仅使用约7000万张带标签图像,即JFT-3B实践的1/40。局限在于私有数据与高算力要求,以及对零样本能力和能耗缺乏系统评估;但其意义在于证明,视觉模型的容量、输入分辨率和任务通用性可以通过架构与系统协同共同扩展。
深度分析
研究背景
Swin Transformer在ImageNet、COCO和ADE20K上证明了层级结构、局部窗口和移位窗口的有效性。此前ViT-G、V-MoE和CoAtNet-7已将视觉模型推向十亿参数,但主要依赖JFT-3B并聚焦分类。视觉大模型要成为通用骨干,还必须解决深层训练不稳定、低分辨率预训练向高分辨率任务迁移困难,以及标签规模和显存成本过高等问题。
核心问题
预归一化残差结构会使主分支激活逐层累积,大模型中不同层的幅值差异可达10^4,658M模型甚至无法完成训练。原始参数化相对位置偏置只覆盖固定窗口,双三次插值在窗口大幅变化时常产生性能损失。此外,高分辨率注意力的激活、优化器状态和权重会共同造成显存瓶颈。
核心创新
第一,res-post-norm在残差输出合并前归一化,稳定信号传播;scaled cosine attention使用cos(q,k)/τ,τ为每层每头独立学习的标量。第二,Log-CPB由MLP G(Δx,Δy)生成连续偏置,并输入sign(x)log(1+|x|)坐标,降低外推比例。第三,SimMIM缓解标签饥渴;ZeRO stage-1、激活检查点和顺序自注意力共同支持3B模型与1536分辨率。
方法详解
- �� 基础结构:保留Swin的四阶段层级、窗口注意力和移位窗口。
- �� 稳定训练:将每个残差分支的LayerNorm置于输出端;SwinV2-H/G主干每6个Transformer块额外归一化一次。
- �� 注意力:以cos(q_i,k_j)/τ+B_ij计算logit,τ>0.01且不跨头、层共享。
- �� 位置编码:用两层ReLU MLP生成B(Δx,Δy),坐标变换为sign(x)log(1+|x|)。
- �� 预训练:SwinV2-G先在ImageNet-22K-ext上用SimMIM训练20轮,再进行30轮分类预训练。
- �� 系统:采用ZeRO、检查点和前两阶段的顺序注意力降低A100-40G显存压力。
实验设计
评测覆盖ImageNet-1K V1/V2、COCO、ADE20K和Kinetics-400;预训练数据包括ImageNet-22K、私有ImageNet-22K-ext及Object365 v2检测中间预训练。模型包括SwinV2-T/S/B/L、658M的H和3B的G。消融比较参数化、线性CPB和Log-CPB,并测试从8×8到24×24窗口以及不同图像分辨率的迁移。
结果分析
SwinV2-G在ImageNet-V2达到84.00%,超过此前83.33%;ImageNet-V1为90.17%。COCO为63.1 box AP、54.4 mask AP,ADE20K为59.9 mIoU,K400为86.8%。相较原Swin最佳结果,提升分别为约0.8、1.8/1.4、1.5和1.4个百分点。Swin-T消融显示,Log-CPB在大窗口迁移时优于线性CPB和双三次插值。
应用场景
该骨干可直接用于高分辨率目标检测、实例分割、语义分割和视频动作识别。COCO实验支持1536×1536输入,适合遥感、工业质检、医学影像和自动驾驶等细粒度场景;K400实验说明其层级时空特征也可迁移到视频。实际部署仍需蒸馏、剪枝或量化以降低3B模型成本。
局限与展望
模型训练依赖私有70M图像集和大规模A100集群,普通研究者难以完全复现。高分辨率带来显著计算与通信开销,激活检查点虽省显存却可能使训练慢约30%。论文未系统报告推理成本、公平数据比较、鲁棒性、偏差和零样本能力。后续应研究开放数据、参数高效迁移、稀疏化以及更严格的缩放规律。
通俗解读 非专业人士也能看懂
可以把Swin V2想成一座不断扩建的工厂。原来的工厂虽然能工作,但楼层越高,机器产生的震动越大,最后会失控;res-post-norm像在每个车间出口装减震器,让信号保持稳定。普通点积注意力好比让工人只盯着少数几个零件,容易过度集中;余弦注意力先把不同零件的大小统一,再决定它们的相似程度。
工厂还要处理不同大小的订单。以前只在小盒子上练习,换成大箱子时,位置规则只能靠拉伸,效果不理想。Log-CPB像一张可计算的地图,能根据零件之间的相对距离随时生成位置关系,而且用对数刻度让远距离变化更平滑。
最后,SimMIM让工厂先用遮住部分标签的图片自学,而不是给每张图片都配人工答案。这样,Swin V2用较少标注数据训练出30亿参数模型,并在分类、检测、分割和视频任务中取得很强成绩。
简单解释 像给14岁少年讲一样
想象你在玩一款需要识别物品、敌人和动作的游戏。普通模型像一个经验不错的小队,但地图一变大、任务一变复杂,它就容易迷路或卡死。Swin V2给这支小队升级了装备:res-post-norm像每走几关就校准一次指南针,避免误差越积越大;余弦注意力像先把所有队员的音量调到差不多,再判断谁在说重要信息。
游戏地图有时是小房间,有时是巨大场景。以前模型只熟悉小房间,换到大地图时只能把旧地图硬拉伸。Log-CPB让它学会按照距离规律推断新位置,因此窗口变大后仍能工作。
训练也很费资源。SimMIM先把图片的一部分遮住,让模型根据周围内容猜回来,就像做拼图;它不需要每张图片都有老师写答案。研究者还用ZeRO和检查点技术节省显存。
结果很惊人:最大模型有30亿个参数,在ImageNet-V2达到84.0%,COCO检测达到63.1 box AP,ADE20K分割达到59.9 mIoU,Kinetics-400动作识别达到86.8%。不过它需要很多显卡和数据,普通电脑暂时玩不起这套装备。
术语表
Swin Transformer (Swin变换器)
一种采用局部窗口和层级特征的视觉Transformer。它通过移位窗口在相邻区域间传递信息。
Swin V2继承其四阶段结构并扩展模型容量。
Residual Post-Norm (残差后归一化)
先计算残差分支,再对其输出进行LayerNorm后合并。它可抑制深层激活幅值累积。
论文用它替代Swin V1的pre-norm。
Scaled Cosine Attention (缩放余弦注意力)
用余弦相似度而非点积计算查询与键的关系,并除以可学习温度τ。该机制降低输入幅值对注意力的影响。
它用于稳定大模型训练。
Log-CPB (对数连续位置偏置)
用MLP根据连续相对坐标生成位置偏置,并将坐标变换到对数空间。它能适应任意窗口大小。
论文用它替代参数化偏置和双三次插值。
SimMIM
一种遮挡图像块并重建其内容的自监督预训练方法。它减少对人工分类标签的依赖。
SwinV2-G先用SimMIM预训练20轮。
ZeRO
将模型参数和优化器状态分片到不同GPU的内存优化技术。它降低数据并行中的冗余存储。
论文采用DeepSpeed ZeRO stage-1。
开放问题 这项研究留下的未解疑问
- 1 3B模型是否能在开放、小规模数据上保持同等优势仍不清楚;需要公开数据、严格匹配训练预算和更完整的可复现实验。
- 2 Log-CPB对长视频、3D点云和非规则图像网格的泛化尚未验证;这些场景需要新的空间坐标与效率设计。
- 3 论文强调准确率,但推理延迟、能耗、数据偏差和零样本能力报告有限;未来应建立综合评测。
应用场景
近期应用
高分辨率工业质检
制造企业可将SwinV2作为检测或分割骨干,处理大尺寸产品图像中的细小缺陷。前提是准备领域数据并通过蒸馏、量化或较小模型降低部署成本。
遥感与医学影像分析
遥感建筑识别、病灶分割等任务需要高分辨率输入,Log-CPB有助于从低分辨率预训练迁移到大窗口。实际应用需进行隐私保护、领域校准和临床或测绘验证。
远期愿景
通用视觉—语言基础模型
Swin V2的容量与多任务骨干能力可作为视觉编码器,连接文本、视频和机器人系统。主要障碍是开放数据、跨模态对齐、能耗和安全评估。
原文摘要
Large-scale NLP models have been shown to significantly improve the performance on language tasks with no signs of saturation. They also demonstrate amazing few-shot capabilities like that of human beings. This paper aims to explore large-scale models in computer vision. We tackle three major issues in training and application of large vision models, including training instability, resolution gaps between pre-training and fine-tuning, and hunger on labelled data. Three main techniques are proposed: 1) a residual-post-norm method combined with cosine attention to improve training stability; 2) A log-spaced continuous position bias method to effectively transfer models pre-trained using low-resolution images to downstream tasks with high-resolution inputs; 3) A self-supervised pre-training method, SimMIM, to reduce the needs of vast labeled images. Through these techniques, this paper successfully trained a 3 billion-parameter Swin Transformer V2 model, which is the largest dense vision model to date, and makes it capable of training with images of up to 1,536$\times$1,536 resolution. It set new performance records on 4 representative vision tasks, including ImageNet-V2 image classification, COCO object detection, ADE20K semantic segmentation, and Kinetics-400 video action classification. Also note our training is much more efficient than that in Google's billion-level visual models, which consumes 40 times less labelled data and 40 times less training time. Code is available at \url{https://github.com/microsoft/Swin-Transformer}.