Soft Mixture-of-Recursions: Going Deeper with Recursive Vision Transformers

TL;DR

SoftMoR通过递归增强视觉Transformer,SR-ViT在ImageNet-1K上提升准确率至82.48%。

cs.CV 🔴 高级 2026-07-01 3 次浏览
Sang In Lee Jihun Park
递归 视觉Transformer 深度学习 参数效率 图像分类

核心发现

方法论

SoftMoR方法通过学习token级的混合权重,灵活地结合所有递归步骤的输出,充分利用中间表示。SR-ViT在标准视觉Transformer架构中实现SoftMoR,通过递归重用共享的Transformer模块,增加计算深度并产生更丰富的视觉表示。

关键结果

  • 在ImageNet-1K上,SR-ViT-S通过增加递归深度从1到4,顶级准确率从79.83%提高到82.48%,仅增加1.7M参数,优于DeiT-B。
  • 在COCO检测任务中,SR-ViT-S递归深度增加后,APbox从45.9提高到47.7。
  • 在ADE20K语义分割中,递归深度增加使mIoU从38.5%提升至41.5%。

研究意义

SoftMoR提供了一种参数高效的途径,通过递归构建更深、更强的视觉Transformer。这种方法在不显著增加参数的情况下,提升了模型的表现力,适用于多种视觉任务,具有广泛的应用潜力。

技术贡献

SoftMoR通过引入可学习的软混合机制,显著提高了递归Transformer的表示能力,区别于传统的硬深度选择方法。SR-ViT在不增加参数的情况下,通过递归重用实现了更深的计算深度。

新颖性

SoftMoR首次在视觉Transformer中引入软混合递归机制,区别于现有的硬深度分配方法,充分利用了中间表示,提升了模型的表示能力。

局限性

  • SoftMoR在极深递归深度下的性能提升有限,可能需要进一步优化递归机制。
  • 在计算资源有限的环境中,递归深度的增加可能导致计算开销增加。

未来方向

未来可以探索更高效的递归机制,优化计算开销,并在更多的视觉任务中验证SoftMoR的通用性。

AI 总览摘要

近年来,视觉Transformer在计算机视觉任务中表现出色,但其参数规模和计算需求也随之增加。现有的递归Transformer通过共享参数构建紧凑的模型,但在视觉任务中简单增加递归深度并不能可靠地提升性能。为此,本文提出了SoftMixture-of-Recursions(SoftMoR)及其在视觉Transformer中的实现SR-ViT。SoftMoR通过学习token级的混合权重,灵活结合所有递归步骤的输出,充分利用中间表示。实验表明,SR-ViT在递归深度增加时,能够在ImageNet-1K、COCO检测和ADE20K语义分割等任务中显著提升性能,同时参数开销最小。这一结果表明,SoftMoR通过递归为视觉Transformer提供了一条参数高效的深度扩展路径。未来的研究可以探索更高效的递归机制,优化计算开销,并在更多的视觉任务中验证其通用性。

深度分析

研究背景

视觉Transformer(ViT)在图像分类、目标检测等任务中取得了显著进展,其扩展性主要依赖于更大的模型架构。然而,这种扩展伴随着参数数量和计算需求的显著增加,导致训练和部署成本上升。因此,研究者们开始探索通过递归机制提升模型表示能力的方法。

核心问题

在视觉Transformer中,简单增加递归深度并不能可靠地提升性能,因为现有递归方法未能充分利用递归计算过程中产生的中间表示。如何有效利用这些中间表示以增强模型的表现力是一个亟待解决的问题。

核心创新

SoftMoR通过学习token级的混合权重,灵活结合所有递归步骤的输出,充分利用中间表示。与现有的硬深度选择方法不同,SoftMoR允许每个token从不同的递归深度中提取信息,提升了模型的表示能力。

方法详解

  • �� SoftMoR通过线性路由器为每个输入token生成混合权重。
  • �� 使用softmax函数计算每个递归步骤的权重。
  • �� 最终token表示通过加权组合所有递归步骤的输出得到。
  • �� 在SR-ViT中实现SoftMoR,通过递归重用共享的Transformer模块。

实验设计

在ImageNet-1K上,使用标准DeiT训练协议进行训练,递归深度从1增加到4,观察到顶级准确率显著提升。在COCO和ADE20K上,使用Mask R-CNN和UPerNet进行微调,验证了SR-ViT在目标检测和语义分割任务中的有效性。

结果分析

在ImageNet-1K上,SR-ViT-S递归深度从1到4,顶级准确率从79.83%提高到82.48%。在COCO上,递归深度增加后,APbox从45.9提高到47.7。在ADE20K上,递归深度增加使mIoU从38.5%提升至41.5%。

应用场景

SoftMoR在图像分类、目标检测和语义分割等任务中表现出色,适用于需要高效参数利用和增强表示能力的场景,特别是在计算资源有限的情况下。

局限与展望

SoftMoR在极深递归深度下的性能提升有限,可能需要进一步优化递归机制。在计算资源有限的环境中,递归深度的增加可能导致计算开销增加。未来的研究可以探索更高效的递归机制,优化计算开销,并在更多的视觉任务中验证其通用性。

通俗解读 非专业人士也能看懂

想象一个厨房,厨师在准备一道复杂的菜肴。每个步骤都需要不同的准备工作,比如切菜、煮汤和调味。SoftMoR就像一个聪明的助手,能够在每个步骤中灵活地选择和结合不同的准备工作,确保每个步骤都能得到最好的结果。这样,即使厨师重复使用相同的工具和材料,菜肴的味道也会越来越好。这种方法在视觉Transformer中,通过递归地重用共享的模块,结合所有步骤的输出,提升了模型的表现力。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,每个关卡都有不同的挑战。SoftMoR就像一个超级助手,能够在每个关卡中灵活地选择和结合不同的技能,帮助你更快地通关。这样,即使你重复使用相同的技能,游戏的难度也会越来越低。这种方法在视觉Transformer中,通过递归地重用共享的模块,结合所有步骤的输出,提升了模型的表现力。

术语表

SoftMixture-of-Recursions (软递归混合)

一种通过学习token级混合权重来结合所有递归步骤输出的方法。

用于提升视觉Transformer的表示能力。

Vision Transformer (视觉Transformer)

一种基于Transformer架构的视觉模型,适用于图像分类等任务。

作为基础架构用于实现SoftMoR。

ImageNet-1K

一个广泛用于图像分类任务的大型数据集,包含1000个类别。

用于评估SR-ViT的分类性能。

COCO

一个用于目标检测和实例分割的标准数据集,包含多种物体类别。

用于评估SR-ViT在检测任务中的表现。

ADE20K

一个用于语义分割的标准数据集,包含多种场景和物体类别。

用于评估SR-ViT在分割任务中的表现。

开放问题 这项研究留下的未解疑问

  • 1 如何在极深递归深度下进一步提升性能?现有方法在计算资源有限的情况下可能不够高效。
  • 2 SoftMoR在其他视觉任务中的通用性如何?需要更多实验验证。

应用场景

近期应用

图像分类

在计算资源有限的情况下,使用SR-ViT进行高效的图像分类。

目标检测

在COCO数据集上使用SR-ViT进行高效的目标检测。

远期愿景

智能监控

利用SR-ViT在智能监控系统中进行实时目标检测和识别。

原文摘要

Recent recursive Transformer studies have primarily reused shared parameters across computation steps to construct compact, parameter-efficient models. In this work, we leverage recursion to build effectively deeper Transformers with stronger representational capacity. However, in Vision Transformers, simply increasing recursion depth does not reliably improve performance, as existing recursive approaches do not fully utilize the intermediate representations produced throughout recursive computation. We propose Soft Mixture-of-Recursions (SoftMoR) and its Vision Transformer instantiation, Soft Recursive Vision Transformer (SR-ViT). SoftMoR learns token-wise mixture weights to softly combine outputs from all recursion steps, allowing intermediate representations to be utilized in a learnable and flexible way. Across diverse vision tasks, SR-ViT consistently improves as recursion depth increases with minimal parameter overhead. On ImageNet-1K, increasing recursion depth from 1 to 4 improves SR-ViT-S top-1 accuracy from 79.83% to 82.48% with only 1.7M additional parameters, outperforming the substantially larger DeiT-B while using approximately 27% of its parameters. These results demonstrate that SoftMoR provides a parameter-efficient path to deeper and stronger Vision Transformers through recursion.

cs.CV cs.LG