Recursive Block-Diagonal Coupling for Resource-Efficient Training of Vision Models

TL;DR

提出递归块对角耦合(RBDC)方法,通过训练窄模型递归构建宽模型,节省30% FLOPs,性能持平或更优。

cs.CV 🔴 高级 2026-05-22 37 次浏览
Maxim Henry Adrien Deliège Sébastien Piérard Marc Van Droogenbroeck
深度学习 模型训练 资源效率 变换器 卷积网络

核心发现

方法论

RBDC采用递归方式,将宽度为W的目标模型分解为两个宽度为W/2的子模型,分别训练后通过块对角初始化进行耦合,逐步构建宽模型。具体实现包括零填充的块对角初始化和递归宽度减半策略,结合AdamW优化器在ImageNet上训练DeiT和ResNet模型。该方法通过调整训练轮数比例(r=2)实现资源分配优化,避免了从零随机初始化的高成本。实验中,RBDC在保持相似准确率的同时,显著降低了训练FLOPs达30%。

关键结果

  • 在ImageNet上,DeiT-Base模型通过一递归步骤实现了30%的FLOPs节省,准确率与标准训练持平(约83.5%)。两递归步骤更进一步,达到84.11%的准确率,训练成本降低了约30%。ResNet-50D模型也验证了该方法的有效性,训练效率提升明显,且模型作为下游目标检测和实例分割的骨干网络表现优异。

研究意义

该研究突破了传统从零随机初始化训练宽模型的高成本瓶颈,通过递归窄模型训练与块对角初始化,有效提升了训练资源利用率,推动大规模视觉模型的可持续发展。其在Transformer和CNN架构上的成功应用,为未来模型压缩、迁移学习和端到端训练提供了新思路,具有重要的理论和实践意义。

技术贡献

提出递归宽度减半策略和参数无关的块对角初始化方案,结合递归训练流程,显著降低了训练FLOPs。与现有模型增长方法相比,RBDC无需预训练模型或模板,具备从零开始的普适性。算法设计中引入训练比率调节,确保不同宽度模型的训练资源合理分配,为大规模模型训练提供了新工程范式。

新颖性

首次提出基于递归宽度减半和块对角初始化的模型训练框架,突破了传统宽模型训练成本高昂的限制。区别于以往的模型增长或剪枝方法,RBDC无需预训练模型或复杂参数融合,强调从零开始的递归训练,具有较强的理论创新性。

局限性

  • 方法依赖于合理的训练轮数比例(r=2),在不同模型架构或任务中可能需要调优,泛化性尚待验证。
  • 块对角初始化在某些复杂层(如注意力机制)中的效果可能受限,且对模型结构的适应性有限。
  • 递归训练流程增加了训练调度复杂度,可能在极端模型规模或硬件环境下表现不佳。

未来方向

未来将探索多模态、多任务场景下的递归训练策略,结合自动调节训练比率与初始化方案,提升泛化能力。同时,结合低精度训练和硬件优化,进一步降低成本,推动大规模视觉模型的高效训练与应用。

AI 总览摘要

随着深度学习模型规模不断扩大,训练高容量视觉模型的资源消耗成为制约其普及的关键因素。传统从零随机初始化训练模型,成本高昂且效率低下,尤其在Transformer和CNN架构中表现明显。为应对这一挑战,本文提出递归块对角耦合(RBDC)方法,通过递归训练窄模型并将其耦合为宽模型,有效降低了训练FLOPs达30%。该方法利用块对角初始化,将多个独立训练的窄模型的特征融合到宽模型中,避免了从零随机初始化的高成本,且在ImageNet上验证了其优越性。实验结果显示,RBDC在保持相似性能的同时,大幅提升训练效率,且模型作为下游任务的骨干网络表现优异。该技术为大规模视觉模型的高效训练提供了新思路,推动了模型压缩与迁移学习的发展。未来,结合硬件优化和多模态应用,RBDC有望在工业界实现更广泛的推广,助力智能视觉系统的可持续发展。

深度分析

研究背景

近年来,深度学习模型在视觉任务中取得突破,尤其是Transformer(如ViT)和卷积网络(如ResNet)架构不断扩大规模,带来性能提升的同时也引发训练成本激增。传统方法依赖大规模预训练或逐步增长模型结构,但这些策略在资源有限的环境中难以推广。模型压缩、剪枝和迁移学习等技术虽能缓解部分问题,但仍无法根本降低训练成本。随着硬件成本和能耗的增加,研究者亟需高效训练策略,以实现模型的可持续发展。

核心问题

当前训练大规模视觉模型的主要瓶颈在于高昂的计算资源消耗,尤其是在从零随机初始化的情况下。模型宽度的增加导致FLOPs指数级增长,训练时间长、成本高,限制了模型的普及和应用。此外,现有的模型增长和剪枝方法多依赖预训练模型或模板,缺乏从零开始的高效策略,难以满足实际需求。

核心创新

本文提出递归块对角耦合(RBDC),创新点在于:• 递归宽度减半策略,将宽模型拆分为两个窄模型,逐步递归训练,降低单次训练成本;• 参数无关的块对角初始化,将两个窄模型的参数块拼接为宽模型,避免随机初始化带来的性能损失;• 训练比率调节(r=2),优化不同宽度模型的训练资源分配。这些创新结合实现了资源节省和性能保障的双重目标。

方法详解

  • �� 递归宽度减半:将目标宽度W模型拆分为两个W/2模型,递归训练直至模型变得足够窄;• 独立训练窄模型:每个窄模型用不同随机种子训练,捕获多样特征;• 块对角初始化:用零填充的块对角矩阵拼接窄模型参数,形成宽模型的初始状态;• 递归耦合:逐层递归训练,逐步构建更宽模型,调节训练轮数比例(r=2)确保效率;• 训练优化:采用AdamW,重启训练调度,避免预训练偏差。

实验设计

在ImageNet上,使用DeiT和ResNet模型进行验证。通过不同递归层数,比较标准训练与RBDC的FLOPs和准确率。设置包括AdamW优化、余弦退火调度、不同训练轮数比例。评估指标为测试准确率和归一化FLOPs,验证RBDC在保持性能的同时,显著降低训练成本。多组消融实验验证初始化策略和训练比率的影响,确保方法的稳健性。

结果分析

在DeiT-Base模型中,单递归步骤实现了30%的FLOPs节省,准确率达83.5%;两递归步骤达84.11%,训练成本降低约30%。ResNet-50D模型也验证了效率提升,模型作为目标检测和实例分割骨干网络表现优异。实验显示,RBDC在不同模型规模和任务中均优于传统训练方法,特别是在硬件资源有限的情况下,表现出极强的实用价值。

应用场景

该方法适用于大规模视觉模型的训练,特别是在硬件资源受限或追求高效训练的场景中。模型可作为目标检测、实例分割等下游任务的骨干网络,提升端到端系统的性能和效率。未来结合硬件加速和多模态数据,有望推动智能视觉系统的广泛应用。

局限与展望

方法依赖合理的训练轮数比例,可能在不同模型或任务中需要调参。块对角初始化在复杂层(如注意力)中的效果有限,模型结构适应性待验证。递归流程增加调度复杂度,硬件环境变化可能影响效果。未来需优化算法的泛化能力和适应性。

通俗解读 非专业人士也能看懂

想象你在建造一座大工厂,先从几个小工厂开始,每个小工厂专注于生产某一部分。等这些小工厂都运转良好后,再把它们合并成一个更大的工厂。这样做比一下子建一个超级大工厂要省钱、省力,也更容易控制质量。这个方法就是本文提出的RBDC。它通过先训练小工厂(窄模型),然后逐步合并成大工厂(宽模型),用更少的资源就能建出性能一样甚至更好的大工厂。这样既节省了成本,又保证了工厂的质量和效率。

简单解释 像给14岁少年讲一样

你知道建一座超级大工厂需要很多材料和时间吗?如果一开始就试图建得很大,花费会非常高。而且如果工厂太大,一旦出问题就很难修好。其实,聪明的方法是先建几个小工厂,每个负责不同的任务,确保它们都运转正常后,再把它们组合成一个大工厂。这样既省钱,又更容易控制质量。本文的方法也是这样:先训练几个小模型(窄模型),然后把它们合成一个大模型(宽模型),用更少的计算资源就能达到和大模型一样的效果。这就像用拼装积木的方法,先做好小块,再拼成大块,既省力又有效率!

原文摘要

Training high-capacity vision models from scratch requires substantial computational resources. To improve training efficiency of a wide target model, existing growth methods often assume the availability of narrower models, obscuring the true computational cost of the entire pipeline. We propose an efficient training protocol, RBDC, that builds wide models by coupling in a parameter-free block-diagonal way narrower, independently trained models in a recursive way. This allows a flexible allocation of the training budget available across all the models involved. Evaluated with vision transformers (DeiT) and convolutional networks (ResNet) on ImageNet, our RBDC training protocol shows a much better efficiency than models trained from scratch with the standard protocol, yielding 30% FLOPs reduction at similar test accuracies. It also achieves higher performances at same training FLOPs than training protocols from the model growth literature. Finally, we show that our models can serve as better backbones than their original counterparts for downstream object detection and instance segmentation tasks.

cs.CV