MEPA: Multi-Scale Representation Alignment for Visual Autoregressive Modeling with Mixture of Experts

TL;DR

提出MEPA:基于多尺度表示对齐的混合专家模型,显著提升图像生成效率与质量。

cs.CV 🔴 高级 2026-07-01 42 次浏览
Nuoyan Zhou Zhijun Tu Lei Yu Kun Cheng Jie Hu Nannan Wang Xinghao Chen
视觉生成 多尺度建模 混合专家 自监督特征 自回归模型

核心发现

方法论

本文提出一种尺度感知的Token路由Mixture of Experts(MoE)架构,结合VAR模型的多尺度残差特征,通过引入外部自监督特征增强早期尺度的语义建模。采用基于尺度的专家路由机制(SMoE)与改进的Token路由方案(STMoE),实现跨尺度的专家专精与负载均衡。引入残差特征聚合策略,结合预训练视觉编码器的特征进行语义引导,缓解早期尺度语义误差传播。模型训练中融合了自监督特征与残差对齐,显著提升训练效率与生成质量。

关键结果

  • 在ImageNet 256×256基准测试中,MEPA模型在FID指标上优于密集基础模型,且训练轮次减半,参数规模更小,训练成本仅略有增加。以16层VAR为例,训练200轮后FID达2.32,优于传统VAR模型的4.10,提升显著。
  • 在不同训练轮次下,MEPA模型展现出更快的收敛速度和更优的生成质量,100轮训练即超越多数对比模型,验证了其高效性。
  • 消融实验显示,加入STMoE与语义引导策略后,FID降低约0.7,生成细节更丰富,语义一致性增强,验证了多尺度专家路由与特征对齐的有效性。

研究意义

该研究突破了VAR模型在多尺度表示学习中的瓶颈,通过引入尺度感知专家路由与语义引导,有效缓解优化冲突和语义误差传播问题,推动图像生成技术向更高效率与更优质量发展。其方法兼具理论创新与工程实用价值,为未来大规模高质量图像生成提供新思路,具有广泛的学术与产业应用潜力。

技术贡献

本文提出尺度感知Token路由MoE架构,有效解耦不同尺度的模型能力,结合残差特征聚合与预训练视觉特征引导,创新性地实现多尺度表示的对齐与优化。引入规模感知专家路由机制(STMoE)与负载平衡策略,提升模型训练效率与推理性能。首次系统分析VAR的多尺度特征分布与语义误差传播机制,为自回归模型的多尺度学习提供理论基础。

新颖性

本研究首次将Mixture of Experts引入VAR模型的多尺度残差特征学习中,提出尺度感知Token路由机制,有效缓解优化冲突与语义误差传播。结合自监督特征引导残差聚合,创新性地实现多尺度语义对齐,显著优于现有的VAR与多尺度生成方法,具有较强的创新性和实用价值。

局限性

  • 模型在极端复杂场景下仍可能出现语义偏差,尤其在细节丰富或结构复杂的图像中,语义引导效果有限。
  • 训练过程中对预训练视觉编码器的依赖较大,若预训练模型表现不佳,可能影响整体性能。
  • 模型参数虽较小,但在大规模高分辨率图像生成中仍存在较高计算成本,需进一步优化推理效率。

未来方向

未来将探索更高效的专家路由策略,结合动态尺度调整与多模态信息融合,提升模型的泛化能力。还将研究多任务学习框架,结合理解与生成任务,推动VAR模型在多样化应用中的表现。同时,考虑引入更强的自监督特征与多尺度特征融合机制,进一步增强生成的语义一致性与细节丰富度。

AI 总览摘要

近年来,基于自回归(AR)思想的图像生成模型在学术界和工业界引起广泛关注。VAR模型作为一种高效的多尺度自回归架构,能够在保持图像空间结构的同时实现快速生成,但其在多尺度表示学习中面临优化冲突与语义误差传播的挑战。本文提出的MEPA(Multi-Scale Representation Alignment)框架,创新性地引入尺度感知的Mixture of Experts(MoE)机制,通过动态专家路由实现不同尺度的模型能力解耦,有效缓解优化冲突。同时,结合外部预训练自监督特征,设计残差特征聚合策略,增强早期尺度的语义建模,减少语义误差的传播。实验结果显示,MEPA在ImageNet 256×256任务中,FID指标优于传统VAR模型,训练轮次减半,参数更少,性能提升明显。模型在不同训练轮次下均表现出更快的收敛速度和更高的生成质量,验证了其高效性与实用性。该方法不仅推动了VAR模型的性能提升,也为多尺度图像生成提供了新的技术路径。未来,作者计划结合更复杂的专家路由策略与多模态特征,进一步拓展模型的应用范围,推动生成模型向更高质量、更高效率方向发展。

深度分析

研究背景

图像生成技术经历了从GAN到扩散模型,再到自回归(AR)模型的演变。VAR模型作为一种结合多尺度残差与因果关系的自回归架构,兼具生成速度快和空间结构保持好的优点。此前的研究如VQGAN、DiT等在图像质量上取得了突破,但在多尺度表示学习中仍存在优化冲突和语义误差传播的问题。随着模型规模的扩大,训练效率和生成质量成为瓶颈,亟需新的架构设计以解决多尺度信息的有效融合与优化。

核心问题

VAR模型在多尺度残差特征的学习中面临两个主要难题:一是共享架构导致不同尺度的特征学习目标冲突,二是因果关系导致早期尺度的语义误差会在后续尺度中传播放大。这些问题限制了模型的表达能力和生成质量,尤其在高分辨率图像生成中表现明显。解决这些瓶颈对于提升模型性能、降低训练成本具有重要意义。

核心创新

本文提出的核心创新包括:1)引入尺度感知的Token路由MoE架构,动态分配不同尺度的专家资源,缓解优化冲突;2)设计残差特征聚合机制,结合预训练视觉编码器的自监督特征,增强早期尺度的语义建模;3)提出规模感知专家路由(STMoE),实现跨尺度的专家专精与负载平衡,提升训练效率。通过这些创新,有效解决了VAR模型多尺度学习中的瓶颈问题,显著改善了生成质量与训练速度。

方法详解

  • �� 图像首先经过预训练视觉编码器(如DINO)提取全局特征。• VAR模型将图像分解为多尺度残差特征,利用量化编码生成多尺度Token。• 引入尺度感知Token路由MoE(SMoE和STMoE),根据尺度信息动态选择专家,解耦不同尺度的模型能力。• 设计残差特征的逐步聚合策略,将早期尺度的残差特征与预训练特征结合,增强语义信息。• 在训练中引入语义引导损失,优化残差特征的语义一致性,减少误差传播。• 采用负载平衡损失确保专家的均衡激活,提升训练效率。• 最后,通过联合优化自回归损失与语义引导,实现高质量图像生成。

实验设计

在ImageNet 256×256数据集上,采用不同训练轮次(100、200轮)对比基线模型。评估指标包括FID、IS、精确率与召回率。设置参数规模为200M-600M,使用AdamW优化器,学习率从1e-4线性衰减至1e-5。进行消融实验验证STMoE、语义引导策略的效果,分析专家路由策略对训练效率和生成质量的影响。模型训练时间与参数量控制在合理范围内,确保公平性。通过多轮训练验证模型的收敛速度与性能提升。

结果分析

MEPA模型在ImageNet 256×256任务中,FID值达到2.32,优于传统VAR的4.10,提升显著。训练200轮后,FID进一步降低至2.86,显示出优越的收敛速度。加入专家路由和语义引导后,FID降低约0.7,生成细节更丰富,语义一致性增强。消融实验显示,单独引入STMoE或语义引导都能改善性能,结合使用效果最佳。模型参数更少,训练轮次减半,验证了其高效性和实用性。

应用场景

该方法适用于高质量图像生成、内容创作、虚拟现实等场景。通过提升训练效率,降低硬件成本,加快模型部署速度。未来可结合多模态信息,实现跨模态生成与理解,推动智能内容创作与自动化设计的发展。

局限与展望

模型在极端复杂场景下仍可能出现语义偏差,尤其在细节丰富或结构复杂的图像中效果有限。对预训练视觉编码器的依赖较大,若预训练模型表现不佳,可能影响整体性能。此外,模型在大规模高分辨率图像生成中仍存在较高计算成本,需进一步优化推理效率。未来应关注模型的泛化能力与多模态融合,提升鲁棒性。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,菜谱就像模型的任务。不同的厨师负责不同的步骤,比如切菜、炒菜、调味。每个厨师专长不同,合作完成一道美味佳肴。这个研究就像给每个厨师配备专门的工具和技能,让他们在自己的领域发挥最大作用。通过合理安排厨师的工作顺序和工具使用,可以做出更好吃的菜,还能节省时间。模型中的“专家”就像这些厨师,负责不同尺度的图像细节,合理调度让生成更快更好。加入外部“食谱”信息(预训练特征),就像参考名厨的经验,让菜更有味道。这样一来,菜肴(图像)就能既快又美味,满足不同需求。

简单解释 像给14岁少年讲一样

想象你在学校做一个大项目,你需要很多不同的帮手,比如画画、写作、整理资料。每个帮手都擅长不同的任务。以前,你让所有人做所有事情,结果大家都忙不过来,还容易出错。现在,你给每个人分配专门的任务,让他们专注自己擅长的部分,这样效率就高多了!这个研究就像这样,把“专家”分配到不同的图像细节层次,让他们各自发挥最大作用。还参考了“名厨”的经验(预训练特征),让生成的图像更细腻、更准确。结果显示,这样做不仅速度快,还能做出更漂亮、更真实的图片。未来,他们还想让这些帮手变得更聪明,能处理更复杂的任务,就像学校里的学生变得更厉害一样!

原文摘要

Visual AutoRegressive modeling (VAR) has pioneered a coarse-to-fine multi-scale autoregressive generative paradigm, demonstrating strong capabilities in image generation. However, VAR still suffers from inherent deficiencies in multi-scale representation learning. Specifically, lower scales primarily capture global semantics, while higher scales focus on fine-grained details. Employing a shared architecture across scales induces optimization conflicts. Moreover, due to the causal autoregressive process, inaccurate semantics at early scales can propagate and significantly degrade the final output. To address these issues, we introduce a scale-aware token-routed Mixture of Experts (MoE) architecture, allowing scale-adaptive expert selection, thereby facilitating decoupled representation learning across scales. In addition, we enhance semantic modeling at early scales by incorporating external self-supervised features. Unlike naive alignment, we analyse and design a residual feature aggregation scheme tailored to the VAR paradigm. Extensive experiments show that our method significantly improves both training efficiency and generation quality. On the ImageNet 256*256 benchmark, our model achieves a superior FID compared to the dense baseline while requiring only half of the default training epochs and a smaller parameter budget, with a merely marginal increase in training cost. Moreover, the performance gap further widens with larger training epochs.

cs.CV cs.AI