Efficient Training with Foresight: Multi-Token Auxiliary Supervision for Autoregressive Image Generation

TL;DR

MTAR框架通过多令牌预测和语义丢弃在ImageNet上实现了高效的自回归图像生成,FID降低0.95。

cs.CV 🔴 高级 2026-08-26 39 次浏览
Guo Niu Xiongfei Yao Teng Wang Nannan Zhu
自回归图像生成 多令牌预测 对比正则化 高效训练 语义丢弃

核心发现

方法论

MTAR框架通过引入多令牌预测(MTP)、令牌级对比正则化(TCR)和语义丢弃(SD)来提升自回归图像生成的效率和质量。MTP通过对多个未来令牌进行联合监督来缓解传统NTP的稀疏性和短视性;TCR通过增强令牌表示的可分性来提高表示的判别性;SD通过减少低信息令牌的冗余计算来加速训练。

关键结果

  • 在ImageNet上,MTAR相比LlamaGen,FID降低0.95,训练速度提高39%。即使只用1/3的训练迭代,性能仍优于基线。
  • MTAR在相同训练迭代下,生成质量显著优于LlamaGen,FID从3.80降至2.85。
  • 通过消融实验验证,MTP、TCR和SD的组合显著提升了生成质量和训练效率。

研究意义

MTAR框架在自回归图像生成领域具有重要意义。它不仅在生成质量和训练效率上优于现有方法,还为解决稀疏监督和高计算成本等长期存在的问题提供了新的思路。其在ImageNet上的优异表现表明该方法在大规模数据集上的潜力。

技术贡献

MTAR通过引入多令牌预测和语义丢弃,显著提升了自回归图像生成的效率和质量。与现有方法相比,MTAR在不增加推理开销的情况下,提供了更密集的训练信号和更有效的表示正则化。

新颖性

MTAR首次在自回归图像生成中引入多令牌预测和语义丢弃,显著改善了传统NTP的稀疏性和短视性。这种创新在于其通过联合监督和语义感知的训练加速策略,提升了模型的上下文建模能力。

局限性

  • 在某些复杂场景下,MTAR可能仍面临表示冗余的问题,特别是在高维数据上。
  • 语义丢弃可能导致某些关键信息的丢失,影响生成质量。

未来方向

未来工作可以探索MTAR在其他类型数据集上的应用,以及进一步优化语义丢弃策略以减少信息损失。

AI 总览摘要

近年来,自回归图像生成在高保真合成方面展现了巨大潜力。然而,传统的下一令牌预测(NTP)由于稀疏和短视的监督信号以及高昂的计算成本,面临诸多挑战。为解决这些问题,本文提出了多令牌自回归(MTAR)框架,通过多令牌预测(MTP)、令牌级对比正则化(TCR)和语义丢弃(SD)三个方面提升自回归图像生成的效率和质量。

具体而言,MTP通过对多个未来令牌进行联合监督,缓解了传统NTP的稀疏性和短视性;TCR通过增强令牌表示的可分性,提高了表示的判别性;SD通过减少低信息令牌的冗余计算,加速了训练。实验结果表明,MTAR在ImageNet上实现了更好的生成质量和训练效率,与LlamaGen相比,FID降低0.95,训练速度提高39%。

MTAR框架在自回归图像生成领域具有重要意义,不仅在生成质量和训练效率上优于现有方法,还为解决稀疏监督和高计算成本等长期存在的问题提供了新的思路。未来工作可以探索MTAR在其他类型数据集上的应用,以及进一步优化语义丢弃策略以减少信息损失。

深度分析

研究背景

自回归图像生成通过将图像离散化为令牌序列并逐个建模,已在高保真合成方面展现出巨大潜力。然而,传统的下一令牌预测(NTP)方法由于稀疏和短视的监督信号以及高昂的计算成本,面临诸多挑战。现有方法如LlamaGen、MaskGIT等在一定程度上缓解了这些问题,但仍存在生成质量和训练效率的权衡问题。

核心问题

传统的自回归图像生成方法由于稀疏和短视的监督信号,导致生成质量不佳。此外,高昂的计算成本限制了其在大规模数据集上的应用。如何在不增加推理开销的情况下,提高生成质量和训练效率,是该领域亟待解决的问题。

核心创新

MTAR框架通过以下创新提升自回归图像生成的效率和质量:

1) 多令牌预测(MTP):通过对多个未来令牌进行联合监督,缓解了传统NTP的稀疏性和短视性。

2) 令牌级对比正则化(TCR):通过增强令牌表示的可分性,提高了表示的判别性。

3) 语义丢弃(SD):通过减少低信息令牌的冗余计算,加速了训练。

方法详解

MTAR框架的核心方法包括:

  • �� 多令牌预测(MTP):在传统NTP基础上,增加多个辅助头,对未来令牌进行联合监督。
  • �� 令牌级对比正则化(TCR):对隐藏令牌表示施加轻量级正则化,提高表示的判别性。
  • �� 语义丢弃(SD):基于外部视觉编码器提取的语义重要性分数,优先保留语义显著的令牌。

实验设计

实验在ImageNet数据集上进行,使用VQGAN令牌器进行预处理。主要基线为LlamaGen,评估指标包括FID、IS、Precision和Recall。实验设计包括消融实验,以验证MTP、TCR和SD的有效性。

结果分析

实验结果表明,MTAR在ImageNet上实现了更好的生成质量和训练效率。与LlamaGen相比,MTAR-B和MTAR-L在相同训练迭代下,FID分别降低0.96和0.95,训练速度分别提高1.27倍和1.39倍。

应用场景

MTAR框架适用于需要高效生成高质量图像的场景,如自动驾驶、虚拟现实和内容生成。其高效的训练过程使其在大规模数据集上的应用成为可能。

局限与展望

尽管MTAR在生成质量和训练效率上表现优异,但在某些复杂场景下,可能仍面临表示冗余的问题。此外,语义丢弃可能导致某些关键信息的丢失,影响生成质量。

通俗解读 非专业人士也能看懂

想象一个工厂,传统的自回归图像生成就像一个流水线,每次只能处理一个零件,效率很低。MTAR就像一个智能工厂,可以同时处理多个零件,并且根据零件的重要性来分配资源。这样不仅提高了效率,还保证了产品的质量。多令牌预测就像是同时加工多个零件,令牌级对比正则化则是确保每个零件的质量,而语义丢弃就像是只专注于重要的零件,而忽略那些不重要的。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,传统的方法每次只能放一个拼图块,这样很慢。MTAR就像是一个超级拼图玩家,可以同时放多个拼图块,而且只挑选那些最重要的块来放。这样不仅拼得快,而且拼得好!多令牌预测就像是同时放多个拼图块,令牌级对比正则化确保每个块都放对地方,而语义丢弃就像是只挑选最重要的块来放。

术语表

多令牌预测 (Multi-Token Prediction)

同时预测多个未来令牌的技术,提供更密集的训练信号。

用于缓解传统NTP的稀疏性和短视性。

令牌级对比正则化 (Token-Level Contrastive Regularization)

通过增强令牌表示的可分性来提高表示判别性的方法。

用于提高隐藏令牌表示的判别性。

语义丢弃 (Semantic Dropping)

通过减少低信息令牌的冗余计算来加速训练的策略。

用于提高训练效率。

自回归图像生成 (Autoregressive Image Generation)

通过逐个建模令牌序列来生成图像的技术。

MTAR框架的基础。

FID (Fréchet Inception Distance)

用于评估生成图像质量的指标,数值越低越好。

用于评估MTAR的生成质量。

开放问题 这项研究留下的未解疑问

  • 1 如何在不损失关键信息的情况下进一步优化语义丢弃策略?
  • 2 MTAR在其他类型数据集上的表现如何?
  • 3 如何在更复杂的场景下提高MTAR的表示能力?

应用场景

近期应用

自动驾驶

通过高效生成高质量图像来提升自动驾驶系统的感知能力。

虚拟现实

在虚拟现实中生成逼真的场景,提高用户体验。

远期愿景

内容生成

在内容生成领域实现更高效的图像生成,推动创意产业的发展。

原文摘要

Autoregressive (AR) image generation has shown strong potential for scalable high-fidelity synthesis by modeling images as discrete token sequences. However, traditional next token prediction (NTP) continues to suffer from sparse and myopic supervision, insufficiently discriminative representations, and high training cost caused by dense computation over the full token sequence. To address these issues, we propose multi-token autoregressive (MTAR), a unified training framework that improves autoregressive image generation from three aspects: prediction objectives, representation regularization, and training efficiency. Specifically, MTAR introduces multi-token prediction (MTP) to alleviate the sparsity and myopia of traditional NTP by imposing joint supervision on multiple future tokens; employs token-level contrastive regularization (TCR) to explicitly enhance the separability of sampled token representations and thereby improve representation discriminability; and incorporates semantic dropping (SD) as a semantics-aware training acceleration strategy to reduce redundant computation on low-information tokens while preserving informative learning signals. All three components are applied only during training and introduce no additional overhead during autoregressive inference. On ImageNet, MTAR achieves a better balance between generation quality and training efficiency. Compared with LlamaGen, MTAR achieves up to 0.95 lower FID and 39\% faster training. Moreover, even with only 1/3 of the training iterations, it still attains performance comparable to or better than the baseline, substantially reducing training time.

cs.CV