Scaling Text-to-Image Diffusion Transformers with Representation Autoencoders

TL;DR

使用表示自编码器扩展文本到图像扩散变压器,RAE在所有模型规模上优于VAE。

cs.CV 🔴 高级 2026-01-23 11 次浏览
Shengbang Tong Boyang Zheng Ziteng Wang Bingda Tang Nanye Ma Ellis Brown Jihan Yang Rob Fergus Yann LeCun Saining Xie
表示自编码器 扩散模型 文本到图像 大规模生成 稳定性

核心发现

方法论

该研究采用表示自编码器(RAE)与冻结的SigLIP-2编码器结合,进行大规模文本到图像生成。通过在高维语义潜在空间中进行扩散,简化了架构,尤其是在噪声调度方面。实验中,RAE在从0.5B到9.8B参数的扩散变压器规模上均表现优于最先进的FLUX VAE。

关键结果

  • RAE在预训练阶段的收敛速度比VAE快4倍,在GenEval和DPG-Bench上分别提高了4.0倍和4.6倍。
  • 在高质量数据集上微调时,VAE模型在64个epoch后出现严重过拟合,而RAE模型在256个epoch后仍保持稳定。
  • RAE模型在所有实验中表现出更快的收敛速度和更好的生成质量,证明其在大规模T2I生成中比VAE更简单且更强大。

研究意义

该研究证明了RAE在大规模文本到图像生成中的优势,解决了VAE在高维潜在空间中扩散的效率问题。通过在共享表示空间中进行视觉理解和生成,RAE为多模态模型的统一提供了新的可能性,对学术界和工业界具有重要意义。

技术贡献

RAE通过在高维语义潜在空间中进行扩散,简化了架构,尤其是在噪声调度方面。与现有的VAE方法相比,RAE在大规模生成任务中表现出更好的稳定性和效率,提供了新的理论保证和工程可能性。

新颖性

RAE首次在大规模文本到图像生成中展示了其相对于VAE的优势,尤其是在高维语义潜在空间中进行扩散的能力。相比于传统的VAE方法,RAE在生成质量和收敛速度上均有显著提升。

局限性

  • RAE在特定领域如文本重建中需要针对性的数据监督,否则难以重现细节。
  • 在大规模模型中,某些架构复杂性如宽扩散头的优势不明显。

未来方向

未来的研究可以探索RAE在其他多模态生成任务中的应用,以及如何进一步优化数据组合以提高特定领域的生成质量。

AI 总览摘要

在文本到图像生成领域,现有的变分自编码器(VAE)方法在高维潜在空间中的扩散效率较低,导致生成质量和收敛速度受限。为解决这一问题,研究者提出了使用表示自编码器(RAE)的方法,通过在高维语义潜在空间中进行扩散,简化了架构,尤其是在噪声调度方面。

实验结果表明,RAE在从0.5B到9.8B参数的扩散变压器规模上均表现优于最先进的FLUX VAE。在预训练阶段,RAE的收敛速度比VAE快4倍,并在GenEval和DPG-Bench上分别提高了4.0倍和4.6倍。在高质量数据集上微调时,VAE模型在64个epoch后出现严重过拟合,而RAE模型在256个epoch后仍保持稳定。

RAE的优势在于其能够在共享表示空间中进行视觉理解和生成,为多模态模型的统一提供了新的可能性。这一研究不仅在学术界引起了广泛关注,也为工业界提供了新的思路。然而,RAE在特定领域如文本重建中仍需针对性的数据监督,未来的研究可以进一步优化数据组合以提高特定领域的生成质量。

深度分析

研究背景

文本到图像生成是计算机视觉领域的一个重要课题,近年来,扩散模型因其在生成质量上的优势而受到广泛关注。传统的变分自编码器(VAE)方法在高维潜在空间中的扩散效率较低,导致生成质量和收敛速度受限。为此,研究者们提出了多种改进方法,如FLUX VAE,但仍存在一定的局限性。

核心问题

现有的VAE方法在高维潜在空间中扩散效率较低,导致生成质量和收敛速度受限。尤其是在大规模文本到图像生成任务中,如何提高模型的稳定性和生成质量是一个重要的研究问题。

核心创新

研究者提出了使用表示自编码器(RAE)的方法,通过在高维语义潜在空间中进行扩散,简化了架构,尤其是在噪声调度方面。RAE在大规模生成任务中表现出更好的稳定性和效率。

方法详解

  • �� 使用SigLIP-2作为冻结的表示编码器,结合RAE进行大规模文本到图像生成。
  • �� 在高维语义潜在空间中进行扩散,简化了架构,尤其是在噪声调度方面。
  • �� 通过在多种数据集上进行训练,验证RAE在不同领域的生成能力。

实验设计

实验设计包括在多个数据集上进行训练和测试,如ImageNet、YFCC和RenderedText。使用GenEval和DPG-Bench作为评估指标,比较RAE与FLUX VAE在不同模型规模上的性能差异。

结果分析

实验结果表明,RAE在从0.5B到9.8B参数的扩散变压器规模上均表现优于最先进的FLUX VAE。RAE的收敛速度比VAE快4倍,并在GenEval和DPG-Bench上分别提高了4.0倍和4.6倍。

应用场景

RAE在大规模文本到图像生成任务中具有广泛的应用前景,尤其是在需要高质量生成和快速收敛的场景中,如广告创意生成和虚拟现实内容制作。

局限与展望

RAE在特定领域如文本重建中需要针对性的数据监督,否则难以重现细节。在大规模模型中,某些架构复杂性如宽扩散头的优势不明显。未来的研究可以进一步优化数据组合以提高特定领域的生成质量。

通俗解读 非专业人士也能看懂

想象一个大型工厂,VAE就像是一个传统的流水线工厂,工人们按照固定的步骤组装产品,但效率不高。而RAE则像是一个现代化的智能工厂,使用机器人在高维空间中灵活组装产品,效率更高,质量更好。在这个智能工厂中,RAE通过在共享的语义空间中进行操作,能够快速生成高质量的产品,适应各种不同的需求。

简单解释 像给14岁少年讲一样

嘿,小伙伴们!想象一下你在玩一个超级酷的游戏,你可以用文字描述来生成游戏中的场景。传统的方法就像是用老旧的游戏引擎,生成速度慢,画质也一般。而RAE就像是最新的游戏引擎,速度快,画质超棒!它能在一个共享的空间中理解你的文字描述,快速生成你想要的场景。是不是很酷?

术语表

表示自编码器 (Representation Autoencoder)

一种用于生成模型的自编码器,能够在高维语义潜在空间中进行扩散。

在本文中用于提高文本到图像生成的效率和质量。

扩散模型 (Diffusion Model)

一种生成模型,通过逐步添加噪声来生成数据。

用于文本到图像生成任务中。

SigLIP-2

一种冻结的表示编码器,用于生成高维语义潜在空间。

在本文中作为RAE的基础编码器。

GenEval

一种用于评估生成模型性能的指标。

在实验中用于评估RAE和VAE的生成质量。

FLUX VAE

一种最先进的变分自编码器,用于生成模型。

在本文中作为RAE的对比基准。

开放问题 这项研究留下的未解疑问

  • 1 如何在不增加数据量的情况下提高特定领域的生成质量?
  • 2 RAE在其他多模态生成任务中的表现如何?
  • 3 如何进一步优化RAE的架构以提高效率?

应用场景

近期应用

广告创意生成

RAE可用于快速生成高质量的广告创意,提高广告制作效率。

远期愿景

虚拟现实内容制作

RAE可用于生成虚拟现实中的高质量场景,推动虚拟现实技术的发展。

原文摘要

Representation Autoencoders (RAEs) have shown distinct advantages in diffusion modeling on ImageNet by training in high-dimensional semantic latent spaces. In this work, we investigate whether this framework can scale to large-scale, freeform text-to-image (T2I) generation. We first scale RAE decoders on the frozen representation encoder (SigLIP-2) beyond ImageNet by training on web, synthetic, and text-rendering data, finding that while scale improves general fidelity, targeted data composition is essential for specific domains like text. We then rigorously stress-test the RAE design choices originally proposed for ImageNet. Our analysis reveals that scaling simplifies the framework: while dimension-dependent noise scheduling remains critical, architectural complexities such as wide diffusion heads and noise-augmented decoding offer negligible benefits at scale Building on this simplified framework, we conduct a controlled comparison of RAE against the state-of-the-art FLUX VAE across diffusion transformer scales from 0.5B to 9.8B parameters. RAEs consistently outperform VAEs during pretraining across all model scales. Further, during finetuning on high-quality datasets, VAE-based models catastrophically overfit after 64 epochs, while RAE models remain stable through 256 epochs and achieve consistently better performance. Across all experiments, RAE-based diffusion models demonstrate faster convergence and better generation quality, establishing RAEs as a simpler and stronger foundation than VAEs for large-scale T2I generation. Additionally, because both visual understanding and generation can operate in a shared representation space, the multimodal model can directly reason over generated latents, opening new possibilities for unified models.

cs.CV