Muse: Text-To-Image Generation via Masked Generative Transformers
Muse:基于掩码生成Transformer实现高效文本到图像生成,FID达6.06。
核心发现
方法论
Muse采用离散Token空间中的掩码建模任务,结合预训练大语言模型(T5-XXL)提取文本嵌入,利用VQGAN编码图像为离散Token。模型由基础掩码Transformer和超分辨率Transformer组成,前者预测被随机掩码的图像Token,后者将低分辨率Token转换为高分辨率。训练中采用变动掩码率和交叉熵损失,推理中实现并行解码,显著提升效率。模型参数范围从632M到3B,训练在Imagen数据集上,FID在CC3M达6.06,零样本COCO评7.88,CLIP得分0.32。
关键结果
- 在CC3M数据集上,632M模型实现FID 6.06,优于所有现有方法;3B模型在零样本COCO上达FID 7.88,CLIP得分0.32。推理速度比Imagen和Parti快10倍以上,优于Stable Diffusion 3倍。
- 模型能理解细粒度语言信息,包括对象、空间关系、姿态和数量,生成高保真图像。支持无微调的图像编辑任务,如修补、扩展和无掩码编辑。
- 通过预训练的LLM增强语言理解,模型在多样化风格、复杂句式和多对象场景表现出色,符合人类评判标准。
研究意义
该模型突破了生成效率与质量的双重瓶颈,推动文本到图像生成技术向更高速度和更高保真度发展。利用离散Token和并行解码,显著降低推理成本,为大规模应用提供可能。模型对视觉概念的理解增强了多模态交互的潜力,未来可在内容创作、虚拟现实、辅助设计等领域广泛应用,推动AI生成内容的普及与创新。
技术贡献
提出基于掩码Transformer的离散Token预测架构,结合预训练大语言模型实现细粒度语言理解。引入变动掩码率和并行解码机制,显著提升推理速度。模型在多尺度图像生成中实现端到端训练,支持无微调的图像编辑功能。创新在于将离散Token建模与掩码训练结合,突破了像素空间diffusion和自回归模型的效率限制,为大规模高质量生成提供新思路。
新颖性
首次将掩码Transformer用于离散Token空间的文本到图像生成,结合预训练LLM实现细粒度理解。不同于传统的像素空间diffusion或自回归模型,采用并行解码和变动掩码策略,极大提升效率。模型架构支持多尺度生成和零样本编辑,展现出强大的多功能性和高效性。
局限性
- 模型在处理长文本或复杂多句描述时,仍存在部分细节丢失或表达不准确的问题,尤其在高对象数量或长短句的场景中表现有限。
- 尽管推理速度显著提升,但在超大模型(如3B参数)上仍需大量计算资源,限制了边缘设备的部署。
- 模型对极端复杂场景或特定风格的生成仍有待优化,未来需结合更丰富的训练数据和多模态信息增强能力。
未来方向
未来将探索更高效的解码策略,如渐进式蒸馏或ODE采样,以进一步缩短推理时间。增强模型对长文本和复杂场景的理解能力,结合多模态预训练数据,提升生成多样性和细节表现。还将研究模型在视频和3D内容生成中的潜力,推动多模态内容的跨模态理解与创造。
AI 总览摘要
Muse是一款基于掩码生成Transformer的文本到图像模型,结合预训练大语言模型(T5-XXL)实现对复杂语言的细粒度理解。通过离散Token空间中的掩码预测,模型在保持高生成质量的同时,大幅提升了推理效率。其核心架构包括基础掩码Transformer和超分辨率Transformer,支持多尺度图像生成。训练采用变动掩码率和交叉熵损失,推理中实现并行解码,显著减少采样步骤。实验结果显示,632M参数模型在CC3M数据集上FID达6.06,优于所有现有方法;3B模型在零样本COCO上FID为7.88,CLIP得分0.32,推理速度比传统diffusion和自回归模型快10倍以上。模型理解对象、空间关系、姿态和数量等视觉概念,支持无微调的图像编辑任务。其创新点在于结合预训练语言模型与离散Token掩码建模,突破了效率瓶颈,为大规模高质量生成提供新思路。未来,模型将继续优化推理速度,增强复杂场景理解,并拓展到视频和3D内容生成,推动多模态AI内容创造的边界。
深度分析
研究背景
近年来,生成模型在文本到图像任务中取得显著进展,代表性工作包括DALL-E、Imagen和Stable Diffusion。这些模型多基于扩散或自回归架构,虽然生成质量不断提升,但在推理速度和多样性控制方面仍存在瓶颈。深度学习中的Transformer架构被广泛应用于多模态任务,结合大规模预训练模型(如GPT、T5)增强理解能力。此前的研究多集中在像素空间或连续潜在空间,缺乏高效的离散Token建模。Muse借鉴了掩码建模和离散Token技术,结合预训练语言模型,旨在解决生成速度与质量的矛盾,推动模型在多样性和细节表现上的突破。
核心问题
现有文本到图像生成模型在生成速度、细节保真度和多样性方面仍有限,尤其是在大规模应用中推理成本高昂。扩散模型虽能生成高质量图像,但采样步骤繁琐,速度缓慢;自回归模型虽快,但难以实现大规模并行。如何在保证生成质量的同时,显著提升推理效率,成为亟待解决的问题。此外,模型对复杂语言和多对象场景的理解能力仍需增强,以满足实际应用需求。
核心创新
1) 离散Token空间中的掩码建模,利用VQGAN编码图像为离散Token,减少连续空间的复杂性。2) 结合预训练大语言模型(T5-XXL)提取丰富的文本语义信息,增强模型对细粒度语言的理解。3) 引入变动掩码率策略,提升模型对不同遮挡比例的适应能力。4) 采用并行解码机制,大幅缩短采样时间,提升推理速度。5) 支持多尺度生成,通过基础模型和超分辨率模型实现高分辨率输出,兼顾细节和语义一致性。这些创新共同推动模型在效率和质量上的突破。
方法详解
- �� 采用预训练T5-XXL提取文本嵌入,作为Transformer模型的条件输入。• 使用两个VQGAN编码器,将图像分别编码为256×256和512×512的离散Token序列。• 基础掩码Transformer在Token空间中预测随机掩码的Token,训练中采用交叉熵损失。• 变动掩码率策略,随机遮挡不同比例Token,增强模型泛化能力。• 推理时,利用并行解码逐步预测Token,减少采样步骤(如24步预测256Token)。• 超分辨率Transformer将低分辨率Token转换为高分辨率Token,支持多尺度生成。• 支持无微调的图像编辑任务,通过掩码预测实现修补、扩展和无掩码编辑。
实验设计
模型在Imagen数据集上训练,632M和3B参数版本,训练时间约1周,采用TPU-v4。评估指标包括FID、CLIP得分和人类评价。在CC3M上,632M模型FID达6.06,优于所有对比模型;在零样本COCO上,3B模型FID为7.88,CLIP得分0.32。对比Diffusion和自回归模型,Muse推理速度快10倍以上。还进行了多样性、风格和复杂场景的定性评估,验证模型对细粒度语言和多对象关系的理解能力。
结果分析
模型在多个指标上超越SOTA,尤其在FID和速度方面表现突出。CC3M上实现了前所未有的低FID 6.06,显示出高质量生成能力。零样本COCO评估中,FID 7.88和CLIP 0.32表明模型对文本的理解和图像的匹配能力强。推理速度比传统diffusion模型快10倍,支持实时交互。模型还能实现无微调的修补、扩展和风格迁移,展示了强大的多功能性。
应用场景
模型可广泛应用于内容创作、虚拟现实、广告设计等领域,支持快速生成高质量图像。无需微调,用户只需提供文本描述即可获得对应图像,极大降低门槛。未来,结合多模态预训练和多任务学习,有望实现更复杂的场景理解和生成,推动AI在艺术、娱乐和工业设计中的创新。
局限与展望
模型在处理长句或复杂描述时,仍存在细节丢失和表达不准确的问题,尤其在高对象数量或长文本中表现不足。推理仍需大量计算资源,限制边缘设备部署。对极端风格或特殊场景的生成能力有限,未来需结合更丰富的数据和多模态信息进行优化。
通俗解读 非专业人士也能看懂
想象你在一个工厂里,工厂的任务是把文字变成图片。工厂里有一个特别的机器(模型),它先读懂你写的描述,就像工人用放大镜仔细看每个词。然后,它用一种特殊的“码”把图片拆成很多小块(Token),这些小块就像拼图的碎片。机器会随机把一些碎片遮住,然后猜出缺失的部分,就像拼图游戏一样。通过不断猜测和修正,最后拼出一幅完整的图片。这个工厂的特别之处在于,它可以非常快地完成拼图,比以前那些慢吞吞的机器快十倍,还能理解你描述的细节,比如对象的数量、位置和姿态。它还能在不需要重新训练的情况下,帮你修补、扩展图片,甚至改变风格,就像魔法一样。这个技术让我们未来可以用一句话,快速得到高质量的图片,应用在游戏、设计、虚拟现实等很多领域,变得更方便、更智能。
简单解释 像给14岁少年讲一样
想象你在玩拼图游戏,但这个拼图可以自己动,知道你想要什么样的图片!你只要告诉它一句话,比如‘一只戴着太阳镜的猫’,它就能用很多小碎片拼出一幅漂亮的猫的画。这个拼图游戏特别厉害,因为它用了一种聪明的机器(模型),可以快速猜出缺失的碎片,而且还能理解你说的话里隐藏的细节,比如猫的姿势、背景或风格。更酷的是,它不用重新训练,只要给它一些例子,就能帮你修补图片、画出更大的画面,甚至改变画的风格。就像有个神奇的画家助手,听一句话就能画出你想要的图片,而且还很快!这让我们以后用一句话就能得到想要的图片,应用在游戏、动画、虚拟世界里,变得超级方便和有趣!
原文摘要
We present Muse, a text-to-image Transformer model that achieves state-of-the-art image generation performance while being significantly more efficient than diffusion or autoregressive models. Muse is trained on a masked modeling task in discrete token space: given the text embedding extracted from a pre-trained large language model (LLM), Muse is trained to predict randomly masked image tokens. Compared to pixel-space diffusion models, such as Imagen and DALL-E 2, Muse is significantly more efficient due to the use of discrete tokens and requiring fewer sampling iterations; compared to autoregressive models, such as Parti, Muse is more efficient due to the use of parallel decoding. The use of a pre-trained LLM enables fine-grained language understanding, translating to high-fidelity image generation and the understanding of visual concepts such as objects, their spatial relationships, pose, cardinality etc. Our 900M parameter model achieves a new SOTA on CC3M, with an FID score of 6.06. The Muse 3B parameter model achieves an FID of 7.88 on zero-shot COCO evaluation, along with a CLIP score of 0.32. Muse also directly enables a number of image editing applications without the need to fine-tune or invert the model: inpainting, outpainting, and mask-free editing. More results are available at https://muse-model.github.io