Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

TL;DR

提出Nemotron-Labs-Diffusion-Image,结合可动态修正的离散掩码扩散模型,提升高分辨率图像生成质量,达成0.90的GenEval评分。

cs.CV 🔴 高级 2026-06-29 32 次浏览
Shufan Li Greg Heinrich Hanrong Ye Yonggan Fu Aditya Grover Jan Kautz Pavlo Molchanov
深度学习 图像生成 扩散模型 离散编码 自我修正

核心发现

方法论

该方法采用单一解码器Transformer架构,结合掩码扩散和令牌编辑机制。引入分组交叉熵(GCE)目标,缓解大词汇表稀疏问题。模型在训练中通过随机掩码和令牌腐蚀,学习动态修正已解码的令牌,提升生成质量。利用定制融合算子降低大词汇表下的VRAM消耗。核心创新在于令牌编辑机制和分组交叉熵,增强模型自我修正能力和训练效率。

关键结果

  • 在1024像素高分辨率文本到图像任务中,Nemotron-Labs-Diffusion-Image在GenEval上达0.90分,超越此前最优的Meissonic(0.66)和LaViDa-O(0.77),显示出显著性能提升。
  • 在DPG和MJHQ-30k数据集上,模型分别取得86.9和10.76的优异指标,验证其在多场景下的泛化能力。
  • 消融实验表明,令牌编辑和GCE目标显著改善图像细节和一致性,提升生成的自我修正能力和训练稳定性。

研究意义

该研究突破了离散图像生成的自我修正瓶颈,结合大词汇表提升重建保真度,推动多模态模型向更高分辨率和更复杂场景发展。模型在保持高效训练的同时,实现了与连续扩散模型相媲美的图像质量,为未来多模态生成提供新思路。

技术贡献

提出令牌编辑机制,允许模型在推理过程中动态修正已解码令牌,缓解误差累积。设计分组交叉熵(GCE)目标,有效缓解大词汇表稀疏问题,提升训练效率。采用单一解码器Transformer架构,结合预训练语言模型,增强模型理解和生成能力。这些创新显著改善了离散图像生成的自我修正和优化能力。

新颖性

首次在离散图像生成中引入令牌编辑机制,实现动态修正。提出分组交叉熵目标,有效缓解大词汇表稀疏,提升训练稳定性和效率。整体架构融合预训练语言模型,推动离散生成技术向高分辨率和复杂场景迈进。

局限性

  • 模型在极端复杂场景或超高分辨率(如4K)下仍存在细节不足或误差累积问题,需进一步优化编辑策略。
  • 训练成本较高,尤其在大词汇表和多级聚类情况下,硬件资源消耗大,限制了广泛应用。
  • 对多模态融合和多任务学习的适应性仍待验证,未来需扩展多模态场景的适用性。

未来方向

未来将探索更高效的令牌编辑策略,结合多模态信息增强生成能力。优化模型结构以降低训练成本,提升超高分辨率图像的细节表现。推动模型在多任务、多模态场景中的应用,拓展其实际工业价值。

AI 总览摘要

随着深度学习的发展,文本到图像的生成技术不断突破,尤其是基于扩散模型的高分辨率合成。传统连续扩散模型在逐步细化潜在表示方面表现优异,但在离散图像生成中面临自我修正能力不足的问题。为此,Nemotron-Labs团队提出了一种创新的离散掩码扩散模型(MDM),结合令牌编辑机制,实现了在推理过程中对已解码令牌的动态修正,显著提升图像质量。

该方法还引入分组交叉熵(GCE)目标,有效缓解大词汇表带来的稀疏训练信号问题,提升训练效率和模型稳定性。模型架构采用单一解码器Transformer,结合预训练的语言模型,增强了理解和生成能力。大量实验表明,模型在1024像素高分辨率文本到图像任务中,达到了0.90的GenEval评分,超越了多项SOTA模型。

这些创新不仅推动了离散图像生成技术的发展,也为多模态模型的未来奠定了基础。模型在多数据集上的优异表现,彰显其广泛应用潜力,包括内容创作、虚拟现实和智能设计等领域。未来,研究将聚焦于提升模型在极端复杂场景中的表现,降低训练成本,并拓展多模态融合的应用场景,推动生成模型迈向更高水平。

深度分析

研究背景

近年来,深度生成模型如GAN、VAE和连续扩散模型在图像合成中取得巨大成功。特别是潜在扩散模型(LDM)通过逐步去噪实现高质量生成,但在离散表示方面仍存在挑战。离散图像生成采用向量量化(VQ)编码,将图像转化为令牌序列,便于与大规模语言模型结合。早期工作如MaskGIT和Meissonic在速度和质量上取得突破,但缺乏自我修正机制,难以提升细节一致性。随着大词汇表的发展,重建保真度提升,但训练难度也随之增加,稀疏性成为瓶颈。本文在此背景下,提出创新的令牌编辑和分组交叉熵技术,旨在突破这些限制。

核心问题

离散图像生成面临两个核心难题:一是缺乏自我修正能力,导致误差在多步生成中累积,影响最终图像质量;二是大词汇表带来的训练稀疏问题,使得模型难以充分学习丰富的语义信息,限制了高保真度的生成。传统方法在修正已解码令牌和优化大词汇表方面效果有限,亟需新机制提升模型的自我修正能力和训练效率。

核心创新

首先,提出令牌编辑机制,允许模型在推理中动态修正已解码令牌,借鉴连续扩散模型的自我修正思想。其次,设计分组交叉熵(GCE)目标,将大词汇表中的代码分层聚类,提供多层次的语义监督,有效缓解稀疏性问题。此外,采用单一解码器Transformer架构,结合预训练语言模型,提升理解和生成能力。这些创新共同推动离散图像生成迈向更高的质量和效率。

方法详解

  • �� 构建单一解码器Transformer模型,输入文本提示和图像令牌。
  • �� 采用预训练的语言模型作为基础,替换最后一层以预测图像令牌。
  • �� 训练中引入随机掩码和令牌腐蚀,学习动态修正能力。
  • �� 设计令牌编辑机制,推理过程中根据置信度修正已解码令牌。
  • �� 利用分组聚类(K-means)将大词汇表分层,定义多级监督目标。
  • �� 训练时采用增强的ELBO目标,结合腐蚀策略和GCE,提升训练稳定性。
  • �� 实现定制融合算子,降低大词汇表下的VRAM消耗,保证训练效率。

实验设计

模型在256×256逐步扩展到1024×1024的训练策略上,使用64块H100 GPU,训练30万步。评估指标包括GenEval、DPG和MJHQ-30k,模型在高分辨率文本到图像任务中表现优异。对比基线模型如Meissonic和LaViDa-O,性能提升显著。还进行了消融实验验证令牌编辑和GCE的贡献,显示其在细节还原和一致性方面的优势。

结果分析

模型在1024像素生成中,GenEval得分达0.90,优于之前的SOTA(如Meissonic的0.66)。在DPG和MJHQ-30k上,指标分别为86.9和10.76,验证了其多场景适应性。消融实验显示,令牌编辑显著减少误差累积,提升细节丰富度。GCE目标有效缓解稀疏性,增强训练稳定性。整体结果表明,该方法在高分辨率图像生成中具有强大竞争力。

应用场景

该模型可应用于高质量内容创作、虚拟现实、广告设计等领域,尤其适合需要高分辨率和细节丰富的场景。其自我修正能力使得生成结果更自然、更一致,适合自动化内容生成和个性化定制。未来结合多模态信息,将推动多任务、多场景的智能生成系统发展。

局限与展望

模型训练成本较高,硬件资源需求大,限制了广泛部署。在极端复杂或超高分辨率场景下,细节还存在不足,误差累积问题未完全解决。模型对多模态融合和多任务适应性仍需优化,未来需在模型压缩和泛化能力上持续改进。

通俗解读 非专业人士也能看懂

想象你在雕塑一块大理石,刚开始只知道大致的形状,但细节还不够清晰。传统的雕塑方法可能一次性完成,效果不够细腻。而这个新方法像是给雕塑家配备了一个神奇的工具,可以在雕刻过程中不断观察、修正,逐步完善作品。模型就像这个雕塑家,先用一个大致的轮廓,然后在生成过程中不断修正细节,确保每一部分都更贴近理想的样子。它还用一种聪明的方式,把所有的可能的细节都分类,确保不会遗漏重要的部分。这样,最终的作品既细腻又真实,远远优于以前一次性完成的作品。这个技术让电脑像个聪明的艺术家,能不断改进自己的作品,变得越来越完美。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,刚开始只拼出大概的轮廓,但还不够漂亮。以前的电脑模型就像是一次拼完所有块,但如果拼错了,就不能再改了。现在,这个新方法像是给电脑装了个魔法工具,可以在拼图过程中不断检查和调整,修正之前拼错的部分。它还把所有的拼块分类,把相似的块放在一起,这样就能更快找到正确的块。最终拼出来的图片不仅细节丰富,而且看起来很自然,就像你用魔法拼出了最完美的画。这让电脑变得更聪明,能自己不断改进,做出更漂亮的图片。

术语表

Masked Discrete Diffusion (MDM) 掩码离散扩散

一种基于掩码机制的离散图像生成模型,通过逐步解码未掩码令牌实现高效高质量的图像合成。技术核心在于掩码和反向扩散过程。

本文提出的核心模型架构,用于高分辨率文本到图像生成。

Token Editing 令牌编辑

在推理过程中动态修正已解码令牌的机制,类似雕塑家反复打磨作品,提升生成一致性和细节。

模型中的关键创新,用于改善误差累积问题。

Grouped Cross-Entropy (GCE) 分组交叉熵

将大词汇表中的代码分层聚类,提供多层次语义监督,有效缓解稀疏信号问题,提升训练效率。

训练目标设计的创新部分,解决大词汇表带来的稀疏性。

Pretrained Diffusion Language Model 预训练扩散语言模型

基于文本任务预训练的Transformer模型,具备强理解能力,用于初始化图像生成模型。

模型架构的基础,提升理解和生成能力。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步提升令牌编辑的修正精度,减少误修和遗漏,仍是未来研究重点。
  • 2 大规模多模态训练的效率和成本问题尚未完全解决,需开发更高效的算法和硬件支持。
  • 3 模型在极端复杂场景(如超高分辨率、多模态融合)中的表现仍有限,未来需优化架构和训练策略。

应用场景

近期应用

内容创作与设计

可用于自动生成高质量图片,辅助广告、动画、虚拟场景设计,提升效率和创意表达。

虚拟现实与游戏开发

生成逼真场景和角色,支持个性化定制,推动虚拟环境的自动化生成。

远期愿景

多模态智能系统

结合文本、图像、声音等多模态信息,打造智能内容创作平台,实现全场景自动化生产。

原文摘要

We propose Nemotron-Labs-Diffusion-Image, a state-of-the-art masked discrete diffusion model (MDM) for high-resolution text-to-image synthesis. Compared with prior work on masked image generation, Nemotron-Labs-Diffusion-Image addresses two key challenges. First, unlike continuous diffusion models which progressively refine latent representations across the entire image, standard MDMs lack self-correcting capability because discrete tokens cannot be modified once they are unmasked. Second, although increasing the vocabulary size of discrete image tokenizers improves reconstruction fidelity, it introduces optimization difficulties for generative modeling as the per-token training signal becomes increasingly sparse. To address the first challenge, Nemotron-Labs-Diffusion-Image incorporates a token-editing mechanism that enables the model to dynamically revise already-unmasked tokens during inference, similar to how a sculptor iteratively refines their work. To tackle the second challenge, we propose a Grouped Cross-Entropy (GCE) objective that assigns positive learning signals to tokens neighboring the ground truth in embedding space, thereby alleviating signal sparsity. To further improve training efficiency, we implement a custom fused operator for GCE that significantly reduces VRAM usage in large-vocabulary settings. Experimental results demonstrate that these innovations substantially improve both training efficiency and image fidelity of masked discrete image generators, achieving a score of 0.90 on GenEval, 86.9 on DPG and 10.76 of HPSv3.

cs.CV