DisCo-Diff: Enhancing Continuous Diffusion Models with Discrete Latents

TL;DR

DisCo-Diff结合离散连续潜变量,提升扩散模型性能,显著降低ODE曲率。

cs.LG 🔴 高级 2024-07-04 46 次浏览
Yilun Xu Gabriele Corso Tommi Jaakkola Arash Vahdat Karsten Kreis
生成模型 扩散模型 离散潜变量 图像合成 分子对接

核心发现

方法论

DisCo-Diff在连续时间扩散模型中引入可学习的离散潜变量,通过编码器推断,端到端训练。离散潜变量简化噪声到数据的映射,降低生成ODE的曲率。模型结合自回归Transformer建模离散潜变量分布,使用少量小码本。实验验证在Toy数据、图像合成和分子对接中均提升性能,特别在ImageNet-64/128上实现了SOTA FID。核心机制包括:• 增强扩散模型以离散潜变量• 编码器端到端学习• Gumbel-Softmax连续松弛• 自回归模型采样离散潜变量。

关键结果

  • DisCo-Diff在ImageNet-64/128类别条件下,利用ODE采样器实现了FID 1.65,优于现有最优模型(如EDM 6.20和VDM 1.43),提升显著。
  • 在Toy 2D高斯混合模型中,离散潜变量捕获不同模态,ODE轨迹变直,曲率明显降低,验证模型简化效果。
  • 在分子对接任务中,离散潜变量帮助识别关键原子,改善多模态不确定性建模,提升性能。
  • 在不同架构和潜变量数量的消融实验中,少量离散潜变量表现优异,验证其简化学习的有效性。

研究意义

该研究突破了扩散模型在复杂多模态数据中的瓶颈,通过引入离散潜变量,显著降低生成ODE的曲率,提升生成质量。模型无需预训练网络,具有广泛适用性,为高质量图像合成和分子设计提供新思路。其端到端训练框架简洁高效,推动了生成模型向更高性能、更强泛化能力方向发展,解决了传统连续潜变量难以捕获多模态结构的问题。

技术贡献

DisCo-Diff创新性在于结合离散与连续潜变量,端到端训练无须预训练网络,利用Gumbel-Softmax实现离散潜变量的连续松弛。模型通过分离离散与连续变异,降低生成ODE的曲率,简化学习难度。引入自回归Transformer建模离散潜变量分布,增强模型的表达能力。整体架构设计兼顾泛用性与效率,显著提升生成质量,达到SOTA水平。

新颖性

本研究首次系统性将离散潜变量融入连续时间扩散模型,利用少量全局离散潜变量捕获数据的多模态结构,减少ODE曲率,提升生成性能。与以往依赖大规模空间潜变量或预训练编码器的工作不同,DisCo-Diff端到端学习,具有更强的普适性和简洁性。这一创新突破了传统连续潜变量难以建模多模态的局限,为生成模型设计提供新范式。

局限性

  • 模型依赖少量离散潜变量,可能在极端多模态或高复杂度数据中表现不足,需进一步扩展潜变量容量。
  • 训练过程中引入Gumbel-Softmax连续松弛,可能引入偏差,影响潜变量的表达能力。
  • 在高维复杂任务中,模型的计算成本仍较高,需优化推理效率。

未来方向

未来可探索更大规模潜变量码本,提升多模态表达能力;结合预训练编码器增强特征表达;优化采样算法以降低计算成本;扩展至视频、3D模型等多模态生成场景,推动生成模型的广泛应用。

AI 总览摘要

近年来,扩散模型(Diffusion Models, DMs)在生成高质量图像和分子结构方面取得了巨大突破,但其在复杂多模态数据中的学习难题依然突出。传统的连续潜变量模型难以捕获数据的多样性,导致生成轨迹曲率大、训练困难。为解决这一瓶颈,Yilun Xu等提出了DisCo-Diff框架,创新性地引入少量可学习的离散潜变量,显著简化噪声到数据的映射过程。

DisCo-Diff通过端到端训练,将编码器与扩散模型结合,利用Gumbel-Softmax实现离散潜变量的连续松弛,避免了预训练依赖。模型中的离散潜变量捕获数据的全局结构,辅助主扩散模型降低ODE轨迹的弯曲度,从而提升生成质量。自回归Transformer建模离散潜变量的分布,确保采样的多样性和一致性。

在Toy二维高斯混合、图像合成及分子对接等多个任务中,DisCo-Diff均展现出优异性能。在ImageNet-64/128类别条件下,模型实现了FID 1.65的SOTA水平,优于现有最优模型如EDM和VDM。实验还验证了少量离散潜变量在简化学习、提升效果中的关键作用。

该研究不仅突破了连续潜变量在多模态数据中的局限,还为未来多模态生成提供了新思路。其端到端、无需预训练的设计具有广泛适用性,推动生成模型向更高质量、更强泛化能力发展。未来,模型有望扩展到视频、3D等多模态场景,助力智能内容创造的多领域应用。

深度分析

研究背景

扩散模型在图像和分子结构生成中取得显著成功,但其核心依赖连续潜变量,难以捕获复杂多模态数据的多样性。早期工作如Ho等(2020)提出的DDPM,以及Karras等(2022)提出的EDM,推动了高质量生成,但在高维复杂数据中,噪声到数据的映射变得异常复杂,导致ODE轨迹弯曲,训练难度增加。近年来,结合离散潜变量的尝试逐渐增多,如VQ-VAE(van den Oord et al., 2017)和其他空间潜变量模型,旨在捕获数据的全局结构,但大多依赖大规模空间潜变量和预训练编码器,限制了模型的普适性和效率。

核心问题

传统连续潜变量模型在多模态数据生成中面临两大难题:一是生成轨迹的高弯曲度导致训练不稳定,二是难以有效捕获数据的多样性。尤其在图像、分子等复杂场景中,单一连续潜变量难以表达多模态结构,造成模型泛化差、样本多样性不足。现有方法多依赖大规模空间潜变量或预训练编码器,增加了模型复杂度和训练成本。如何设计一种简洁、有效的潜变量结构,既能捕获全局多模态信息,又能简化学习过程,成为亟待解决的问题。

核心创新

DisCo-Diff的核心创新在于引入少量可学习的离散潜变量,结合端到端训练框架,有效降低生成ODE的曲率。具体包括:• 离散潜变量编码全局结构,简化噪声到数据的映射• 端到端学习,无需预训练编码器,增强模型普适性• 利用Gumbel-Softmax实现离散潜变量的连续松弛,优化梯度传播• 自回归Transformer建模离散潜变量分布,确保采样多样性。这些创新使模型在复杂多模态任务中表现优异,突破了传统连续潜变量的局限。

方法详解

  • �� 设计扩散模型框架,加入离散潜变量z,编码全局信息• 编码器Eϕ通过输入清晰数据推断离散潜变量,输出类别分布• 训练目标扩展为同时优化扩散模型和编码器,最小化噪声还原误差• 利用Gumbel-Softmax实现离散潜变量的连续松弛,支持梯度反传• 训练中随机用null潜变量替代部分离散潜变量,增强模型鲁棒性• 自回归模型Aψ学习离散潜变量的联合分布,采样时先生成离散潜变量,再通过ODE采样生成数据• 设计多层交叉注意机制,将离散潜变量融入主网络,增强全局特征表达。

实验设计

在Toy二维高斯混合、图像合成(ImageNet-64/128)和分子对接任务中验证模型性能。使用FID指标评估生成质量,比较不同潜变量数量和架构。在Toy数据中,离散潜变量捕获模态,ODE轨迹变直。在图像任务中,DisCo-Diff实现了FID 1.65,优于EDM(6.20)和VDM(1.43)。消融实验显示少量潜变量效果最佳,验证简化学习的有效性。模型还在不同采样策略和架构下进行验证,确保鲁棒性。

结果分析

DisCo-Diff在ImageNet-64/128类别条件下,利用ODE采样实现了FID 1.65,优于现有最优模型(如EDM 6.20和VDM 1.43),提升显著。在Toy二维高斯混合模型中,离散潜变量成功捕获不同模态,ODE轨迹变直,模型学习更稳定。分子对接实验中,离散潜变量帮助识别关键原子,改善多模态不确定性建模,提升性能。多架构和潜变量数量的消融验证显示,少量潜变量即可实现性能提升,验证了设计的合理性。

应用场景

该模型适用于高质量图像生成、分子结构设计及其他多模态生成任务。无需预训练编码器,端到端训练简化流程,适合多行业应用。未来可扩展到视频、3D模型等场景,推动内容创作、药物设计等领域的发展。模型的全局潜变量捕获数据的宏观结构,有助于实现更丰富、更多样的生成内容。

局限与展望

模型在极端多模态或高复杂度数据中潜变量容量可能不足,需扩展潜变量空间。Gumbel-Softmax松弛引入偏差,影响潜变量表达。训练成本仍较高,特别在高维任务中需优化推理效率。未来需探索更大潜变量集和高效采样算法,以应对更复杂场景。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭,食材代表数据。传统的做法是用一种调料(连续潜变量)来调味,但这种调料很难表达所有不同的味道,尤其是当菜肴多样时。DisCo-Diff就像加入几种特殊的调料(离散潜变量),每种代表一种大致的风格或主题,比如辣味、甜味。这样,厨师(模型)只需根据这些调料选择不同的做法,就能做出多样的菜肴。离散调料让整体味道更容易控制,做饭也更快更好吃。模型通过学习这些调料的组合,能更精准地还原复杂菜肴的风味,像在生成多样的图片或分子结构一样。

简单解释 像给14岁少年讲一样

想象你在玩拼图游戏,每块拼图代表一部分图片。以前的方法就像用一块大拼图拼出整个图,但有时候拼图太复杂,容易出错。DisCo-Diff像是用几块小拼图,每块代表一个大概的主题,比如颜色或形状。这样拼图就变得简单多了!模型先学会每块拼图的内容,然后再把它们拼在一起,拼出完整的图片。这样一来,不同的拼图组合可以拼出很多不同的图片,就像你用不同的主题拼出不同的场景。这个方法让拼图变得更快、更准确,也能拼出更丰富多彩的画面。

原文摘要

Diffusion models (DMs) have revolutionized generative learning. They utilize a diffusion process to encode data into a simple Gaussian distribution. However, encoding a complex, potentially multimodal data distribution into a single continuous Gaussian distribution arguably represents an unnecessarily challenging learning problem. We propose Discrete-Continuous Latent Variable Diffusion Models (DisCo-Diff) to simplify this task by introducing complementary discrete latent variables. We augment DMs with learnable discrete latents, inferred with an encoder, and train DM and encoder end-to-end. DisCo-Diff does not rely on pre-trained networks, making the framework universally applicable. The discrete latents significantly simplify learning the DM's complex noise-to-data mapping by reducing the curvature of the DM's generative ODE. An additional autoregressive transformer models the distribution of the discrete latents, a simple step because DisCo-Diff requires only few discrete variables with small codebooks. We validate DisCo-Diff on toy data, several image synthesis tasks as well as molecular docking, and find that introducing discrete latents consistently improves model performance. For example, DisCo-Diff achieves state-of-the-art FID scores on class-conditioned ImageNet-64/128 datasets with ODE sampler.

cs.LG cs.AI cs.CV