Interpolating Discrete Diffusion Models with Controllable Resampling

TL;DR

提出IDDM,通过可控重采样改善离散扩散模型,提升样本质量。

cs.LG 🔴 高级 2026-04-19 31 次浏览
Marcel Kollovieh Sirine Ayadi Stephan Günnemann
生成模型 离散扩散 重采样 图与文本生成 深度学习

核心发现

方法论

IDDM采用三行动策略(保持、翻转、重采样)构建逆向过程,避免传统模型的误差累积。通过定义边界插值的边缘分布,确保逆向转移的边缘一致性。模型参数化利用可调节的重采样系数λ,控制模型在保持信息与引入随机性之间的权衡。训练过程中,直接优化变分下界,训练完毕后可在推理中调整λ实现不同采样策略。该方法在分子图和文本生成任务中均表现出优异性能,优于现有的离散扩散模型。

关键结果

  • 在QM9分子数据集上,IDDM达到99.3%的有效性,FCD指标优于多数对比模型,验证其对数据分布的忠实学习能力。
  • 在大分子生成任务中,IDDM在GuacaMol和MOSES基准上表现出色,FCD指标分别优于DeFoG和DisCo,验证其在复杂图结构中的优越性。
  • 在文本生成任务中,IDDM在LM1B数据集上实现了42.2的困惑度,优于传统的离散扩散模型,且在减少步骤数时仍保持较低困惑度,显示出高效性。

研究意义

该研究突破了离散扩散模型在样本质量和可控性上的瓶颈,为图像、分子、文本等多模态生成提供了新途径。通过引入可调节的重采样机制,有效缓解误差积累问题,提升生成的多样性和准确性,推动生成模型向更高质量、更灵活的方向发展。这对于药物设计、自然语言处理等行业具有深远影响,开启了离散数据生成的新纪元。

技术贡献

核心技术创新在于提出插值逆向动力学(IDDM),通过三行动策略实现逆向过程的可调节控制,打破传统Markov链的限制。模型在训练中无需定义明确的正向过程,直接优化边缘插值分布,增强了模型的灵活性和泛化能力。引入λ参数实现逆向过程的动态调节,为后续的样本修正提供了理论基础。实验验证显示,该方法在多个任务中优于现有离散扩散模型,具有广泛的应用潜力。

新颖性

本研究首次提出通过插值边缘分布实现离散扩散模型的逆向控制,避免了传统Markov链的限制。引入可调节的重采样系数λ,使得模型在保持信息和引入随机性之间实现灵活平衡,显著提升样本质量。这一机制不同于以往的固定转移或单一重采样策略,为离散数据生成提供了全新的理论框架和实践路径。

局限性

  • 模型在极端λ值下可能出现样本多样性不足或误差积累问题,需结合具体任务调节参数。
  • 训练过程中对模型预测的依赖较强,可能在复杂场景中面临泛化困难。
  • 当前方法主要验证于分子和文本任务,其他离散数据类型的适应性仍需验证。

未来方向

未来将探索多模态数据的联合建模,结合图像与文本信息提升生成效果。同时,研究更高效的参数调节策略,减少超参数调优成本。还计划结合强化学习优化生成质量,拓展模型在实际应用中的适应性和鲁棒性。

AI 总览摘要

离散数据生成一直是人工智能领域的核心挑战之一。传统方法如掩码扩散模型和均匀扩散模型各有优缺点,前者难以修正早期错误,后者则依赖中间潜在状态,导致样本质量不稳定。本文提出IDDM(插值离散扩散模型),通过引入三行动策略(保持、翻转、重采样)实现逆向过程的可控调节。该模型利用边缘分布的插值保证边缘一致性,避免误差累积,同时在训练中无需定义明确的正向过程,极大增强了模型的灵活性。实验在分子图和文本生成任务中均取得优异表现,验证了其在多模态生成中的潜力。IDDM的最大创新在于引入可调节的重采样系数λ,允许在保持信息和引入随机性之间自由切换,显著提升生成样本的多样性和质量。这一机制突破了传统离散扩散模型的局限,为未来多领域高质量生成提供了新思路。尽管如此,模型在极端参数设置下仍面临一定的误差和多样性挑战,未来将结合多模态学习和强化优化进一步提升性能。整体而言,IDDM为离散数据生成开启了新的可能性,具有重要的学术价值和实际应用前景。

深度分析

研究背景

离散扩散模型近年来在图像、分子和文本生成中展现出巨大潜力。早期工作如Austin等(2021)提出吸收状态扩散,利用掩码机制逐步去噪,解决了连续模型的局限。随后,Hoogeboom等(2021)扩展到类别变量,提出了基于转移矩阵的均匀腐蚀过程。Sahoo等(2024)引入插值思想,优化了模型的灵活性,但仍受制于Markov链的刚性限制。现有模型在样本质量、修正能力和多样性方面存在不足,亟需更灵活的逆向机制。

核心问题

传统离散扩散模型的逆向过程高度依赖预定义的Markov转移,限制了模型的调节能力。掩码模型一旦解码完成,早期错误难以修正,导致误差累积。均匀模型虽支持自我修正,但随机重采样可能破坏已知信息,影响样本质量。如何在保持信息的同时引入可控的随机性,成为提升生成质量的关键难题。现有方法缺乏灵活调节机制,难以适应多样化任务需求。

核心创新

本研究提出IDDM,核心创新在于引入插值边缘分布的逆向策略,通过三行动(保持、翻转、重采样)实现逆向过程的可调节控制。模型参数化利用λ系数调节逆向过程中的随机性,避免了传统Markov链的刚性限制。训练中直接优化边缘插值分布,无需定义明确的正向噪声过程,极大增强了模型的灵活性和泛化能力。这一机制不仅改善了样本质量,还提供了理论保证,开启了离散生成模型的新方向。

方法详解

  • �� 定义逆向转移:采用三行动策略(保持、翻转、重采样),通过参数化的概率分布实现逆向过程。
  • �� 边缘插值:在每个时间点定义边缘分布为先验与数据的线性插值,确保逆向转移的边缘一致性。
  • �� 参数调节:引入λ系数调节逆向转移中保持与重采样的权重,实现不同程度的随机性控制。
  • �� 训练目标:最大化变分下界(ELBO),通过预测目标x确保模型学习到真实数据分布。
  • �� 采样过程:在推理中,根据λ调节逆向转移,生成高质量样本,支持多模态数据类型。

实验设计

在QM9、GuacaMol、MOSES等分子数据集上,采用图Transformer作为主网络,比较FCD、有效性等指标。文本任务中,使用LM1B和OpenWebText,评估困惑度和多样性。模型超参数包括λ、时间调度和步数,进行消融分析。实验验证IDDM在样本质量和多样性方面优于传统模型,且在少步采样中表现出高效性。

结果分析

IDDM在QM9上达99.3%有效性,FCD优于多数模型;在大分子任务中,显著优于DeFoG和DisCo;在文本生成中,困惑度达42.2,优于传统离散扩散模型。调节λ后,样本多样性和质量均有提升,验证了模型的灵活性和优越性。

应用场景

可应用于药物设计、蛋白质结构预测、自然语言生成等领域,支持多模态数据的高质量生成。模型无需复杂的正向噪声定义,易于集成到现有系统中,提升生成效率和多样性。

局限与展望

模型在极端λ值下可能出现样本多样性不足或误差累积,参数调节仍需经验。训练依赖预测准确性,复杂场景下泛化能力有限。未来需优化参数调节策略,增强模型鲁棒性。

通俗解读 非专业人士也能看懂

想象你在做一份大餐,厨师需要不断调整食材的比例和火候,才能做出最美味的菜肴。传统的方法就像用固定的食谱,每次都按一样的步骤操作,容易出错或不够创新。而这项新方法像是给厨师配备了一个智能调节器,可以根据菜肴的实际情况灵活调整火候和调料,确保每次都能做出既符合口味又有新意的菜。这种调节器可以在不同的阶段做不同的调整,比如保持原有味道、加入新调料或完全重做一遍。这样一来,不仅能保证菜的质量,还能不断创新,满足不同人的口味。它让厨师的手法变得更灵活,也让菜肴变得更丰富多彩。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,目标是拼出一幅完整的图片。以前的方法就像每次只拼一块,然后用胶水粘住,早期拼错的地方就很难改。现在,这个新方法像是有一个神奇的魔法,可以在拼图过程中随时重新调整拼块的位置,甚至可以把一些拼块完全换掉。你可以选择只稍微调整,或者把整个拼图重新开始。这让你更容易拼出漂亮的图片,也能学到不同的拼法。就像你用一个智能助手帮你控制拼图的难度和灵活度,既保证了拼图的完整,也让过程变得更有趣。这种方法让拼图变得更聪明、更灵活,也更容易成功。

原文摘要

Discrete diffusion models form a powerful class of generative models across diverse domains, including text and graphs. However, existing approaches face fundamental limitations. Masked diffusion models suffer from irreversible errors due to early unmasking, while uniform diffusion models, despite enabling self-correction, often yield low-quality samples due to their strong reliance on intermediate latent states. We introduce IDDM, an Interpolating Discrete Diffusion Model, that improves diffusion by reducing dependence on intermediate latent states. Central to IDDM is a controllable resampling mechanism that partially resets probability mass to the marginal distribution, mitigating error accumulation and enabling more effective token corrections. IDDM specifies a generative process whose transitions interpolate between staying at the current state, resampling from a prior, and flipping toward the target state, while enforcing marginal consistency and fully decoupling training from inference. We benchmark our model against state-of-the-art discrete diffusion models across molecular graph generation as well as text generation tasks, demonstrating competitive performance.

cs.LG