Discrete Diffusion Bridges for Spatiotemporally Aligned Image Translation and Generation

TL;DR

提出离散扩散桥(DDB),通过混合吸收和信息引导噪声调度解决图像生成中的时空错位问题。

cs.CV 🔴 高级 2026-08-31 30 次浏览
Xing Xie Jiawei Liu Shijun Zhou Huijie Fan Zhi Han Yandong Tang Liangqiong Qu
离散扩散模型 图像翻译 图像生成 时空对齐 混合吸收机制

核心发现

方法论

DDB通过混合吸收机制将源图像作为空间锚点注入扩散潜空间,并设计信息引导噪声调度优先处理高信息区域,确保训练与推理路径一致。

关键结果

  • 在OmniEdit数据集上,DDB的编辑分数达0.779,显著优于其他方法,同时保持背景一致性(DINO得分0.790)。
  • 在SynthRAD数据集的CT到MRI转换中,DDB的PSNR为28.43,SSIM为0.91,LPIPS降至0.12,超越现有基线。
  • 在MIMIC-CXR数据集的文本到图像生成任务中,DDB的FID为16.8,CLIP分数为0.87,展现了强大的文本图像对齐能力。

研究意义

DDB解决了离散扩散模型在图像翻译和生成中的时空错位问题,显著提升了编辑对齐性和结构保真度,推动了生成模型在医学影像生成和复杂图像编辑中的应用。

技术贡献

提出混合吸收机制和信息引导噪声调度,重新定义扩散模型的噪声状态,优化训练路径与推理路径的一致性,显著提升生成质量和效率。

新颖性

DDB首次通过混合吸收机制将源图像信息直接注入扩散潜空间,并通过信息引导调度实现训练与推理的时空对齐,开创了新的扩散模型设计思路。

局限性

  • 在极低采样步数下,复杂场景的生成质量仍有下降。
  • 需要较高的计算资源支持大规模模型训练。
  • 混合吸收机制在无源图像任务中的适用性需进一步验证。

未来方向

未来可探索DDB在多模态生成任务中的扩展应用,并优化模型架构以降低计算成本,同时研究其在实时生成场景中的表现。

AI 总览摘要

离散扩散模型近年来在图像生成领域取得了显著进展,但其在图像翻译任务中存在时空错位问题:训练过程中随机掩码顺序与推理中的“易先难后”解码机制不一致,且纯掩码状态忽略了源图像的结构信息。

本文提出离散扩散桥(DDB),通过混合吸收机制将源图像信息注入扩散潜空间,作为空间锚点,同时设计信息引导噪声调度优先处理高信息区域,确保训练路径与推理路径一致。

实验表明,DDB在OmniEdit、SynthRAD和MIMIC-CXR等数据集上显著提升了编辑对齐性、结构保真度和生成质量,展现了其在复杂图像翻译和文本到图像生成中的广泛适用性。

深度分析

研究背景

离散扩散模型通过掩码和预测机制实现高保真图像生成,已广泛应用于图像编辑和生成任务。然而,传统模型在图像翻译任务中存在时空错位问题,导致编辑对齐性和结构保真度下降。

核心问题

标准离散扩散模型的训练过程采用随机掩码顺序,忽略了复杂区域的优先处理需求,同时纯掩码状态无法保留源图像的结构信息,影响生成质量。

核心创新

DDB通过混合吸收机制将源图像信息作为空间锚点注入扩散潜空间,并设计信息引导噪声调度优先处理高信息区域,确保训练与推理路径一致。

方法详解

  • �� 混合吸收机制:定义吸收状态为源图像与掩码的混合分布,保留空间锚点。
  • �� 信息引导噪声调度:基于信息密度优先掩盖高信息区域,构建“难先易后”训练路径。
  • �� 推理过程:从混合吸收状态开始,动态解码低信息区域,逐步处理复杂编辑。

实验设计

在OmniEdit数据集上评估图像编辑性能,在SynthRAD数据集上验证模态转换能力,并在MIMIC-CXR数据集上测试文本到图像生成质量。

结果分析

DDB在OmniEdit数据集上的编辑分数为0.779,显著优于基线;在SynthRAD数据集上的PSNR为28.43,SSIM为0.91;在MIMIC-CXR数据集上的FID为16.8,CLIP分数为0.87。

应用场景

DDB可用于医学影像生成、复杂图像编辑和跨模态图像翻译,适合需要高保真度和精确编辑的场景。

局限与展望

DDB在极低采样步数下的生成质量仍有下降,且需要较高的计算资源支持大规模模型训练。未来可优化架构以降低计算成本。

通俗解读 非专业人士也能看懂

可以将DDB比作一个智能画家。传统画家需要从空白画布开始,而DDB的画布上已经有一部分草图(源图像信息)。它先处理最复杂的部分,比如画出人物的脸,然后再填充背景和细节。这样既能保持原画的结构,又能快速完成复杂的编辑。

简单解释 像给14岁少年讲一样

想象你在玩一个拼图游戏,传统方法是把所有拼图块都打乱再开始拼。而DDB的方法是先把一些关键拼图块固定下来,比如边框和角落,然后再根据这些固定块拼出整个图。这样既快又准,是不是很聪明?

术语表

离散扩散模型 (Discrete Diffusion Model)

一种通过掩码和预测机制生成图像的模型,采用离散状态空间。

用于图像翻译和生成任务。

混合吸收机制 (Hybrid Absorption Mechanism)

将源图像信息与掩码混合,作为扩散模型的吸收状态。

解决空间锚点缺失问题。

信息引导噪声调度 (Information-Guided Noise Schedule)

基于信息密度优先处理高信息区域的掩码策略。

用于优化训练路径与推理路径的一致性。

FID (Fréchet Inception Distance)

衡量生成图像与真实图像分布差异的指标。

用于评估生成质量。

CLIP分数 (CLIP Score)

衡量文本与图像对齐程度的指标。

用于评估文本到图像生成任务。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步优化混合吸收机制以适应无源图像任务?
  • 2 能否降低DDB的计算成本以支持实时生成场景?

应用场景

近期应用

医学影像生成

支持从文本生成高质量医学影像,提升诊断效率。

复杂图像编辑

实现精确的图像局部编辑和风格转换,适用于设计领域。

远期愿景

实时生成系统

开发实时图像生成技术,应用于游戏和虚拟现实场景。

原文摘要

We propose Discrete Diffusion Bridges (DDB), a novel framework designed to resolve the fundamental spatiotemporal misalignment of standard discrete diffusion in image translation and generation. By corrupting data into a pure mask state via a random schedule, the conventional forward process induces a twofold misalignment: spatially, this pure-mask destination entirely discards the rich structural priors of the source image; temporally, the random masking order inherently contradicts the ``easy-first, hard-last'' decoding mechanism used during inference. To address this, DDB constructs a direct and efficient trajectory between domains. Spatially, we introduce a hybrid absorption mechanism that redefines the absorbing state to a stochastic mixture of mask and source tokens, effectively injecting source prior as spatial anchors into the latent space. Temporally, we design an information-guided noise schedule that quantifies semantic variation to prioritize the corruption of high-information regions at earlier timesteps. This ensures the model learns to resolve difficult semantic changes using robust context from invariant regions. Extensive experiments validate the versatility and robustness of our framework across diverse generative paradigms. DDB effectively balances edit alignment with structural fidelity across both text-guided semantic manipulation and pure structural image translation, while inherently complementing text-to-image generation and guaranteeing robust high-quality decoding under extremely low sampling steps. Code and models are available at \href{https://github.com/HKU-HealthAI/DDB}{https://github.com/HKU-HealthAI/DDB}.

cs.CV