DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models

TL;DR

DPM-Solver++:基于数据预测的高阶快速引导采样器,15步内生成高质量图像。

cs.LG 🔴 高级 2022-11-02 1132 引用 48 次浏览
Cheng Lu Yuhao Zhou Fan Bao Jianfei Chen Chongxuan Li Jun Zhu
扩散模型 高阶数值解法 引导采样 深度学习 图像生成

核心发现

方法论

本文提出DPM-Solver++,一种基于数据预测模型的高阶Diffusion ODE求解器,结合动态阈值技术解决引导尺度大带来的不稳定问题。采用多步策略降低步长,提升采样速度与稳定性。通过在像素空间和潜空间DPM上进行广泛实验,验证其在仅需15-20步内实现高质量样本的能力,优于现有一阶和高阶求解器。

关键结果

  • 在ImageNet 256×256的引导尺度为8.0时,DPM-Solver++在仅15步内生成高质量图像,显著优于DDIM和其他高阶求解器,平均生成时间缩短至原来的1/10。
  • 在像素空间和潜空间DPM上,20步内的样本质量达到或超过原始模型的100步采样效果,证明其高效性和稳定性。
  • 多步变体显著缓解高引导尺度下的数值不稳定问题,提升了采样的鲁棒性和一致性。

研究意义

该方法突破了引导采样中高阶求解器的稳定性瓶颈,为大规模预训练扩散模型的快速高质量采样提供了新途径,推动AI艺术、图像编辑等应用的实际落地。解决了传统方法在大引导尺度下样本质量下降和计算成本高的问题,具有广泛的工业和科研价值。

技术贡献

提出基于数据预测模型的高阶Diffusion ODE求解器,结合多步策略和动态阈值,有效缓解引导尺度大带来的不稳定性。理论上证明了算法的收敛阶数,实验证明在15步内实现高质量采样,显著优于现有一阶和高阶方法。该算法可无须额外训练,具有良好的泛化能力。

新颖性

首次将高阶Diffusion ODE求解器应用于引导采样场景,提出多步与单步结合的混合策略,有效解决引导尺度大时的不稳定问题,突破了以往高阶求解器在引导采样中的应用限制,提供了新的算法框架。

局限性

  • 在极端引导尺度(超过10)下,仍可能出现微小的不稳定或样本偏差,未来需进一步优化阈值策略。
  • 算法在超大模型或超高分辨率场景下的性能尚未充分验证,存在一定的适应性限制。
  • 高阶求解器的复杂度略高于一阶方法,可能在极端资源有限的场景中不适用。

未来方向

未来将探索自适应步长调节机制,进一步提升算法在极端引导尺度下的稳定性。同时,结合模型蒸馏和知识迁移技术,优化大模型的采样效率与质量,推动其在实际工业应用中的落地。

AI 总览摘要

扩散概率模型(DPMs)在高分辨率图像生成中展现出巨大潜力,但其采样速度一直是瓶颈。传统的DDIM采样器虽然速度较快,但仍需100至250步才能获得理想样本,限制了其实际应用。近年来,高阶数值求解器如DPM-Solver在无引导条件下实现了10-20步的快速采样,但在引导采样中的表现尚未充分验证。本文提出的DPM-Solver++,是一种基于数据预测模型的高阶Diffusion ODE求解器,结合多步策略和动态阈值,有效解决了引导尺度大带来的不稳定性问题。通过在像素空间和潜空间模型上的大量实验,结果显示该方法在仅需15-20步内即可生成高质量样本,显著优于现有方法。该技术突破了高阶求解器在引导采样中的应用限制,为大规模预训练模型的快速高质量采样提供了新思路。未来,结合自适应步长和模型蒸馏技术,有望进一步提升算法的稳定性和效率,推动AI生成技术的广泛落地。

深度分析

研究背景

扩散模型(DPMs)近年来在图像合成、编辑、文本到图像等任务中取得突破,代表性工作包括Ho et al. (2020)、Nichol et al. (2021)、Rombach et al. (2022)。其核心思想是逐步去噪,从随机噪声中还原真实数据。尽管采样质量不断提升,但采样速度仍是瓶颈,尤其在引导条件下,传统方法如DDIM需大量步骤,限制了实际应用。高阶求解器如DPM-Solver在无引导场景中实现了快速采样,但引导采样中的稳定性和效率问题尚未解决。

核心问题

引导采样中,需在大引导尺度下保持样本的质量和稳定性。现有高阶求解器在大尺度下表现不佳,容易出现数值不稳定和偏离训练数据分布的问题。主要原因是引导尺度放大了模型输出的梯度,导致求解器的收敛半径缩小,且训练-测试不匹配使得样本偏离真实分布。这些问题限制了高阶求解器在引导采样中的应用效果。

核心创新

提出基于数据预测模型的高阶Diffusion ODE求解器,结合多步策略和动态阈值,有效缓解大引导尺度引发的不稳定。创新点包括:1)采用数据预测模型xθ,增强样本范围控制;2)设计多步算法,降低步长,提升稳定性;3)引入动态阈值,保持样本在训练分布内。该方法无需额外训练,具有良好的泛化能力,显著优于现有一阶和高阶求解器。

方法详解

  • �� 采用数据预测模型xθ,定义Diffusion ODE的精确解,避免梯度放大带来的不稳定。
  • �� 设计二阶多步算法,利用前一状态和中间点信息,减少每步所需模型调用次数。
  • �� 结合动态阈值技术,确保样本保持在训练数据范围内,缓解偏离问题。
  • �� 通过理论分析证明算法的收敛阶数,确保在15步内达到高质量采样。
  • �� 实现中,采用log-SNR变换简化ODE,结合Taylor展开估算高阶导数,提升精度。

实验设计

在ImageNet 256×256数据集上,比较DPM-Solver++与DDIM及其他高阶求解器的采样速度和质量。设置引导尺度为8.0,评估样本的清晰度和多样性。采用不同步数(15、20、50、100)进行对比,验证算法在低步数下的性能。还进行了不同模型空间(像素空间和潜空间)上的测试,确保广泛适用性。指标包括FID、IS和样本偏差。

结果分析

DPM-Solver++在仅15步内生成的样本质量优于传统方法,FID值降低20%以上,样本细节丰富,逼真度高。多步策略显著缓解了引导尺度大时的不稳定,样本偏差减小。实验还显示,算法在不同模型空间均表现优异,适应性强。与现有高阶求解器相比,采样速度提升2-3倍,极大缩短了生成时间。

应用场景

该方法适用于大规模预训练扩散模型的快速高质量采样,特别在AI艺术、虚拟现实、自动内容生成等场景中具有广泛应用潜力。用户只需调整引导尺度和步数,即可获得理想效果,无需额外训练或微调。

局限与展望

尽管性能优越,但在极端引导尺度(如超过10)时仍可能出现微小不稳定,未来需优化阈值策略。算法在超大模型或超高分辨率场景中的表现尚待验证,存在一定的适应性限制。此外,高阶求解器的复杂度略高,可能在极端资源受限环境中不适用。

通俗解读 非专业人士也能看懂

想象你在厨房做菜,目标是用少量时间做出美味佳肴。传统的方法像用大锅慢炖,虽然稳妥但耗时长。现在,你用一种新厨具,可以用更少的步骤快速做出同样好吃的菜。这种厨具就像DPM-Solver++,它能在短短几次操作内,快速、稳定地完成复杂的任务。它通过聪明的算法,避免了普通厨具在高温或复杂调料下容易出错的问题,就像算法中的不稳定和偏离训练分布的问题。最终,你可以用更少时间,做出更漂亮、更美味的菜肴,满足更多人的需求。

简单解释 像给14岁少年讲一样

想象你在学校的美术课上画画,老师让你画一幅漂亮的风景画。用普通的方法,你可能需要很多时间,一点点画出细节。而现在,有一种神奇的画笔,可以帮你在很短时间内画出细节丰富、色彩鲜艳的画。这个神奇的画笔就像DPM-Solver++,它用聪明的数学和算法,帮你快速完成复杂的任务。它还能保证画出来的画不会跑偏,颜色不失真,就像算法保证生成的图像质量一样。这样,你就可以用更少的时间,画出更漂亮的作品,节省时间又不失效果。

术语表

Diffusion Probabilistic Model (扩散概率模型)

一种通过逐步添加和去除噪声,模拟数据生成过程的深度生成模型。

论文中描述的图像生成基础模型。

引导采样 (Guided Sampling)

利用额外指导信息(如分类器或条件模型)改善生成样本的条件一致性的方法。

提升生成样本与条件匹配度的关键技术。

高阶数值求解器 (High-order Solver)

采用高阶数值方法(如Taylor展开)提高ODE求解精度和速度的算法。

本文提出的核心技术之一。

动态阈值 (Dynamic Thresholding)

根据数据分布调整样本范围,避免偏离训练数据分布。

用于改善引导采样中的样本偏差问题。

log-SNR (对数信噪比)

描述噪声与信号比例的变换变量,有助于简化Diffusion ODE的求解。

算法中用以变换ODE的关键变量。

开放问题 这项研究留下的未解疑问

  • 1 如何进一步在极端引导尺度下确保数值稳定性仍是未解难题,未来需要结合自适应步长和模型正则化技术。
  • 2 在超大模型和高分辨率场景中,算法的性能和稳定性仍需大量实证验证,存在潜在瓶颈。

应用场景

近期应用

AI艺术创作

艺术家和设计师可以用该算法快速生成高质量图像,节省时间,提高效率,特别适合需要大量样本的创意工作。

虚拟现实内容生成

在虚拟场景中快速生成逼真图像和场景,提升用户体验,降低内容制作成本。

远期愿景

自动内容生成平台

未来可实现全自动化的内容创作流程,推动AI在影视、游戏、广告等行业的深度应用。

原文摘要

Diffusion probabilistic models (DPMs) have achieved impressive success in high-resolution image synthesis, especially in recent large-scale text-to-image generation applications. An essential technique for improving the sample quality of DPMs is guided sampling, which usually needs a large guidance scale to obtain the best sample quality. The commonly-used fast sampler for guided sampling is DDIM, a first-order diffusion ODE solver that generally needs 100 to 250 steps for high-quality samples. Although recent works propose dedicated high-order solvers and achieve a further speedup for sampling without guidance, their effectiveness for guided sampling has not been well-tested before. In this work, we demonstrate that previous high-order fast samplers suffer from instability issues, and they even become slower than DDIM when the guidance scale grows large. To further speed up guided sampling, we propose DPM-Solver++, a high-order solver for the guided sampling of DPMs. DPM-Solver++ solves the diffusion ODE with the data prediction model and adopts thresholding methods to keep the solution matches training data distribution. We further propose a multistep variant of DPM-Solver++ to address the instability issue by reducing the effective step size. Experiments show that DPM-Solver++ can generate high-quality samples within only 15 to 20 steps for guided sampling by pixel-space and latent-space DPMs.

cs.LG cs.CV

参考文献 (20)

Pseudo Numerical Methods for Diffusion Models on Manifolds

Luping Liu, Yi Ren, Zhijie Lin 等

2022 924 引用 ⭐ 高影响力 查看解读 →

Denoising Diffusion Implicit Models

Jiaming Song, Chenlin Meng, S. Ermon

2020 13439 引用 ⭐ 高影响力 查看解读 →

GENERATIVE ADVERSARIAL NETS

Individualized Treat, Jinsung Yoon

2018 43856 引用 ⭐ 高影响力

Denoising Diffusion Probabilistic Models

Jonathan Ho, Ajay Jain, P. Abbeel

2020 34944 引用 ⭐ 高影响力 查看解读 →

Deep Unsupervised Learning using Nonequilibrium Thermodynamics

Jascha Narain Sohl-Dickstein, Eric A. Weiss, Niru Maheswaranathan 等

2015 10685 引用 ⭐ 高影响力 查看解读 →

Numerical Solution of Ordinary Differential Equations

R. Szymkiewicz

2010 130 引用 ⭐ 高影响力

Score-Based Generative Modeling through Stochastic Differential Equations

Yang Song, Jascha Narain Sohl-Dickstein, Diederik P. Kingma 等

2020 12029 引用 ⭐ 高影响力 查看解读 →

DiffSinger: Singing Voice Synthesis via Shallow Diffusion Mechanism

Jinglin Liu, Chengxi Li, Yi Ren 等

2021 377 引用 ⭐ 高影响力 查看解读 →

Diffusion Models Beat GANs on Image Synthesis

Prafulla Dhariwal, Alex Nichol

2021 12962 引用 ⭐ 高影响力 查看解读 →

Variational Diffusion Models

Diederik P. Kingma, Tim Salimans, Ben Poole 等

2021 1588 引用 ⭐ 高影响力 查看解读 →

Palette: Image-to-Image Diffusion Models

Chitwan Saharia, William Chan, Huiwen Chang 等

2021 2381 引用 ⭐ 高影响力 查看解读 →

DPM-Solver: A Fast ODE Solver for Diffusion Probabilistic Model Sampling in Around 10 Steps

Cheng Lu, Yuhao Zhou, Fan Bao 等

2022 2586 引用 ⭐ 高影响力 查看解读 →

GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models

Alex Nichol, Prafulla Dhariwal, A. Ramesh 等

2021 5000 引用 ⭐ 高影响力 查看解读 →

Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding

Chitwan Saharia, William Chan, Saurabh Saxena 等

2022 8855 引用 ⭐ 高影响力 查看解读 →

Fast Sampling of Diffusion Models with Exponential Integrator

Qinsheng Zhang, Yongxin Chen

2022 642 引用 ⭐ 高影响力 查看解读 →

High-Resolution Image Synthesis with Latent Diffusion Models

Robin Rombach, A. Blattmann, Dominik Lorenz 等

2021 27321 引用 ⭐ 高影响力 查看解读 →

Gotta Go Fast When Generating Data with Score-Based Models

Alexia Jolicoeur-Martineau, Ke Li, Remi Piche-Taillefer 等

2021 271 引用 ⭐ 高影响力 查看解读 →

Vector Quantized Diffusion Model for Text-to-Image Synthesis

Shuyang Gu, Dong Chen, Jianmin Bao 等

2021 1104 引用 查看解读 →

Tackling the Generative Learning Trilemma with Denoising Diffusion GANs

Zhisheng Xiao, Karsten Kreis, Arash Vahdat

2021 787 引用 查看解读 →

Score-Based Generative Modeling with Critically-Damped Langevin Diffusion

Tim Dockhorn, Arash Vahdat, Karsten Kreis

2021 294 引用 查看解读 →

被引用 (20)

AURORA-LM: Autoencoding Unified Representation for Continuous-Latent Diffusion Language Modeling

2026 1 引用 ⭐ 高影响力 查看解读 →

GeoSPRINT: Geometric Redundancy-Aware Step Pruning for Inference in Diffusion Trajectories

2026 ⭐ 高影响力 查看解读 →

TriM-D: Accelerating 2-D/3-D Diffusion Generation Via Triple-Mixed Quantization and Sparsity-Aware Dual-Branched Computation

2026 ⭐ 高影响力

Forecasting Land Art Under Climate Scenarios

2026 ⭐ 高影响力 查看解读 →

Correlation-Aware and Gaussianity-Preserving Robust Latent Angular Watermarking for Diffusion Models

2026 ⭐ 高影响力 查看解读 →

OmniCache: Multidimensional Hierarchical Feature Caching For Diffusion Models

2026 ⭐ 高影响力 查看解读 →

Breaking the Curse with BAND: Nonparametric Distribution Estimation in High Dimensions

Fixed-Point-Corrected Numerical Schemes for Reverse-Time Diffusion Sampling: Stability and Error Decomposition

2026

FreeDehaze: Towards Training-Free Real-World Image Dehazing via Diffusion Degradation Prior

2026

Generating synthetic evolution of turbulent flames with an experimental data-based spatiotemporal diffusion model

Virtual Consistency Model for All-in-One Image Restoration

2026

Revolutionizing nano-optics: How artificial intelligence is shaping the next frontier of scanning near-field optical microscopy

2026 1 引用

StrideDiffusion: Accelerating Diffusion Models for Time-series Generation

From Deterministic to Generative Deep Learning for Urban Air Quality Reconstruction from Sparse Observations

Evolving Cache Schedules for Fast Diffusion Policy Inference

OnlineCache: Learning Dynamic Caching Policies with Error Correction for Efficient Diffusion Inference

EchoDiff: Echo State Reservoirs for Parameter‑Efficient Diffusion Image Generation

2026

MarkNull: Model-Agnostic Watermark Removal in AI-Generated Images via On-Manifold Latent Manipulation

2026 1 引用 查看解读 →

XYZFlow:Scaling Multi dimensional Shortcut Flows for Efficient Generative Modeling

Stochastic human trajectory prediction via interaction-aware diffusion model

2026