Optimize Your Sampling: Tuned Diffusion Sampling with Bayesian Optimization
提出基于贝叶斯优化的采样调度方法OYS,有效缩减采样步骤至5步,保持89%-94%的样本质量,显著降低计算成本。
核心发现
方法论
本文提出的OYS方法将扩散模型中的采样时间点选择问题视为黑箱优化任务,利用贝叶斯优化(Gaussian Process)直接优化目标指标(如FID、HPS等)。具体流程包括:首先定义采样时间点参数空间,采用高斯过程模型对采样配置的性能进行建模;然后通过采集最大化采集函数(如qLogNEI)选择下一组采样参数;每次采样后,通过生成图像并评估目标指标,将结果反馈到模型中,迭代优化。该方法无需模型再训练,适用于各种扩散模型,包括蒸馏模型和复杂采样器(如Euler、DPM-Solver++)。在文本到图像、修复、反向图像等任务中,OYS通过优化调度,显著提升生成质量,尤其在低步数(如5步)下表现优异,保持接近50步调度的89%-94%的质量,同时减少10倍推理成本。
关键结果
- 在COCO字幕数据集上,利用OYS调度在仅用5步采样时,图像质量(HPS)比默认调度提升了约17%,在多个模型(如Stable Diffusion XL、v1.5)上均实现了显著优越的性能,win率超过80%。
- 在SDXL-Turbo模型中,3步调度经过OYS调优后,HPS指标提升至0.298,优于默认的0.287,提升幅度达4%。
- 在修复任务中,OYS调度在SDXL和SDv1.5模型上,PSNR分别提高6.8dB和2.9dB,HPS提升超过30%,且在用户评估中表现优异,显著优于传统调度方案。
研究意义
该研究突破了扩散模型采样调度的传统限制,直接以目标性能指标为优化目标,避免了依赖理论推导的近似指标。通过贝叶斯优化实现全局搜索,极大提升低步采样的效率,为实际应用中快速生成高质量图像提供了技术支撑。此方法不仅降低了计算成本,还增强了模型的适应性和泛化能力,推动扩散模型在工业界的广泛应用,尤其在边缘设备和实时场景中具有巨大潜力。未来,结合多目标优化和自适应调度,有望实现更智能、更高效的生成系统。
技术贡献
本文的核心技术创新在于将采样时间点的选择问题转化为黑箱优化任务,利用贝叶斯优化(Gaussian Process)进行全局搜索,避免了传统基于梯度或理论推导的局限。具体贡献包括:• 提出基于贝叶斯优化的调度策略,支持多模型、多任务的泛用性;• 设计了高效的采样配置搜索空间参数化方式(如乘积参数化和log-SNR空间映射);• 实现无需模型再训练的调度优化流程,兼容蒸馏模型和复杂采样器;• 通过在多项任务中的实验验证,展现了调度优化在图像生成、修复、反向任务中的广泛适用性和优越性能。该方法在保持高质量的同时,显著降低了采样步骤和推理成本,为未来扩散模型的实用化提供了新思路。
新颖性
本研究的创新点在于首次将扩散模型的采样调度问题作为黑箱优化问题,利用贝叶斯优化直接优化目标指标,而非依赖理论推导的近似指标(如KLUB)。相比于先前的调度优化方法(如AYS、HSO、ART),本方法无需提前定义参数空间的特定结构,也不受梯度限制,支持多样化的目标函数(包括人类偏好、感知指标等)。此外,调度策略在低步数场景下表现尤为出色,能在极端压缩的采样步骤中,保持接近全步调度的生成质量。这种全局优化的思路,为扩散模型调度的自动化和智能化开辟了新路径。
局限性
- 尽管OYS在低步数采样中表现优异,但在高步数(如50步)场景下,调度优化的边际收益有限,可能不如传统调度方案直观有效。
- 优化过程依赖大量的图像生成与评估,计算成本较高,尤其在多目标、多指标优化时,可能限制其在资源有限环境中的应用。
- 调度优化的效果在不同任务和模型间存在一定差异,需针对具体应用进行调参和验证,泛化能力仍需进一步提升。
未来方向
未来,作者计划结合多目标优化策略,兼顾生成速度与质量的平衡,开发自适应调度算法。此外,将调度优化与模型微调、指导技术结合,探索更复杂的生成场景(如视频、3D内容)中的调度策略。还希望引入强化学习等方法,实现调度的在线自我调整,适应不同输入和任务需求,推动扩散模型在工业界的广泛落地。
AI 总览摘要
扩散模型作为近年来生成任务中的佼佼者,已在文本到图像、超分辨率、修复等多个领域取得了突破性进展。然而,其主要缺点在于采样过程需要大量的前向推理,导致计算成本高昂,难以在实际应用中实现快速响应。传统的解决方案多集中在设计高效的采样器或训练更少步骤的模型,但在采样时间点的选择上,仍缺乏系统性优化方法。本文提出的“优化采样调度(OYS)”方法,创新性地将采样时间点的选择问题转化为黑箱优化任务,通过贝叶斯优化(Gaussian Process)实现全局搜索,直接优化目标指标如FID和HPS。该方法无需模型再训练,支持多种采样器(如Euler、DPM-Solver++)和模型(包括蒸馏模型),在多个任务中均表现出优异的性能。
在文本到图像生成任务中,OYS通过调度优化,将采样步骤从50步压缩到5步,仍能保持89%-94%的生成质量,大幅度降低推理成本(减少10倍)。在图像修复和反向任务中,调度优化也带来了显著的性能提升,PSNR和HPS指标均优于默认调度方案。人类评测进一步验证了OYS在图像质量和内容一致性方面的优势,赢得了用户的普遍认可。
该研究的意义在于打破了传统调度依赖理论推导的局限,提供了一种基于目标性能直接优化的全局调度策略,为扩散模型的工业应用提供了新思路。未来,结合多目标优化和自适应调度,有望实现更智能、更高效的生成系统,推动扩散模型在边缘设备、实时交互等场景中的落地。
技术贡献方面,本文首次将贝叶斯优化应用于采样调度,支持多目标、多指标的优化,极大提升了低步数采样的效率和质量。调度参数的设计兼顾连续与离散模型,支持多样化的任务需求。实验结果显示,调度优化不仅在定量指标上优于传统方法,也在用户体验和感知质量上具有明显优势。该方法的通用性和扩展性,为未来扩散模型调度策略的研究提供了重要参考。
深度分析
研究背景
扩散模型在近年来成为生成模型的研究热点,凭借其逐步去噪的机制,已在图像、视频、语音等领域取得了突破性进展。早期代表性工作如Ho et al. (2020)提出的DDPM,奠定了扩散模型的基础。随后,Song et al. (2021)引入了连续时间扩散过程,提升了模型的灵活性与性能。近年来,诸如Karras et al. (2022)提出的调度参数化方法、Lugmayr et al. (2022)的自定义调度策略,以及Sabour et al. (2024)的调度优化(AYS)等,推动了采样效率的提升与调度策略的多样化。然而,尽管在采样器设计和模型训练方面取得了显著进展,采样时间点的选择仍是瓶颈,限制了低步数采样的质量和速度。传统方法多依赖理论推导或局部优化,难以实现全局最优,且在实际应用中存在调度不适应不同模型和任务的缺陷。因此,如何在保证生成质量的同时,显著减少采样步骤,成为当前研究的热点与难点。
核心问题
核心问题在于扩散模型的采样调度设计。现有的调度策略多为预定义或局部优化,难以适应不同模型架构和任务需求,尤其在低步数场景下,样本质量迅速下降。传统调度依赖理论推导(如KLUB)或启发式方法,存在局限性:一方面无法实现全局最优,另一方面在实际应用中调度效果不稳定。随着模型规模和复杂度的增加,调度策略的优化变得更加困难,尤其在没有明确梯度信息的情况下,如何找到最优的时间点序列,成为制约低成本高质量采样的关键瓶颈。此外,调度优化的计算成本较高,尤其在需要多次生成与评估的情况下,限制了其在工业应用中的推广。
核心创新
本研究的创新点主要体现在:1)将采样时间点的选择问题转化为黑箱优化任务,利用贝叶斯优化(Gaussian Process)实现全局搜索,避免了梯度依赖和理论推导的局限;2)设计了支持连续与离散模型的参数化调度空间,采用乘积参数化和log-SNR空间映射,确保调度的单调性与可调性;3)实现无需模型再训练的调度优化流程,支持多任务、多模型的泛用性;4)在多个任务(文本到图像、修复、反向)中验证调度优化的有效性,显著提升低步数采样的质量,降低推理成本。这种全局优化策略,突破了传统调度的局限,为扩散模型的高效应用提供了新思路。
方法详解
- �� 定义调度参数空间:采用乘积参数化(pk ∈ [0, 1])确保调度单调递减,将时间点表示为t(p) = t_max * ∏_{i=1}^k p_i。
- �� 采样空间支持连续与离散模型:对离散模型中的时间点进行四舍五入处理。
- �� 构建目标指标:根据任务定义不同的性能指标(如FID、HPS、LPIPS、PSNR),作为优化目标。
- �� 贝叶斯优化流程:
- 初始化:采用Sobol采样生成初始配置,数量为参数个数的两倍。
- 建模:利用高斯过程(Gaussian Process)对采样配置的性能进行建模,形成后验分布。
- 采集:使用qLogNEI等采集函数,选择下一组最有潜力的采样配置。
- 评估:生成图像并计算目标指标,将结果反馈到高斯过程模型中。
- 迭代:重复采集与建模,直到满足收敛条件或预算耗尽。
- �� 支持多模型、多任务:调度参数化支持连续和离散模型,优化过程可扩展到多目标、多指标场景。
实验设计
实验在多个公开数据集(如COCO Captions、DiffusionDB)上进行,包括文本到图像、图像修复和反向任务。采用多种模型(如DeepFloyd、Stable Diffusion XL、v1.5、QwenImage)进行调度优化,比较默认调度、AYS调度和OYS调度的性能。指标包括HPS、FID、PSNR等,评估生成质量与内容一致性。调优过程采用贝叶斯优化,调度参数在不同步数(如5步、10步、50步)下进行。每次实验都进行多轮随机初始化,确保结果的稳健性。通过人类评测验证生成内容的感知质量,结合自动指标,全面评估调度方案的优劣。
结果分析
调度优化显著提升了低步数采样的性能。例如,在COCO字幕数据集上,5步调度的HPS由默认的0.215提升至0.252,win率达到83.99%。在SDXL模型中,3步调度经过调优后,HPS提升至0.298,优于默认的0.287,提升幅度达4%。在图像修复任务中,调度优化带来PSNR提升6.8dB,HPS提升超过30%。人类评测显示,OYS调度生成的图像在质量和内容一致性方面,明显优于传统调度方案,用户偏好率超过70%。这些结果表明,调度参数的全局优化在低步数采样中具有巨大潜力,能在保持高质量的同时大幅度降低计算成本。
应用场景
该调度优化方法适用于多种场景,包括快速文本到图像生成、图像修复、逆向图像任务等。工业界可以利用OYS实现低延迟、高质量的内容生成,尤其适合边缘设备和实时交互场景。未来,结合多目标优化和自适应调度,有望在视频生成、3D内容等更复杂任务中发挥作用。此外,该方法还可用于模型微调和指导,提升模型的泛化能力和鲁棒性。
局限与展望
尽管OYS在低步数场景表现优异,但在高步数(如50步)下,调度优化的边际收益有限,可能不如传统调度方案直观有效。优化过程依赖大量的图像生成与评估,计算成本较高,限制其在资源有限环境中的应用。调度效果在不同任务和模型间存在一定差异,需针对具体应用进行调参和验证,泛化能力仍需提升。此外,当前方法主要在静态任务中验证,动态场景和多模态任务的适应性有待进一步研究。
通俗解读 非专业人士也能看懂
想象你在一家工厂里,生产线上的每个工序都需要一定的时间和资源。传统上,工厂设计了一个固定的生产流程,比如从原料到成品,按照一定的顺序和时间点进行操作。这就像在扩散模型中,生成一张图片需要经过多次“去噪”步骤,每个步骤的时间点和顺序都预先设定好。可是,工厂的效率其实可以更高,如果我们能根据实际情况动态调整每个步骤的时间和顺序,让生产线更合理、更节省资源。这个想法就是本文提出的“调度优化”。作者用一种叫贝叶斯优化的方法,像在工厂里不断试验不同的流程,找到最节省时间又能保证产品质量的方案。通过这种方法,即使只用很少的步骤,也能生产出高质量的图片,就像用少量的时间和资源,做出和传统方法一样好的产品。这种创新让我们可以用更少的努力,得到更好的结果,特别是在需要快速生成内容的场景中,非常实用。
简单解释 像给14岁少年讲一样
你知道吗?有一种叫扩散模型的技术,就像在画画一样,它会一步步把一张模糊的图片变得越来越清晰。可是,要画一张漂亮的图片,传统方法需要很多次“去噪声”的步骤,就像画家用很多细笔一笔一笔慢慢画出来。这就很慢,也很费力。科学家们一直在想办法,让这个过程变得快一些,但又不影响画质。这个研究就像是给画画的步骤安排一个聪明的“时间表”,让每一步都用得恰到好处。作者用一种叫贝叶斯优化的方法,就像是让一个聪明的助手帮你试验不同的画画顺序,找到最省时间又能画出漂亮图片的方案。结果发现,只用很少的步骤,比如5步,就能画出和用50步差不多好的图片,节省了很多时间和计算资源。这就像用少量的笔,就能画出一幅细腻的画,非常厉害!这项技术让未来的图片生成变得更快、更便宜,也更适合在手机或边缘设备上使用。
术语表
扩散模型 (Diffusion Model)
一种生成模型,通过逐步去噪声的方式,从随机噪声中生成高质量的图像。技术基础包括逐步反向扩散过程。
论文中用于描述生成图像的核心技术。
贝叶斯优化 (Bayesian Optimization)
一种全局优化方法,利用高斯过程模型预测目标函数,并通过采集函数选择最优配置,适用于黑箱优化问题。
用于调度参数的全局搜索。
调度 (Scheduling)
在扩散模型中,指选择一系列时间点(步骤)以控制去噪过程的策略。影响生成质量和效率。
本文的主要优化目标。
FID (Fréchet Inception Distance)
衡量生成图像与真实图像分布差异的指标,数值越低代表生成质量越高。
用于评估生成图像的质量。
HPS (Human Preference Score)
基于人类偏好的感知指标,结合CLIP模型评估文本与图像的内容一致性。
作为优化目标之一。
Gaussian Process (高斯过程)
一种非参数贝叶斯模型,用于预测函数值及不确定性,广泛应用于黑箱优化。
贝叶斯优化中的核心建模工具。
qLogNEI
一种采集函数,用于贝叶斯优化中选择最具潜力的采样配置。
指导调度参数的选择。
调度参数化 (Scheduling Parameterization)
将时间点参数化为连续变量或离散值,以便进行优化。
调度优化的基础。
调度空间 (Scheduling Space)
所有可能的时间点配置集合。支持连续和离散两种形式。
优化的目标空间。
低步数采样 (Few-step Sampling)
用少量步骤快速生成高质量图像的方法。关键在于调度策略的优化。
本文的核心研究内容。
调度优化 (Schedule Optimization)
通过算法自动调整采样时间点,以提升生成质量和效率。
本文的主要技术创新。
图像修复 (Inpainting)
在图像中填补缺失区域,使修复后图像自然连贯。
实验中的应用任务之一。
反向任务 (Inverse Tasks)
从目标输出反推输入或中间状态的任务,如逆向深度估计。
论文中涉及的应用场景。
感知指标 (Perceptual Metrics)
衡量图像质量的指标,反映人类视觉感知。
用于优化和评估。
全局搜索 (Global Search)
在整个参数空间中寻找最优配置的方法。
贝叶斯优化的核心思想。
开放问题 这项研究留下的未解疑问
- 1 尽管OYS在低步数调度中表现出色,但其在高步数(如50步)场景中的优势仍需验证,特别是在不同模型和任务的泛化能力方面。未来研究应探索调度策略的自适应调整机制,以适应多样化的应用需求。
- 2 调度优化过程依赖大量图像生成与评估,计算成本较高,限制了其在资源有限环境中的推广应用。开发更高效的评估策略或代理指标,是未来的研究方向。
- 3 目前调度策略主要在静态任务中验证,动态场景和多模态内容的调度优化仍未充分探索。未来应结合强化学习等技术,实现调度的在线自我调整。
- 4 调度参数化设计在离散模型中存在偏差,未来可研究更合理的参数化方案,提升调度的公平性和多样性。
- 5 调度优化的目标指标多样,如何在多目标、多指标之间实现平衡,仍是一个开放问题。未来应引入多目标优化框架,兼顾不同指标的权衡。
应用场景
近期应用
快速内容生成
在内容创作、广告设计等行业,利用OYS实现低成本、快速高质量的图像生成,满足实时需求,减少硬件资源消耗。
边缘设备部署
将调度优化应用于手机、嵌入式设备,实现本地高效图像生成,降低云端依赖,提升用户体验。
工业自动化
在工业检测、自动修复等场景中,通过优化调度提升图像质量,减少推理时间,增强系统鲁棒性。
远期愿景
智能调度系统
未来发展出自主学习的调度算法,结合多目标、多任务优化,实现全场景自适应调度,推动生成模型的智能化。
跨模态生成
结合调度优化与多模态信息,推动视频、3D内容等复杂场景的高效生成,改变内容创作的生态。
原文摘要
Sampling from a diffusion model typically requires many forward passes through a large neural network, making generation computationally expensive. While much work has focused on efficient solvers and samplers, comparatively little attention has been paid to selecting the sampling timesteps themselves. A recent line of work optimizes theoretically derived surrogates for sample quality rather than the quality metric itself. We propose Optimizing Your Sampling (OYS), which instead treats timestep selection as a black-box optimization problem, optimizing the target metric directly with Bayesian optimization. OYS outperforms both the default schedules and those of Align Your Steps on text-to-image generation, and improves over the default schedules on inpainting and other image tasks, in both quantitative and human evaluations. OYS requires no additional training, is applicable even to distilled models, and improves both simple and sophisticated samplers such as Euler and DPM-Solver++. A 5-step OYS schedule retains 89%-94% of the quality of a 50-step schedule while reducing inference cost by 10x.
参考文献 (20)
Human Preference Score v2: A Solid Benchmark for Evaluating Human Preferences of Text-to-Image Synthesis
Xiaoshi Wu, Yiming Hao, Keqiang Sun 等
Align Your Steps: Optimizing Sampling Schedules in Diffusion Models
Amirmojtaba Sabour, Sanja Fidler, Karsten Kreis
Adversarial Diffusion Distillation
Axel Sauer, Dominik Lorenz, A. Blattmann 等
GANs Trained by a Two Time-Scale Update Rule Converge to a Local Nash Equilibrium
M. Heusel, Hubert Ramsauer, Thomas Unterthiner 等
Microsoft COCO Captions: Data Collection and Evaluation Server
Xinlei Chen, Hao Fang, Tsung-Yi Lin 等
Elucidating the Design Space of Diffusion-Based Generative Models
Tero Karras, M. Aittala, Timo Aila 等
In-Context Learning Unlocked for Diffusion Models
Zhendong Wang, Yifan Jiang, Yadong Lu 等
Analyzing and Improving the Training Dynamics of Diffusion Models
T. Karras, M. Aittala, J. Lehtinen 等
SDXL: Improving Latent Diffusion Models for High-Resolution Image Synthesis
Dustin Podell, Zion English, Kyle Lacey 等
DPM-Solver++: Fast Solver for Guided Sampling of Diffusion Probabilistic Models
Cheng Lu, Yuhao Zhou, Fan Bao 等
Hierarchical Text-Conditional Image Generation with CLIP Latents
A. Ramesh, Prafulla Dhariwal, Alex Nichol 等
Efficient Global Optimization of Expensive Black-Box Functions
Donald R. Jones, Matthias Schonlau, W. Welch
Constrained Bayesian Optimization with Noisy Experiments
Benjamin Letham, B. Karrer, G. Ottoni 等
Photorealistic Text-to-Image Diffusion Models with Deep Language Understanding
Chitwan Saharia, William Chan, Saurabh Saxena 等
Scale-wise Distillation of Diffusion Models
Nikita Starodubcev, Denis Kuznedelev, A. Babenko 等
Learning to Efficiently Sample from Diffusion Probabilistic Models
Daniel Watson, Jonathan Ho, Mohammad Norouzi 等
DiffusionDB: A Large-scale Prompt Gallery Dataset for Text-to-Image Generative Models
Zijie J. Wang, Evan Montoya, David Munechika 等
Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference
Simian Luo, Yiqin Tan, Longbo Huang 等
Pseudo Numerical Methods for Diffusion Models on Manifolds
Luping Liu, Yi Ren, Zhijie Lin 等
Learning Fast Samplers for Diffusion Models by Differentiating Through Sample Quality
Daniel Watson, William Chan, Jonathan Ho 等