Geometry-Aware Dataset Condensation for Diffusion Model Training

TL;DR

提出一种几何感知的数据集凝聚方法,提升扩散模型训练的保真度和分布覆盖。

cs.CV 🔴 高级 2026-06-04 33 次浏览
Xiao Cui Yulei Qin Mo Zhu Wengang Zhou Hongsheng Li Houqiang Li
数据集凝聚 扩散模型 几何对齐 最优传输 分布保真

核心发现

方法论

本文提出了一种几何感知的分布对齐方法,通过单边部分最优传输(POT)和统计正则化实现数据集的凝聚。该方法包括几何引导的贪心选择和基于交换的精炼两个阶段,以确保所选子集与完整数据分布的对齐。

关键结果

  • 在ImageNet-1K上,使用DiT-L/2模型,10K图像子集的FID从D2C的4.20降至3.43,显示出更高的分布保真度。
  • 在不同数据预算下,方法在FID和IS指标上均优于基线方法,特别是在低数据预算下表现突出。
  • 消融实验表明,统计正则化和几何对齐的结合显著提高了模型的训练效率和生成质量。

研究意义

该研究在学术界和工业界具有重要意义,解决了扩散模型训练中数据集规模与计算成本之间的矛盾。通过几何感知的选择方法,确保了在有限数据预算下的高质量生成,推动了扩散模型在资源受限环境中的应用。

技术贡献

本文的技术贡献在于将数据集凝聚问题重新表述为几何感知的分布对齐问题,并提出了一种高效的两阶段离散优化策略。这种方法与现有的基于评分的选择策略有本质区别,提供了新的理论保证和工程可能性。

新颖性

这是首次将几何感知的分布对齐应用于扩散模型的数据集凝聚,区别于传统的基于难度评分的选择方法,提供了更精细的分布对齐机制。

局限性

  • 该方法在处理极端低数据预算时可能会出现对齐不充分的情况,影响生成质量。
  • 在高分辨率图像上,计算成本仍然较高。
  • 需要进一步研究如何在不同任务中自适应调整正则化参数。

未来方向

未来研究方向包括探索更高效的对齐算法以降低计算成本,以及在多模态数据集上的应用。此外,如何在不同任务中自适应调整正则化参数也是一个值得关注的问题。

AI 总览摘要

数据集凝聚是通过合成或选择从真实数据中构建紧凑数据集的过程。然而,现有方法在扩散模型训练中表现不佳。本文提出了一种几何感知的分布对齐方法,通过单边部分最优传输(POT)和统计正则化实现数据集的凝聚。该方法包括几何引导的贪心选择和基于交换的精炼两个阶段,以确保所选子集与完整数据分布的对齐。

实验结果表明,该方法在不同数据预算下均优于现有基线,特别是在低数据预算下表现突出。在ImageNet-1K上,使用DiT-L/2模型,10K图像子集的FID从D2C的4.20降至3.43,显示出更高的分布保真度。

该研究在学术界和工业界具有重要意义,解决了扩散模型训练中数据集规模与计算成本之间的矛盾。未来研究方向包括探索更高效的对齐算法以降低计算成本,以及在多模态数据集上的应用。此外,如何在不同任务中自适应调整正则化参数也是一个值得关注的问题。

深度分析

研究背景

数据集凝聚旨在通过合成或选择构建紧凑的数据集,以减少存储和计算成本。然而,现有方法在扩散模型训练中表现不佳,因为它们通常无法保留扩散模型所需的分布几何结构。

核心问题

扩散模型训练需要高质量的数据集,但大规模数据集的存储和计算成本高昂。现有的合成数据生成和真实子集选择方法无法有效保留数据分布的几何结构。

核心创新

本文提出了一种几何感知的分布对齐方法,通过单边部分最优传输和统计正则化实现数据集的凝聚。这种方法确保了所选子集与完整数据分布的几何对齐。

方法详解

  • �� 使用单边部分最优传输(POT)实现几何对齐。
  • �� 通过统计正则化确保分布保真度。
  • �� 两阶段优化策略:几何引导的贪心选择和基于交换的精炼。

实验设计

实验在ImageNet-1K上进行,使用DiT-L/2和SiT-L/2模型,比较了不同数据预算下的方法性能。评估指标包括FID和IS,基线方法包括D2C、Herding等。

结果分析

在10K图像子集上,本文方法的FID从D2C的4.20降至3.43,显示出更高的分布保真度。消融实验表明,统计正则化和几何对齐的结合显著提高了模型的训练效率和生成质量。

应用场景

该方法适用于资源受限环境下的扩散模型训练,能够在有限数据预算下实现高质量的生成。它在图像生成、数据增强等领域具有广泛的应用潜力。

局限与展望

该方法在处理极端低数据预算时可能会出现对齐不充分的情况,影响生成质量。在高分辨率图像上,计算成本仍然较高。

通俗解读 非专业人士也能看懂

想象你在厨房里做饭。你需要用有限的食材做出美味的菜肴。现有的方法就像是用随机选择的食材来做菜,可能会缺乏某些关键的味道。而本文的方法就像是根据食材的味道和营养价值来选择,确保每道菜都能保留原有的风味和营养。这种选择方法使得即使在食材有限的情况下,也能做出美味的菜肴。

简单解释 像给14岁少年讲一样

想象你在玩一个游戏,你需要用有限的资源来建造一个强大的堡垒。现有的方法就像是随机选择资源,可能会导致堡垒不够坚固。而本文的方法就像是根据资源的价值和用途来选择,确保每个资源都能发挥最大的作用。这样,即使资源有限,你也能建造一个坚固的堡垒!

术语表

数据集凝聚 (Dataset Condensation)

通过合成或选择构建紧凑数据集的过程,旨在减少存储和计算成本。

用于扩散模型训练中以减少数据量。

扩散模型 (Diffusion Model)

一种生成模型,通过逐步去噪生成高质量样本。

需要高质量数据集进行训练。

几何对齐 (Geometry Alignment)

确保所选子集与完整数据分布的几何结构一致。

通过单边部分最优传输实现。

最优传输 (Optimal Transport)

一种数学方法,用于在两个分布之间找到最优的匹配方式。

用于实现数据集的几何对齐。

统计正则化 (Statistical Regularization)

通过对齐特征的统计量来提高模型的分布保真度。

用于补充几何对齐以确保分布保真度。

开放问题 这项研究留下的未解疑问

  • 1 如何在极端低数据预算下保持高质量的生成?现有方法在这种情况下可能对齐不充分。
  • 2 在多模态数据集上应用该方法的效果如何?需要进一步研究。

应用场景

近期应用

图像生成

在资源受限的环境下,使用该方法训练扩散模型以生成高质量图像。

远期愿景

多模态数据处理

将该方法应用于多模态数据集,以提高数据处理效率和质量。

原文摘要

Dataset condensation aims to construct compact datasets from real data via synthesis or selection. However, existing approaches are ill-suited for diffusion model training: synthetic data generation often yields low-fidelity samples unsuitable for authentic modeling, while real subset selection typically fails to preserve the distributional geometry required by diffusion likelihood objectives. To address this, we propose to reformulate real subset selection as a geometry-aware distribution alignment problem. By incorporating one-sided partial optimal transport, our method selectively aligns a compact subset with the full data distribution while allowing unmatched mass in low-density regions, ensuring the preserved geometric structure necessary for effective diffusion model training. To further ensure distributional fidelity, we complement geometric alignment with lightweight feature-statistics and semantic consistency regularization. An efficient two-stage discrete optimization strategy is proposed to achieve this alignment objective. Extensive experiments across diffusion variants, subset sizes, image resolutions, and training rounds show that our method achieves superior fidelity and distributional coverage in diffusion model training. Codes are available at https://github.com/2018cx/GADC.

cs.CV