Generative Models as Distributions of Functions

TL;DR

GASP用超网络生成连续函数分布,在CelebAHQ上达FID 7.42/19.16并支持跨分辨率生成。

cs.LG 🔴 高级 2021-02-09 20 次浏览
Emilien Dupont Yee Whye Teh Arnaud Doucet
隐式神经表示 生成对抗网络 超网络 PointConv 连续生成模型

核心发现

方法论

论文提出Generative Adversarial Stochastic Process(GASP)。潜变量z经超网络gφ生成隐式函数fθ的权重,再以坐标x为输入产生特征y。生成器使用随机傅里叶特征γ(x)=(cos(2πBx),sin(2πBx))捕获高频;判别器采用PointConv处理无序但具有空间距离的坐标—特征点云,并以非饱和GAN损失和R1梯度惩罚训练。

关键结果

  • 在CelebAHQ上,GASP的FID为64×64时7.42、128×128时19.16;集合判别器基线分别为236.82和未报告,自动解码器为117.80和未报告,显示PointConv对复杂图像分布的重要性。
  • 模型只用64×64图像训练,却能将同一采样函数在256×256坐标网格上评估,生成具有说服力的4倍超分辨率图像;在ShapeNet椅子数据上仅抽样4096点训练,而原始体素网格含32,768点。
  • 同一基本架构被用于图像、3D形状和ERA5气候数据,仅调整函数输入输出维度及傅里叶参数。3D实验使用ShapeNet Chairs的6,778个32³体素模型,并可在163、323、643、1283分辨率渲染平滑网格。

研究意义

GASP把生成建模对象从固定大小数组转为函数分布,缓解卷积模型随分辨率呈平方或立方增长的问题。它使图像、体素、非规则点集及流形数据共享一个连续框架,并允许训练时随机抽取坐标子集。学术上,这连接了隐式表示、超网络与GAN;工程上,它为高分辨率3D、气候场和不规则传感器数据提供了更节省内存的生成路径。

技术贡献

核心技术包括三部分:以超网络gφ定义权重分布p(θ),从而采样完整神经函数;以RFF编码提升MLP对高频细节的拟合;以PointConv替代CNN或PointNet/DeepSets判别器。PointConv核由MLP W:Rd→Rcout×cin参数化,输出为fout(x)=Σxi∈NxW(xi−x)fi,并通过邻域距离实现平移等变和置换不变。论文还提出针对点云特征的R1惩罚。

新颖性

与使用图像CNN判别器的GRAF、GIRAFFE和pi-GAN不同,GASP的生成器、判别器及损失都直接作用于连续坐标—特征点云。论文据作者所知首次展示同一连续生成框架覆盖图像、3D形状和流形气候数据,并在CelebAHQ复杂图像上获得清晰样本,而非仅在MNIST上验证。

局限性

  • 128×128 CelebAHQ仍会出现伪影和低质量样本,FID 19.16明显高于专门的卷积GAN 5.74,说明连续性并不自动带来最优视觉保真度。
  • 函数生成、RFF频率和PointConv邻域均需调参;固定MLP结构可能限制复杂信号,且点云邻域搜索与超网络生成权重带来额外计算成本。

未来方向

后续可研究更强的函数架构、可学习或自适应频率、条件生成及更稳定的对抗目标,并扩展到更高维流形、动态时空场和真实不规则观测。还需建立跨分辨率质量、函数平滑性及采样效率的统一评测,以缩小与图像专用SOTA GAN的差距。

AI 总览摘要

现代生成模型通常把图像、体素和波形视为固定网格上的数组,因此分辨率提高会使内存和计算量快速膨胀:二维图像至少按面积增长,三维体素则按体积增长。Dupont、Teh与Doucet提出GASP,将每个数据样本视为从坐标到特征的连续函数,并学习这些函数的概率分布。

GASP用潜变量驱动超网络gφ,生成隐式MLP fθ的全部权重;对坐标输入先施加随机傅里叶特征,以恢复高频细节。它不使用依赖网格的CNN判别器,而用PointConv处理坐标—特征点云;训练采用非饱和GAN损失和面向输入特征的R1惩罚。真实样本只需提供坐标—特征集合,训练时还可随机抽取子集。

实验覆盖CelebAHQ、ShapeNet Chairs和ERA5。CelebAHQ上的FID为64×64的7.42、128×128的19.16,优于集合判别器和自动解码器基线;64×64训练的函数还能在256×256上生成合理图像。ShapeNet包含6,778个椅子模型,GASP每次只用4,096点而非32,768个体素。结果表明,函数分布能跨模态、跨分辨率工作,但在图像质量上仍落后于专门卷积GAN,且复杂度和调参问题尚未消失。

深度分析

研究背景

隐式神经表示把图像写成f:R²→R³,把3D形状写成坐标到占用值的函数。NeRF、Occupancy Networks和DeepSDF证明了连续表示在渲染与几何建模中的价值,但多数生成方法仍依赖网格、自动解码器或CNN判别器,难以统一处理不同分辨率和非规则数据。

核心问题

目标是学习pdata(s)上的函数分布,其中s={(xi,yi)}是坐标—特征对集合。难点在于:真实函数通常不可直接访问;判别器必须同时具备置换不变性和空间局部性;高频信号难以由普通ReLU MLP拟合;模型还应避免随网格分辨率线性、平方或立方扩张。

核心创新

  • ��用超网络从z生成函数权重,而非直接生成固定像素数组。•用RFF将坐标映射到高频正弦余弦特征。•用PointConv在连续坐标空间定义卷积核,兼顾距离结构、平移等变和置换不变。•训练真实与生成点云的子集,使内存开销与采样点数K而非完整网格绑定。

方法详解

  • ��表示:对数据点拟合minθΣi||fθ(xi)−yi||²。•编码:γ(x)=[cos(2πBx),sin(2πBx)],B元素通常来自N(0,σ²)。•生成:采样z,计算θ=gφ(z),再输出yi=fθ(γ(xi))。•判别:PointConv使用MLP核W(xi−x),在邻域Nx内聚合特征。•优化:使用传统非饱和GAN目标,并加入R1(s)=1/2Σyi||∇yiD(s)||²。•训练:随机抽取K个坐标—特征对,避免完整网格输入。

实验设计

实验使用CelebAHQ 64×64与128×128、ShapeNet Chairs及ERA5气候数据。函数MLP含3个128宽隐藏层,超网络含256和512宽的2个隐藏层;单张2080Ti、11GB显存完成训练。图像比较AD、SD、ConvNP及卷积GAN,指标为FID;3D比较Occupancy Network VAE和DeepSDF集合判别器,并测试不同采样点数和渲染分辨率。

结果分析

CelebAHQ FID分别为7.42和19.16,优于SD的236.82和AD的117.80;卷积GAN仍为4.00和5.74。GASP能从64×64训练函数生成256×256图像。ShapeNet训练从32,768体素降至4,096点,并在更高分辨率生成平滑网格。PointNet/DeepSets判别器在复杂图像上失败,说明空间距离建模是关键。

应用场景

该框架适用于高分辨率图像生成、3D形状采样、稀疏传感器场重建和球面或其他流形上的气候建模。使用者只需定义坐标系、特征类型和距离度量;若数据具有高频细节,应配置合适的RFF频率。3D设计、科学模拟和遥感可从子集训练及任意分辨率查询中受益。

局限与展望

GASP并未击败图像专用卷积GAN,128×128样本仍有伪影。固定函数容量、RFF超参数和PointConv邻域可能限制复杂分布;邻域搜索、超网络输出完整权重也增加开销。论文实验规模和模态虽多,但对更高分辨率、动态数据、条件生成及严格消融的覆盖有限。

通俗解读 非专业人士也能看懂

把每张图片想成一家餐馆,而不是一张固定大小的菜单。传统方法会把菜单上的每个格子都印下来:菜单变大,纸张、仓库和运输成本就按格子数量增加。GASP则学习一位“按坐标做菜”的厨师:你问“桌面第几行第几列是什么颜色”,厨师就给出答案,因此不必提前决定菜单有多少格。

训练时,超网络像总厨,根据一张随机食谱生成一位新厨师;这位厨师就是一张可能的图片、一个椅子或一张气候地图。随机傅里叶特征像更丰富的调味工具,帮助厨师表现细小纹理。PointConv判别器则像食品评审,不只看每道菜,还看相邻位置之间是否协调。

因此,同一个模型能处理不同材料,也能在较少样本点上学习,再到更细的网格上“询问”结果。代价是厨师和评审都更复杂,调味参数也必须选好;生成的图片虽然清晰,但还不是最好的专业图像生成器。

简单解释 像给14岁少年讲一样

想象你在做一个游戏世界生成器。普通方法像把地图每一格都提前画好:地图从64×64变成128×128,格子一下多四倍;如果是3D,增加得更夸张。论文的方法不保存整张地图,而是训练一个“地图规则函数”:给它坐标,它就告诉你那里是什么颜色、有没有方块。

这里有个小机器人叫超网络。你给它一串随机数字,它就制造出另一个机器人;新机器人负责画一张具体的脸、椅子或天气地图。为了画头发、边缘等细节,作者加入了傅里叶特征,就像给画家一盒彩色细笔。

检查作品的评审也很特别。它不要求所有点排成整齐方格,而是观察点之间的距离和邻居关系,所以乱序的小点、3D点云甚至球面上的数据也能处理。训练时只看一部分点,就像抽查地图,而不是每次检查全部格子。

结果很酷:模型在64×64人脸上训练,却能在256×256网格上画出合理图像;ShapeNet的椅子每个有32,768个体素,训练只抽4,096点。不过它仍会画出一些奇怪脸,而且FID 7.42和19.16还不如专门的卷积GAN。也就是说,它更灵活,但还需要变得更稳定、更聪明!

术语表

Implicit Neural Representation(隐式神经表示)

用神经网络表示从坐标到信号值的连续函数,而不是存储固定数组。分辨率由查询坐标决定。

GASP用MLP fθ表示图像、占用场和气候场。

Hypernetwork(超网络)

一个网络生成另一个网络的参数。它可把潜变量直接转换为函数权重。

gφ(z)生成GASP中fθ的权重。

Random Fourier Features(随机傅里叶特征)

用正弦和余弦映射坐标,使MLP更容易拟合高频变化。频率由矩阵B及其方差控制。

论文使用γ(x)提升图像纹理和边缘质量。

PointConv

在连续点坐标上定义卷积,卷积核由坐标差的MLP生成。它能利用邻域距离并保持置换不变。

PointConv构成GASP的连续判别器。

R1 penalty(R1惩罚)

惩罚判别器关于输入的梯度范数,以改善GAN训练稳定性。本文梯度针对点云特征而非规则图像像素。

使用R1(s)=1/2Σyi||∇yiD(s)||²。

FID

比较真实与生成图像特征分布的指标,通常越低越好。它反映视觉质量和分布相似性。

GASP在CelebAHQ 64×64和128×128上分别取得7.42和19.16。

开放问题 这项研究留下的未解疑问

  • 1 如何在保持连续、分辨率无关的同时达到卷积GAN的图像质量仍未解决;需要更强的连续判别器、条件机制和稳定训练目标。
  • 2 函数复杂度、RFF频率与样本点数K之间的理论关系尚不清楚;未来应建立误差、内存和计算量的统一界限。
  • 3 动态时空场和高维流形上的函数分布是否能稳定采样,论文尚未充分验证。

应用场景

近期应用

3D形状生成

设计系统可用ShapeNet式占用函数生成椅子等物体,并只采样部分体素点训练。生成后可在更高分辨率查询函数,得到更平滑网格,同时降低显存需求。

气候场建模

气候研究者可将ERA5等数据表示为坐标到气象变量的函数分布。模型能够适配不同采样密度和非规则位置,适合稀疏观测补全与场景模拟,但需验证物理一致性。

远期愿景

统一的科学场生成平台

未来可用一个连续生成框架处理图像、医学体数据、海洋场和行星表面数据。若结合物理约束与条件控制,它可能支持跨分辨率预测、仿真和设计优化。

原文摘要

Generative models are typically trained on grid-like data such as images. As a result, the size of these models usually scales directly with the underlying grid resolution. In this paper, we abandon discretized grids and instead parameterize individual data points by continuous functions. We then build generative models by learning distributions over such functions. By treating data points as functions, we can abstract away from the specific type of data we train on and construct models that are agnostic to discretization. To train our model, we use an adversarial approach with a discriminator that acts on continuous signals. Through experiments on a wide variety of data modalities including images, 3D shapes and climate data, we demonstrate that our model can learn rich distributions of functions independently of data type and resolution.

cs.LG cs.CV stat.ML