探索/视觉

经典视觉arXiv:2006.11239

DDPM:把生成写成逐步去噪

Denoising Diffusion Probabilistic Models

Jonathan Ho, Ajay Jain, Pieter Abbeel

NeurIPS · 2020

22k 引用 · 1.6k 阅读 · 0 收藏

摘要

把扩散概率模型与去噪分数匹配连起来,通过反转加噪过程生成高质量图像。

Connects diffusion probabilistic models to denoising score matching and shows high-quality image synthesis by reversing a noise process.

提要

DDPM 用「先加噪再学会去噪」替代 GAN 式对抗训练,以更稳的优化和更好的分布覆盖做生成。它把扩散概率模型与去噪分数匹配对齐,通过反转加噪过程实现高质量图像合成。

01背景与动机

在深度生成模型领域,对抗生成网络曾长期占据主流,但其训练依赖生成器与判别器的博弈,常出现不稳定、模式崩塌以及对数据分布覆盖不足等问题。社区因此需要一种训练更平稳、目标更清晰,且仍能产出高质量样本的替代框架。

扩散概率模型提供了另一条路线:先把数据逐步腐蚀为近似高斯噪声,再学习如何逆转这一过程。DDPM 的关键在于给出简洁可优化的训练目标——预测各时间步所加噪声,并阐明该目标与去噪分数匹配的等价关系,从而把概率建模与可训练损失衔接起来。

02核心方法

前向扩散过程按预定方差日程,在多个时间步上向数据逐步注入高斯噪声,最终将样本分布推向标准正态。反向过程参数化一条马尔可夫链,用神经网络在每一步估计去噪均值或直接预测噪声,从而从纯噪声迭代恢复数据。

早期实现普遍采用带时间步条件嵌入的 U-Net 作为主干,在像素空间逐步完成去噪。训练时对时间步随机采样,以均方误差拟合该步真实噪声;这一看似朴素的目标,背后对应扩散模型变分下界的可操作分解与一条完整概率链。

CelebA-HQ 256×256(左)与无条件 CIFAR10(右)上的生成样本
1. CelebA-HQ 256×256(左)与无条件 CIFAR10(右)上的生成样本

03结果与证据

在标准图像合成设定下,按噪声预测目标训练后,模型可从纯高斯噪声出发,经多步反向迭代得到结构清晰、纹理自然的图像,说明把生成写成逐步去噪在实践中可行且有效。

证据主要来自定性生成样本以及与既有生成范式的对照:训练过程无需对抗博弈即可稳定收敛,样本对数据模式的覆盖也更易保持,从而把扩散方法从偏理论的概念验证推进到可复现的高质量图像合成流程。

无条件 CIFAR10 生成样本
2. 无条件 CIFAR10 生成样本

04影响与意义

DDPM 把扩散模型从相对小众的概率理论讨论,推进为可在常见计算资源与开源代码栈上稳定复现的高质量图像生成路径。这一转变降低了后续研究迭代与工程落地的门槛,使更多团队能在统一框架上改进采样、架构与条件控制。

其「逐步加噪再学习去噪」的范式以及相对稳定的优化特性,直接催生了在压缩潜空间中运行扩散的工作,其中包括 Latent Diffusion,并进一步支撑了面向广泛用户的 Stable Diffusion 等系统,形成延续至今的技术谱系。

本文所考虑的有向图模型。
3. 本文所考虑的有向图模型。

05局限

主要瓶颈在于反向采样通常需要大量离散时间步,每一步都调用一次网络前向,整体延迟明显高于单次前向即可出图的生成器,因而在交互式应用与高吞吐部署场景中效率仍然受限。

此外,直接优化与似然相关的目标并不自动等价于感知上的清晰与美观;实践中常需在对数似然、重建失真和主观视觉质量之间权衡,这一张力在后续改进采样与损失函数的工作中仍被反复讨论。

LSUN Church样本。FID=7.89
4. LSUN Church样本。FID=7.89

06要点

  1. 01生成可以表述为沿噪声日程展开的迭代推理,而非单次前向映射。
  2. 02简单的均方误差噪声预测目标,背后对应一条可推导的概率与变分链。
  3. 03训练稳定性降低了复现门槛,使扩散生态得以持续建立和扩展。

为何入典

稳定生成的主干。从图像到音频、视频、蛋白质,扩散成了新的默认生成引擎。

标签

diffusiongenerative

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。