探索/视觉

经典视觉arXiv:2112.10752

潜在扩散:在压缩空间里生成

High-Resolution Image Synthesis with Latent Diffusion Models

Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer

CVPR · 2022

18k 引用 · 1.6k 阅读 · 0 收藏

摘要

把扩散过程放到预训练自动编码器的潜在空间,用远低于像素空间的成本做高分辨率图像合成。

Runs diffusion in the latent space of a pretrained autoencoder, enabling high-resolution image synthesis at a fraction of pixel-space cost.

提要

潜在扩散把感知压缩与语义生成拆开,使高分辨率图像合成的算力成本远低于像素空间扩散。生成式图像因此第一次具备真正可普及的训练与部署门槛。

01背景与动机

像素空间扩散虽能生成高质量图像,但分辨率升高后计算与显存开销急剧膨胀,训练和推理都难以广泛开展。大量运算反复处理纹理与局部细节,而这些感知冗余对语义结构的贡献有限,造成明显的资源浪费。

核心动机因此很明确:证明大部分扩散计算不必发生在像素上。若先做感知压缩、再在紧凑表示里完成语义生成,就有望以可接受成本实现高分辨率合成,并降低研究与应用的进入门槛。

02核心方法

方法先用预训练自动编码器把图像压到低维潜变量,在保留主要感知信息的同时去掉高频冗余。随后扩散过程只在该潜空间进行:U-Net负责逐步去噪,生成负担从像素网格转移到更小的特征图上,从而显著降低计算量。

文本等条件通过交叉注意力注入U-Net中间层,使同一套去噪网络能够灵活对接语言或其他模态信号。整体形成「先压缩、再生成、再解码」的流水线,把感知重建与语义建模清晰分开。

以较温和下采样提升可达成质量上界。扩散模型对空间数据归纳偏置良好,无需潜空间相关模型那样重度下采样,仍可通过合适自编码器大幅降维(见第3节)。图像来自DIV2K验证集,512²像素评估;f为空间下采样因子。重建FID与PSNR在ImageNet-val上计算。
1. 以较温和下采样提升可达成质量上界。扩散模型对空间数据归纳偏置良好,无需潜空间相关模型那样重度下采样,仍可通过合适自编码器大幅降维(见第3节)。图像来自DIV2K验证集,512²像素评估;f为空间下采样因子。重建FID与PSNR在ImageNet-val上计算。

03结果与证据

与直接在像素空间做扩散相比,潜在扩散在相近生成质量目标下可用更低的训练与推理成本完成高分辨率图像合成。自动编码器负责可接受的重建保真度,扩散模型则专注潜空间中的语义分布学习,两者分工使算力利用更集中。

条件生成方面,交叉注意力能够稳定地把文本约束写入去噪轨迹,支持文本引导的图像合成,并保持架构上的可扩展性。证据主要体现在效率与可及性的提升,而非依赖夸张的单一指标宣传。

感知与语义压缩示意:数字图像大部分比特对应不可感知细节。扩散模型虽可抑制语义无关信息,但梯度与网络骨干仍需在全部像素上计算,造成多余开销。我们提出潜扩散模型(LDM),配合仅去除不可感知细节的温和压缩阶段。
2. 感知与语义压缩示意:数字图像大部分比特对应不可感知细节。扩散模型虽可抑制语义无关信息,但梯度与网络骨干仍需在全部像素上计算,造成多余开销。我们提出潜扩散模型(LDM),配合仅去除不可感知细节的温和压缩阶段。

04影响与意义

算力门槛下降后,更多团队能够训练、微调并部署高分辨率生成模型,开源权重与工具链迅速扩散。围绕同一潜空间接口,社区发展出丰富的微调、插件与工作流,形成可持续迭代的图像生成生态。

在此基础上,ControlNet等可控生成技术以及相关工业应用得以快速生长。潜在扩散不仅是一次效率优化,更改变了生成模型的分发与协作方式,使开放研究比封闭演示更容易长出完整产业链。

在CelebAHQ、FFHQ、LSUN-Churches、LSUN-Bedrooms及类别条件ImageNet上训练的LDM样本,分辨率均为256×256。建议放大查看;更多样本见补充材料。
3. 在CelebAHQ、FFHQ、LSUN-Churches、LSUN-Bedrooms及类别条件ImageNet上训练的LDM样本,分辨率均为256×256。建议放大查看;更多样本见补充材料。

05局限

潜空间压缩会损失部分精细细节,解码后在小文字、复杂纹理和极端高频结构上仍可能模糊或失真。生成质量上限受到自动编码器重建能力的约束,单靠放大扩散模型并不能完全补回丢失信息。

此外,文字渲染、人体结构以及多物体组合与空间关系的泛化仍然薄弱。条件控制虽比早期方法更灵活,但对复杂指令的遵循仍不稳定,这些短板需要更好的表示、数据与对齐策略继续改进。

文本到图像模型LDM-8(KL,训练于LAION)按用户文本提示生成的样本。200步DDIM、η=1.0,无条件引导s=10.0。
4. 文本到图像模型LDM-8(KL,训练于LAION)按用户文本提示生成的样本。200步DDIM、η=1.0,无条件引导s=10.0。

06要点

  1. 01先压缩,再生成,才能把扩散计算从像素冗余中解放出来。
  2. 02条件注入的位置与机制直接决定模型的可控性和扩展方式。
  3. 03开源权重比封闭演示更能孕育可持续的工具生态与工业应用。

为何入典

Stable Diffusion 的论文形态。开源文生图能在消费级 GPU 上跑,是因为生成被搬进了潜空间。

标签

diffusionlatent

相关论文

和这篇论文对话

开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。

登录后可以接入自己的模型,向这篇论文提问。