经典视觉arXiv:2112.10752
潜在扩散:在压缩空间里生成
High-Resolution Image Synthesis with Latent Diffusion Models
Robin Rombach, Andreas Blattmann, Dominik Lorenz, Patrick Esser, Björn Ommer
CVPR · 2022
18k 引用 · 1.6k 阅读 · 0 收藏
摘要
把扩散过程放到预训练自动编码器的潜在空间,用远低于像素空间的成本做高分辨率图像合成。
Runs diffusion in the latent space of a pretrained autoencoder, enabling high-resolution image synthesis at a fraction of pixel-space cost.
提要
潜在扩散把感知压缩与语义生成拆开,使高分辨率图像合成的算力成本远低于像素空间扩散。生成式图像因此第一次具备真正可普及的训练与部署门槛。
01背景与动机
像素空间扩散虽能生成高质量图像,但分辨率升高后计算与显存开销急剧膨胀,训练和推理都难以广泛开展。大量运算反复处理纹理与局部细节,而这些感知冗余对语义结构的贡献有限,造成明显的资源浪费。
核心动机因此很明确:证明大部分扩散计算不必发生在像素上。若先做感知压缩、再在紧凑表示里完成语义生成,就有望以可接受成本实现高分辨率合成,并降低研究与应用的进入门槛。
02核心方法
方法先用预训练自动编码器把图像压到低维潜变量,在保留主要感知信息的同时去掉高频冗余。随后扩散过程只在该潜空间进行:U-Net负责逐步去噪,生成负担从像素网格转移到更小的特征图上,从而显著降低计算量。
文本等条件通过交叉注意力注入U-Net中间层,使同一套去噪网络能够灵活对接语言或其他模态信号。整体形成「先压缩、再生成、再解码」的流水线,把感知重建与语义建模清晰分开。

03结果与证据
与直接在像素空间做扩散相比,潜在扩散在相近生成质量目标下可用更低的训练与推理成本完成高分辨率图像合成。自动编码器负责可接受的重建保真度,扩散模型则专注潜空间中的语义分布学习,两者分工使算力利用更集中。
条件生成方面,交叉注意力能够稳定地把文本约束写入去噪轨迹,支持文本引导的图像合成,并保持架构上的可扩展性。证据主要体现在效率与可及性的提升,而非依赖夸张的单一指标宣传。

04影响与意义
算力门槛下降后,更多团队能够训练、微调并部署高分辨率生成模型,开源权重与工具链迅速扩散。围绕同一潜空间接口,社区发展出丰富的微调、插件与工作流,形成可持续迭代的图像生成生态。
在此基础上,ControlNet等可控生成技术以及相关工业应用得以快速生长。潜在扩散不仅是一次效率优化,更改变了生成模型的分发与协作方式,使开放研究比封闭演示更容易长出完整产业链。

05局限
潜空间压缩会损失部分精细细节,解码后在小文字、复杂纹理和极端高频结构上仍可能模糊或失真。生成质量上限受到自动编码器重建能力的约束,单靠放大扩散模型并不能完全补回丢失信息。
此外,文字渲染、人体结构以及多物体组合与空间关系的泛化仍然薄弱。条件控制虽比早期方法更灵活,但对复杂指令的遵循仍不稳定,这些短板需要更好的表示、数据与对齐策略继续改进。

06要点
- 01先压缩,再生成,才能把扩散计算从像素冗余中解放出来。
- 02条件注入的位置与机制直接决定模型的可控性和扩展方式。
- 03开源权重比封闭演示更能孕育可持续的工具生态与工业应用。
为何入典
Stable Diffusion 的论文形态。开源文生图能在消费级 GPU 上跑,是因为生成被搬进了潜空间。
标签
相关论文
GAN:生成变成一场博弈
Generative Adversarial Nets
DDPM:把生成写成逐步去噪
Denoising Diffusion Probabilistic Models
CLIP:用自然语言监督视觉
Learning Transferable Visual Models From Natural Language Supervision
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。