经典视觉arXiv:1406.2661
GAN:生成变成一场博弈
Generative Adversarial Nets
Ian J. Goodfellow, Jean Pouget-Abadie, Mehdi Mirza, Bing Xu, David Warde-Farley, Sherjil Ozair, Aaron Courville, Yoshua Bengio
NeurIPS · 2014
65k 引用 · 1.5k 阅读 · 0 收藏
摘要
把生成建模写成生成器与判别器的二人博弈,从而在不显式建模密度的情况下学习数据分布。
Frames generative modeling as a two-player game between a generator and a discriminator, enabling implicit density estimation.
提要
GAN 通过生成器与判别器的对抗训练,让模型学习生成「像真的」样本,而不是最大化显式似然。它以隐含密度绕开配分函数,并深刻影响了后续生成建模与对抗学习路线。
01背景与动机
传统生成模型常依赖显式概率密度与配分函数,在高维数据上推断与归一化代价很高。灵活建模因此受到明显限制,也难以直接扩展到复杂真实分布,成为早期生成式方法的主要瓶颈之一。
本文提出基于隐含密度的生成框架,用可采样的生成过程代替直接书写似然。学习目标由此从「算对概率」转向「生成足够像真的样本」,为高维复杂数据上的生成建模提供了另一条可行路径。
02核心方法
生成器将随机噪声映射为样本,判别器负责区分真实数据与生成数据。两者构成最小最大博弈,并在训练中交替进行梯度更新,以相互对抗的方式共同推进优化。
生成器尽量提高判别器的出错率,判别器则尽量正确分类,最终推动生成分布逼近数据分布。整个过程无需显式写出配分函数,因而绕开了传统密度模型中最棘手的归一化难题。

03结果与证据
论文表明,对抗目标可以学到可采样的隐含生成模型,并在图像等数据上给出具有真实感的定性生成示例。这些示例说明该学习准则在实践中能够成立,而不仅停留在形式推导层面。
相关证据主要体现为判别器难以轻易区分真假、样本在视觉上更接近真实分布。这支持了以「像真的」作为生成目标的可行性,也展示了隐含密度框架的实际可用性。

04影响与意义
GAN 打开了高保真图像生成的重要方向,使对抗训练成为生成建模的主流思路之一。它也改变了人们评价生成质量的常用方式,把「样本是否逼真」推到了更核心的位置。
其影响还延伸到对抗鲁棒性、判别器引导,以及后续大量基于博弈结构或评分网络的生成与表示学习工作。许多后来的方法虽已改写目标与训练流程,仍能看到这一博弈式思路的痕迹。

05局限
对抗训练过程往往不稳定,且容易出现模式崩塌,导致样本多样性不足。该方法也对超参数与实现细节较为敏感,工程调参成本偏高,限制了其在复杂场景中的稳健落地。
相较之下,后来的扩散等模型在训练稳定性与分布覆盖上更具优势。这也进一步暴露了纯对抗目标在理论分析与工程可控性上的难点,促使社区继续寻找更稳妥的生成训练范式。

06要点
- 01生成目标可以表述为一场生成器与判别器之间的博弈,而不必先写出完整似然。
- 02在实际系统中,训练稳定性往往比目标函数的理论优雅更决定可用性。
- 03GAN 重新定义了生成式模型「像不像真的」这一评价与审美标准的起点。
为何入典
生成模型的一次范式转移。对抗训练的思想后来进入图像、语音、甚至部分语言模型对齐。
标签
相关论文
潜在扩散:在压缩空间里生成
High-Resolution Image Synthesis with Latent Diffusion Models
DDPM:把生成写成逐步去噪
Denoising Diffusion Probabilistic Models
CLIP:用自然语言监督视觉
Learning Transferable Visual Models From Natural Language Supervision
和这篇论文对话
开启对话后,本页的标题、摘要、导读和图注会装进上下文。模型是你自己接入的。