潜在扩散:在压缩空间里生成
High-Resolution Image Synthesis with Latent Diffusion Models
潜在扩散把感知压缩与语义生成拆开,使高分辨率图像合成的算力成本远低于像素空间扩散。生成式图像因此第一次具备真正可普及的训练与部署门槛。
按时代、领域或关键词筛选。经典是骨架,新篇每天早上 6 点从 arXiv 自动收入。
High-Resolution Image Synthesis with Latent Diffusion Models
潜在扩散把感知压缩与语义生成拆开,使高分辨率图像合成的算力成本远低于像素空间扩散。生成式图像因此第一次具备真正可普及的训练与部署门槛。
An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale
ViT 表明卷积并非视觉识别的必要条件:当预训练规模足够时,纯注意力机制也能学到有效表征。它把图像切成 patch 当作 token,用标准 Transformer 编码器完成分类。
Denoising Diffusion Probabilistic Models
DDPM 用「先加噪再学会去噪」替代 GAN 式对抗训练,以更稳的优化和更好的分布覆盖做生成。它把扩散概率模型与去噪分数匹配对齐,通过反转加噪过程实现高质量图像合成。
Deep Residual Learning for Image Recognition
ResNet 指出深层网络的退化主要来自优化路径而非深度本身,并通过恒等捷径使残差学习可行。该结构让极深网络变得可训练,并成为后来各类架构的默认骨架。
Generative Adversarial Nets
GAN 通过生成器与判别器的对抗训练,让模型学习生成「像真的」样本,而不是最大化显式似然。它以隐含密度绕开配分函数,并深刻影响了后续生成建模与对抗学习路线。
ImageNet Classification with Deep Convolutional Neural Networks
AlexNet 表明,更深的卷积网络配合 GPU 训练可以在大规模视觉识别上取得决定性优势。它把端到端卷积学习推成计算机视觉的主流路线。