生成对抗网络(Generative Adversarial Network,GAN)由 Ian Goodfellow 于 2014 年提出,是深度学习领域最具创造性的架构之一。
核心原理
GAN 由两个神经网络组成——生成器(Generator)和判别器(Discriminator)——它们在一个博弈框架中对抗训练。生成器试图制造以假乱真的数据,判别器试图区分真实数据和生成数据。两者共同进化,最终生成器学会输出高度逼真的内容。
经典变体
- DCGAN(2015):引入卷积层,大幅提升图像生成质量
- StyleGAN / StyleGAN2 / StyleGAN3(2018-2021):NVIDIA 提出,实现精细的风格控制和超高分辨率人脸生成
- CycleGAN(2017):实现图像风格迁移(如照片变梵高风格),无需配对训练数据
- pix2pix(2017):图像到图像的翻译(草图→照片、黑白→彩色)
与扩散模型的对比
- GAN 优点:生成速度快(单次前向传播),适合实时应用
- GAN 缺点:训练不稳定(模式坍塌),多样性不如扩散模型
- 扩散模型逐渐成为图像生成主流(Stable Diffusion、DALL·E、Midjourney),但 GAN 在特定领域(如超分辨率、风格迁移)仍有优势
代表作品
StyleGAN 系列、BigGAN、ProGAN、CycleGAN。