变分自编码器(Variational Autoencoder,VAE)是一种生成模型,由Kingma与Welling在2013年提出。它把输入数据压缩到一个有规律的「潜空间」里,再从该空间采样就能生成新数据,是连接「理解」与「生成」的桥梁。
工作原理
- 编码器把输入(如图片)压缩成潜空间中的概率分布,记录均值和方差,而不是一个固定点
- 解码器从该分布中采样,还原出接近原输入的输出
- 训练目标在两件事之间权衡:既要让输出还原得足够像,又要让潜空间分布逼近标准正态分布,从而获得连续性和可采样性
- 潜空间有语义规律:沿着空间的某个方向「滑动」,生成结果会平滑变化,如脸型、表情的渐变
- 这是它与普通自编码器的本质区别——普通自编码器只做压缩还原,不保证空间规律
- 训练稳定、理论清晰,特别适合作为更复杂模型的组件
- Stable Diffusion等扩散模型用VAE在像素空间与潜空间之间来回转换,大幅降低扩散过程的计算量,这是它最广为人知的应用
- 在音乐、语音、分子生成等场景中,VAE也常作为潜空间基础模型
- 相比GAN,VAE生成的图像略偏模糊,但可控性与训练稳定性更好;2026年它更多以「潜空间引擎」的身份嵌入各类生成流水线。