🎭

变分自编码器(VAE)

Variational Autoencoder
技术原理
生成模型表示学习

变分自编码器(Variational Autoencoder,VAE)是一种生成模型,由Kingma与Welling在2013年提出。它把输入数据压缩到一个有规律的「潜空间」里,再从该空间采样就能生成新数据,是连接「理解」与「生成」的桥梁。

工作原理

  • 编码器把输入(如图片)压缩成潜空间中的概率分布,记录均值和方差,而不是一个固定点
  • 解码器从该分布中采样,还原出接近原输入的输出
  • 训练目标在两件事之间权衡:既要让输出还原得足够像,又要让潜空间分布逼近标准正态分布,从而获得连续性和可采样性
核心价值
  • 潜空间有语义规律:沿着空间的某个方向「滑动」,生成结果会平滑变化,如脸型、表情的渐变
  • 这是它与普通自编码器的本质区别——普通自编码器只做压缩还原,不保证空间规律
  • 训练稳定、理论清晰,特别适合作为更复杂模型的组件
在生成式AI中的角色
  • Stable Diffusion等扩散模型用VAE在像素空间与潜空间之间来回转换,大幅降低扩散过程的计算量,这是它最广为人知的应用
  • 在音乐、语音、分子生成等场景中,VAE也常作为潜空间基础模型
  • 相比GAN,VAE生成的图像略偏模糊,但可控性与训练稳定性更好;2026年它更多以「潜空间引擎」的身份嵌入各类生成流水线。

🔗 探索更多 AI 工具板块

除了本板块,AI工具宝箱还有这些独家内容板块,帮你从不同角度发现好工具。

0