返回 深度学习 思维导图
中文·English
🧠 深度学习ID: vae

VAE 与重参数化

VAE & Reparameterization
🎯核心定义
VAE 是变分生成模型, 优化证据下界 ELBO: logp(x)Eq(zx)[logp(xz)]DKL(q(zx)p(z))\log p(x) \ge \mathbb{E}_{q(z|x)}[\log p(x|z)] - D_{KL}(q(z|x) \Vert p(z)), 即重构项 + 先验 KL 正则。由于直接从 q(zx)q(z|x) 采样得到的期望对参数不可导, 用重参数化技巧 z=μ+σϵz = \mu + \sigma \odot \epsilon, 其中 ϵN(0,I)\epsilon \sim \mathcal{N}(0, I), 把随机性转移到与参数无关的噪声, 使采样路径可反向传播。
💡使用场景
生成模型、隐空间表示学习、异常检测、扩散模型 (加噪过程可视为层次 VAE) 的前置知识; 面试必考 ELBO 推导与重参数化技巧。
解决的核心痛点
直接最大化 logp(x)\log p(x) 需要难解的边际积分, VAE 把推断转化为可 SGD 优化的下界。与 AE 的区别: AE 的编码器是确定性映射、无先验约束, 隐空间无结构、无法采样生成; VAE 强制 q(zx)q(z|x) 靠近先验 p(z)p(z), 获得可采样性与生成能力, 代价是逐像素高斯似然导致样本模糊 — 模式平均: 一个 zz 要覆盖多个真实模式, 输出取平均; 而 GAN 相反, 样本锐利但训练不稳。
🎯5 个高频面试考点 (Exam Points)
1
推导 VAE 的 ELBO? 为什么它是 logp(x)\log p(x) 的下界?
2
重参数化技巧解决什么问题? 为什么不直接从 q(zx)q(z|x) 采样?
3
VAE 与 AE 的核心区别? 为什么 AE 不能生成新样本?
4
VAE 生成图像为什么模糊? 模式平均的机理?
5
KL 项与重构项如何平衡? 什么是 β\beta-VAE 与 posterior collapse?
📖 关联深度指南:📄 gan-and-generative-basics
更新于 2026-08-12
🎯
检验攻克程度:针对「VAE 与重参数化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点WGAN 与 Wasserstein下一个知识点训练调试流程

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化