返回 数理基础 思维导图
中文·English
📐 数理基础ID: elbo-vi

变分推断与 ELBO

Variational Inference & ELBO
🎯核心定义
变分推断用可解分布 q(zx)q(z|x) 逼近难解后验 p(zx)p(z|x),核心是证据下界 ELBO。对证据对数做精确分解: logp(x)=ELBO(q)+DKL(q(zx)p(zx))\log p(x) = \text{ELBO}(q) + D_{KL}(q(z|x) \Vert p(z|x)),其中 ELBO(q)=Eq(zx)[logp(x,z)q(zx)]=Eq[logp(x,z)]+H(q)=Eq[logp(xz)]DKL(q(zx)p(z))\text{ELBO}(q) = \mathbb{E}_{q(z|x)}\left[\log\frac{p(x,z)}{q(z|x)}\right] = \mathbb{E}_q[\log p(x,z)] + H(q) = \mathbb{E}_q[\log p(x|z)] - D_{KL}(q(z|x) \Vert p(z))。下界由 Jensen 不等式构造:log\log 凹,所以 logp(x)=logEq[p(x,z)q(zx)]Eq[logp(x,z)q(zx)]=ELBO(q)\log p(x) = \log\mathbb{E}_q\left[\frac{p(x,z)}{q(z|x)}\right] \ge \mathbb{E}_q\left[\log\frac{p(x,z)}{q(z|x)}\right] = \text{ELBO}(q);由 Eq[logp(x)]=ELBO+Eq[logqp(zx)]\mathbb{E}_q[\log p(x)] = \text{ELBO} + \mathbb{E}_q\left[\log\frac{q}{p(z|x)}\right] 展开即得精确分解,等式当且仅当 q=p(zx)q = p(z|x),此时 KL 缺口为 0、ELBO 达到 logp(x)\log p(x)
💡使用场景
VAE 的训练目标(重构项 + KL 正则,配重参数化技巧)、贝叶斯神经网络、LDA 主题模型;面试“推导 ELBO”“VAE 为什么优化 ELBO”是变分类必考题。
解决的核心痛点
后验 p(zx)p(z|x) 的积分通常不可解析,MCMC 在大模型上不可行;变分把“推断”转化为“优化”,与 SGD 天然兼容,并给出带不确定性的近似后验。代价是近似族受限(均值场假设各维度独立)导致低估后验方差。
🎯5 个高频面试考点 (Exam Points)
1
完整推导 logp(x)=ELBO+DKL(qp)\log p(x) = \text{ELBO} + D_{KL}(q \Vert p)?
2
如何用 Jensen 不等式证明 ELBO 是 logp(x)\log p(x) 的下界?
3
ELBO 的两种等价形式(重构项 + KL 惩罚)如何互相转换?优化 ELBO 为何等价于最小化与后验的 KL?
4
变分推断与 EM 算法的关系?E 步与 M 步分别做什么?
5
均值场近似的假设是什么?为什么 VI 倾向于低估后验方差?
更新于 2026-08-12
🎯
检验攻克程度:针对「变分推断与 ELBO」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点贝叶斯推断下一个知识点高维几何与测度集中

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导偏差方差分解Bootstrap因果推断与 Rubin 框架