EM (期望最大化) 是含隐变量模型做极大似然估计的通用框架, 交替迭代 E 步与 M 步直到收敛。E 步固定当前参数
θ(t), 构造完整数据对数似然对隐变量后验的期望 (下界):
Q(θ∣θ(t))=EZ∣X,θ(t)[logp(X,Z∣θ)]; M 步极大化该期望得新参数
θ(t+1)=argmaxθQ(θ∣θ(t))。由 Jensen 不等式 (对数凹),
logp(X∣θ)≥EZ∣X,θ(t)[logp(X,Z∣θ)]+H, 其中
H 是与
θ 无关的常数 (隐变量后验的熵)——EM 每次迭代都在提升对数似然的下界, 保证
logp(X∣θ) 单调不降, 但仅收敛到局部最优。