返回 多模态 思维导图
中文·English
👁️ 多模态ID: ddpm

DDPM 前向/反向过程

DDPM Forward/Reverse Process
🎯核心定义
DDPM (Denoising Diffusion Probabilistic Models, 去噪扩散概率模型) 用两条 Markov 链做生成: 前向过程 qqTT 步内把图像逐步加噪直至标准高斯噪声, 反向过程 pθp_\theta 学习逐步去噪还原数据。前向单步 q(xtxt1)=N(xt; 1βtxt1, βtI)q(x_t \mid x_{t-1}) = \mathcal{N}(x_t;\ \sqrt{1-\beta_t}x_{t-1},\ \beta_t I), 因每一步只加独立高斯噪声, 重参数化叠加后任意时刻 tt 都有封闭形式:
📌核心概述
q(xtx0)=N(xt; αˉtx0, (1αˉt)I),xt=αˉtx0+1αˉtϵ, ϵN(0,I)q(x_t \mid x_0) = \mathcal{N}(x_t;\ \sqrt{\bar\alpha_t}x_0,\ (1-\bar\alpha_t)I),\qquad x_t = \sqrt{\bar\alpha_t}x_0 + \sqrt{1-\bar\alpha_t}\,\epsilon,\ \epsilon \sim \mathcal{N}(0, I)
📌核心概述
其中 αt=1βt\alpha_t = 1 - \beta_t, 累积噪声调度 αˉt=s=1tαs\bar\alpha_t = \prod_{s=1}^{t}\alpha_s(tt 越大, 信噪比 αˉt/(1αˉt)\bar\alpha_t/(1-\bar\alpha_t) 越低), 常用线性调度 β1=104\beta_1 = 10^{-4} 线性增至 βT=0.02\beta_T = 0.02。训练目标由最大化变分下界 (ELBO) 推出: ELBO 每项是后验 q(xt1xt,x0)q(x_{t-1} \mid x_t, x_0)pθ(xt1xt)p_\theta(x_{t-1} \mid x_t) 之间的高斯 KL, 在方差已知时化简为两均值间的 L2; 该均值是 xtx_t 与噪声 ϵ\epsilon 的线性组合, 最终等价于“预测第 tt 步被注入的噪声”的简单回归:
📌核心概述
L=EtUniform[1,T],x0q,ϵN(0,I)[ϵϵθ(xt,t)2]\mathcal{L} = \mathbb{E}_{t \sim \mathrm{Uniform}[1,T],\, x_0 \sim q,\, \epsilon \sim \mathcal{N}(0,I)}\left[\Vert \epsilon - \epsilon_\theta(x_t, t)\Vert^2\right]
📌核心概述
采样从 xTN(0,I)x_T \sim \mathcal{N}(0, I) 出发, 按 t=T,,1t = T, \dots, 1 反向迭代: xt1=1αt(xtβt1αˉtϵθ(xt,t))+σtzx_{t-1} = \dfrac{1}{\sqrt{\alpha_t}}\left(x_t - \dfrac{\beta_t}{\sqrt{1-\bar\alpha_t}}\epsilon_\theta(x_t, t)\right) + \sigma_t z, 其中 σt2=β~t\sigma_t^2 = \tilde\beta_t (后验方差), 末步 t=1t=1z=0z = 0
💡使用场景
面试必考“写出 DDPM 训练/采样公式”; 是 Stable Diffusion 等文生图模型与视频/音频生成的底座, 常与“为什么 L2 只回归噪声”连问。
解决的核心痛点
GAN 对抗训练不稳定、易模式坍塌且难调; DDPM 的训练目标是噪声回归 MSE, 一阶优化稳定收敛、多样性好(覆盖全分布), 代价是采样需约 1000 步——由此引出 DDIM、LCM 等加速手段。
🎯5 个高频面试考点 (Exam Points)
1
写出 DDPM 前向过程的封闭形式 q(x_t|x_0) 与累积噪声调度 ᾱ_t 的定义?
2
白板推导: 从变分下界 ELBO 到训练损失 L = E[‖ε − ε_θ(x_t,t)‖²], 每项高斯 KL 如何化简?
3
写出 DDPM 采样迭代公式, 末步为什么不加噪声? σ_t 取什么?
4
α_t、β_t、ᾱ_t 的关系? 为什么前向可以一步采样到任意时刻 t?
5
DDPM 相比 GAN 与 VAE 在训练稳定性、样本多样性、采样速度上的差异?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「DDPM 前向/反向过程」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点多模态偏好对齐下一个知识点Classifier-Free Guidance (CFG)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示CLIP 应用CLIP 双塔架构