M6-043M6: Multimodal & Generative ModelsDiffusion Models Foundations (DDPM)Easy
Mastery:

Diffusion Models Foundations (DDPM): 写出 DDPM 的简化训练损失,并说明网络预测什么。

📐 Mathematical Definition
Lsimple=Et,x0,ϵ[∥ϵ−ϵθ(αˉtx0+1−αˉtϵ, t)∥2]\mathcal{L}_{\text{simple}}=\mathbb{E}_{t,x_0,\epsilon}\left[\left\|\epsilon-\epsilon_\theta(\sqrt{\bar\alpha_t}x_0+\sqrt{1-\bar\alpha_t}\epsilon,\ t)\right\|^2\right]
⚡ Executive Summary
Core Concept: 网络预测噪声 ε:L=E[‖ε−ε_θ(x_t,t)‖²];训练时随机采 t、用闭式解构造 x_t、回归所加的噪声。

📌 Key Takeaways

  • •
    网络输入:加噪样本 x_t 与时间步 t
  • •
    预测目标:所加的噪声 ε(等价于预测 x_0 或 score)
  • •
    训练:随机采 t、一步加噪、回归噪声(简单高效)

📐 Mathematical Derivations

数学机理:<strong>DDPM 的简化损失</strong>——L_simple=E_{t,x_0,ε}[ ‖ε−ε_θ(x_t,t)‖² ],其中 (a) <strong>t 均匀采样</strong>(1~T);(b) <strong>x_t 由闭式解构造</strong>:x_t=√ᾱ_t·x_0+√(1−ᾱ_t)·ε(ε∼N(0,I));(c) <strong>网络预测所加的噪声</strong> ε_θ(x_t,t);(d) <strong>损失是 MSE</strong>(预测噪声与真实噪声的均方误差)。<strong>为什么预测噪声</strong>——(a) <strong>数学等价</strong>——因为 x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε,故'预测 ε'与'预测 x_0'<strong>互相可转换</strong>:x̂_0=(x_t−√(1−ᾱ_t)ε_θ)/√ᾱ_t、ε̂=(x_t−√ᾱ_t x̂_0)/√(1−ᾱ_t);两者在数学上等价(只是参数化不同)。(b) <strong>实践更好</strong>——实证发现'预测 ε'比'直接预测 x_0'<strong>训练更稳定、生成质量更好</strong>(因为 ε 的尺度在各时间步更均匀,而 x_0 的预测在 t 大时(信噪比低)极难)。<strong>(c) 与 score 的关系</strong>——ε_θ 与 score 函数 ∇log p(x_t) 成正比:∇log p_t(x_t)=−ε_θ(x_t,t)/√(1−ᾱ_t);故'预测噪声'等价于'估计 score'(这是扩散与 score matching 的联系)。<strong>为什么可以省略 ELBO 的权重系数</strong>——严格的 ELBO 推导得到的是'各时间步带权重 λ_t 的加权 MSE'(λ_t 与 β_t、ᾱ_t 有关);DDPM 发现<strong>去掉权重、用简单的均匀加权 MSE</strong>(L_simple)<strong>效果更好</strong>——这被称为'简化损失(simple loss)'。<strong>直觉</strong>——(a) 加权会'偏重某些时间步'(如 t 小的步),导致其他步训练不足;(b) 均匀加权使每个时间步都得到充分训练;(c) 这也是一种'对生成质量的隐式优化'(而非纯粹的似然优化)。<strong>训练循环</strong>(伪代码思路)——(1) 采 x_0(真实图像);(2) 采 t∼U{1,T};(3) 采 ε∼N(0,I);(4) 构造 x_t;(5) 计算 ‖ε−ε_θ(x_t,t)‖²;(6) 反向传播。<strong>采样</strong>——从 x_T∼N(0,I) 开始,逐步用 ε_θ 估计并去除噪声(DDPM 采样 / DDIM 采样)。<strong>其他参数化</strong>——(a) <strong>x_0-prediction</strong>(直接预测 x_0);(b) <strong>v-prediction</strong>(预测 √ᾱ_t ε−√(1−ᾱ_t) x_0,见 v-prediction 题);(c) <strong>score-prediction</strong>。选择影响'不同 SNR 区间的训练难度'。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'预测噪声 + 均匀权重'是 DDPM 的两大实践选择</strong>——它们都'偏离严格的 ELBO 推导'但'效果更好';这说明扩散模型的成功部分来自'工程选择'而非纯理论。② <strong>'参数化选择影响稳定性'</strong>——ε-prediction 在'高噪声区(t 大)'更稳定(因为 ε 尺度均匀),而 x_0-prediction 在高噪声区极难;这是'为什么默认用 ε'的原因。③ <strong>'与 score matching 的等价性'</strong>——它连接了扩散与 score-based 生成模型(Song 等);理解这一点能统一两个视角(见 score matching 题)。④ <strong>'均匀权重 vs 加权'的争议</strong>——有工作(如 'Perception Prioritized Training')发现'对中间时间步加权'能提升质量;故'均匀'不是绝对最优(取决于目标)。⑤ <strong>'训练的高效性'</strong>——随机采 t + 一步加噪 + 一次前向/反向,使扩散训练与普通监督学习一样简单(这是它相比 GAN/VAE 的工程优势)。⑥ <strong>面试要点</strong>——被问'DDPM 损失',应写出 <strong>L_simple(预测 ε 的 MSE)</strong> 与'<strong>闭式解构造 x_t</strong>',并解释'<strong>预测 ε 与预测 x_0 等价但 ε 更稳定</strong>'与'<strong>简化损失(去权重)效果更好</strong>';能指出'ε 与 score 成正比'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为必须用完整的 ELBO 加权损失(简化损失更好)
  • ✕
    在 t 大时用 x_0-prediction(极难且不稳)
🎯 Interviewer Follow-ups
  • ?
    为什么预测噪声而不是 x_0?
  • ?
    为什么可以省略 ELBO 的权重系数?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-042: Diffusion Models Foundations (DDPM): 写出扩散的前向过程与闭式解。📋Back to BankNext →M6-044: Diffusion Models Foundations (DDPM): 解释 DDPM 与 DDIM 的采样差异。