M6-042M6: Multimodal & Generative ModelsDiffusion Models Foundations (DDPM)Easy
Mastery:

Diffusion Models Foundations (DDPM): 写出扩散的前向过程与闭式解。

📐 Mathematical Definition
q(xt∣x0)=N ⁣(αˉtx0, (1−αˉt)I),αˉt=∏s=1t(1−βs)q(x_t|x_0)=\mathcal{N}\!\left(\sqrt{\bar\alpha_t}x_0,\ (1-\bar\alpha_t)I\right),\quad \bar\alpha_t=\prod_{s=1}^{t}(1-\beta_s)
⚡ Executive Summary
Core Concept: 前向逐步加噪 q(x_t|x_{t-1})=N(√(1-β_t)x_{t-1}, β_t I);闭式解可直接从 x_0 采样任意 t 的 x_t。

📌 Key Takeaways

  • •
    前向:每步按调度 β_t 加高斯噪声
  • •
    闭式解:可用 ᾱ_t 一步采样任意 t 的 x_t(无需逐步)
  • •
    t→∞ 时 x_T 趋于标准正态(纯噪声)

📐 Mathematical Derivations

数学机理:<strong>前向过程(forward process)</strong>——给定数据 x_0,逐步加噪:q(x_t|x_{t−1})=N(x_t; √(1−β_t)·x_{t−1}, β_t·I),即 x_t=√(1−β_t)·x_{t−1}+√β_t·ε,其中 β_t∈(0,1) 是<strong>噪声调度(noise schedule)</strong>(t 越大 β 越大)。<strong>闭式解(closed form)</strong>——把递推展开,可证明:q(x_t|x_0)=N(x_t; √(ᾱ_t)·x_0, (1−ᾱ_t)·I),即 x_t=√ᾱ_t·x_0+√(1−ᾱ_t)·ε,其中 <strong>ᾱ_t=∏_{s=1}^{t}(1−β_s)</strong>(累积保留系数)。<strong>闭式解为什么重要</strong>——(a) <strong>训练效率</strong>——训练时可<strong>直接从 x_0 采样任意 t 的 x_t</strong>(一步),无需逐步加噪 T 次;这使得'随机采样 t + 一步加噪'成为训练循环(高效);(b) <strong>理论分析</strong>——它揭示了'信噪比(SNR)=ᾱ_t/(1−ᾱ_t)'随 t 单调下降(从 ∞ 到 0);(c) <strong>重参数化</strong>——x_t 可写成'信号 + 噪声'的线性组合,这是所有扩散损失推导的基础。<strong>ᾱ_t 的物理含义</strong>——它表示'到 t 步时保留的原始信号比例':ᾱ_t 接近 1 时信号几乎完整(t 小)、接近 0 时信号被噪声淹没(t 大)。<strong>终点性质</strong>——当 T 足够大且调度合适时,ᾱ_T≈0,故 x_T≈N(0,I)(标准正态,与数据无关);这是'反向过程从纯噪声出发'的前提。<strong>β 与 α 的记法</strong>——α_t=1−β_t、ᾱ_t=∏α_s;这两个符号在文献中通用。<strong>与 SDE 的关系</strong>——前向过程可写成<strong>随机微分方程(SDE)</strong>:dx=−½β(t)x dt+√β(t) dW;闭式解对应 SDE 的转移核。<strong>调度设计</strong>——β_t 的选择(linear/cosine)影响'各时间步的信噪比分布',从而影响生成质量(见噪声调度题)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'闭式解让训练可行'是核心工程价值</strong>——没有它,每个训练样本都要逐步加噪 T 次(T 可能 1000),成本高得不可接受;有了它,训练只需'随机采 t + 一步加噪'。② <strong>'SNR = ᾱ_t/(1−ᾱ_t)'是关键量</strong>——它统一描述了'各时间步的难度'(SNR 高时任务简单、低时难);噪声调度设计本质上是在'SNR 随时间的变化曲线'上做设计。③ <strong>'ᾱ_t 的调度'影响生成质量</strong>——若 ᾱ_t 衰减过快,则大量时间步处于'几乎纯噪声'(浪费);过慢则'最后几步太难'。故需精心设计(见噪声调度题)。④ <strong>'x_T≈N(0,I)'是采样的起点</strong>——这使'从纯噪声生成'成为可能;也意味着'生成的多样性'来自起始噪声的随机性。⑤ <strong>'重参数化'是损失推导的基础</strong>——x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε 使'预测噪声'与'预测 x_0'之间可互相转换(见 v-prediction 题)。⑥ <strong>面试要点</strong>——被问'扩散的前向过程',应写出<strong>递推式 + 闭式解</strong>(x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε)并解释'<strong>闭式解让训练可行</strong>'与'<strong>ᾱ_t 是信号保留比例、SNR 单调下降</strong>';这是扩散类问题的基本盘。
⚠️ Common Interview Pitfalls
  • ✕
    以为训练需要逐步加噪(闭式解可一步)
  • ✕
    混淆 β_t 与 ᾱ_t 的含义
🎯 Interviewer Follow-ups
  • ?
    闭式解为什么重要?
  • ?
    ᾱ_t 的物理含义?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-041: VLM Training & Evaluation: 解释 VLM 的多语言与跨文化能力(训练与评估)。📋Back to BankNext →M6-043: Diffusion Models Foundations (DDPM): 写出 DDPM 的简化训练损失,并说明网络预测什么。