M6-048M6: Multimodal & Generative ModelsDiffusion Models Foundations (DDPM)Hard
Mastery:
Diffusion Models Foundations (DDPM): 解释 score matching 与扩散的关系。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 扩散的 ε 预测等价于估计 score(∇log p);去噪 score matching 提供了扩散损失的另一种(统一的)推导。
📌 Key Takeaways
- •score = 对数密度的梯度(指向'更高概率'的方向)
- •ε 与 score 成正比:ε = −√(1−ᾱ_t)·∇log p
- •去噪 score matching 给出与 DDPM 损失等价的推导
📐 Mathematical Derivations
数学机理:<strong>score 函数</strong>——score 定义为对数概率密度的梯度:s(x)=∇_x log p(x);它指向'概率密度增大的方向'(即'更像真实数据'的方向)。<strong>为什么 score 能生成</strong>——(a) 若知道 score,可用 <strong>Langevin 动力学</strong>采样:x←x+(η/2)s(x)+√η·z(沿 score 方向移动 + 加噪),迭代后收敛到 p(x);(b) 但直接估计 score 困难(需知道归一化常数);<strong>去噪 score matching(DSM)</strong> 提供了'无需归一化常数'的估计方法:对数据加噪后,score 可用'去噪方向'表示:∇_x log p_σ(x)=E[(x_0−x)/σ²|x](即'从含噪样本指向干净样本的方向')。<strong>与扩散的关系(核心)</strong>——在扩散中,x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε;可证明 <strong>score 与预测噪声成正比</strong>:∇_{x_t}log p_t(x_t)=−ε_θ(x_t,t)/√(1−ᾱ_t)。故 <strong>(a) '预测 ε' 等价于 '估计 score'</strong>;(b) DDPM 的 L_simple 等价于'去噪 score matching'的损失;(c) 两种视角(DDPM 的变分推断 vs score matching)<strong>给出等价的训练目标</strong>。<strong>score-based 生成(Song 等)</strong>——用 <strong>SDE</strong> 统一描述:前向 SDE dx=f(x,t)dt+g(t)dW 把数据变成噪声;反向 SDE dx=[f(x,t)−g²(t)∇log p_t(x)]dt+g(t)dW 从噪声生成数据;其中唯一的未知量是 score ∇log p_t,故'训练 score 网络 = 训练扩散模型'。<strong>概率流 ODE</strong>——同一个 SDE 对应一个<strong>确定性 ODE</strong>(dx=[f−½g²∇log p]dt),它与 SDE 有<strong>相同的边缘分布</strong>;这解释了'DDIM 的确定性采样与 DDPM 的随机采样能得到相似结果'。<strong>统一视角的价值</strong>——(a) <strong>理论统一</strong>——DDPM、DDIM、score-based、Flow Matching 都可用'SDE/ODE + score/向量场'统一描述;(b) <strong>采样器设计</strong>——可用 SDE/ODE 的数值方法(高阶求解器、自适应步长);(c) <strong>引导的统一</strong>——classifier guidance 与 CFG 都可用 score 的线性组合表达。<strong>实践</strong>——(a) 训练时用'预测 ε'(等价于 score matching);(b) 采样时可选 SDE(随机,DDPM/Euler-a)或 ODE(确定,DDIM/DPM-Solver);(c) 引导时用 score 的线性组合(见 CFG 题)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'ε 与 score 成正比'是统一扩散与 score-based 的桥梁</strong>——理解它能把两个看似不同的框架统一起来;面试中能给出这个关系式很有说服力。② <strong>'score matching 无需归一化常数'是关键优势</strong>——直接估计 score 避免了计算配分函数(不可行);这是'为什么能训练'的原因。③ <strong>'SDE 与 ODE 同边缘分布'解释了 DDIM 的合理性</strong>——确定性采样与随机采样都能得到正确的分布;这是'两种采样器共存'的理论基础。④ <strong>'统一视角的实用价值'</strong>——它使'采样器设计'变成'数值积分方法的选择'(可直接借鉴数值分析的工具),并统一了各种引导方法。⑤ <strong>'Langevin 动力学的直觉'</strong>——'沿 score 走 + 加噪'是采样的一般范式;扩散可视为'多尺度 Langevin 动力学'(从大噪声到小噪声逐步精化)。⑥ <strong>面试要点</strong>——被问'score matching 与扩散的关系',应给出'<strong>score=∇log p + ε 与 score 成正比 + 去噪 score matching 与 DDPM 损失等价 + SDE/ODE 统一框架</strong>';能写出 ∇log p_t=−ε/√(1−ᾱ_t) 是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 score matching 与扩散是两套无关的方法
- ✕忽略'概率流 ODE 与 SDE 同边缘分布'这一性质
🎯 Interviewer Follow-ups
- ?为什么 score 能用来生成?
- ?score-based 生成(SDE)与 DDPM 的关系?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.