M6-051M6: Multimodal & Generative ModelsDiffusion Models Foundations (DDPM)Hard
Mastery:
Diffusion Models Foundations (DDPM): 解释扩散模型的 SDE 与 ODE 采样。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 反向 SDE(随机,DDPM/Euler-a)与概率流 ODE(确定,DDIM/DPM-Solver)有相同边缘分布;ODE 可大步长、SDE 多样性更高。
📌 Key Takeaways
- •反向 SDE:含随机项(每步加噪),对应 DDPM 系
- •概率流 ODE:去掉随机项,对应 DDIM/DPM-Solver
- •两者边缘分布相同;ODE 可用大步长、SDE 多样性更高
📐 Mathematical Derivations
数学机理:<strong>统一框架(Song 等 2021)</strong>——前向过程写成 SDE:dx=f(x,t)dt+g(t)dW(把数据变成噪声);<strong>反向 SDE</strong>(从噪声生成数据):dx=[f(x,t)−g²(t)∇_x log p_t(x)]dt+g(t)dar w,其中 ∇log p_t 由 score 网络提供(与 ε 成正比)。<strong>概率流 ODE</strong>——对同一个 SDE,存在一个<strong>确定性 ODE</strong>:dx=[f(x,t)−½g²(t)∇log p_t(x)]dt;<strong>关键性质</strong>——该 ODE 与反向 SDE 有<strong>相同的边缘分布</strong> p_t(x)(即在每个时刻 t,两者的样本分布相同)。<strong>因此</strong>——(a) 用 SDE 采样(随机)或 ODE 采样(确定)都能得到正确的最终分布;(b) 差异在'路径'与'多样性':SDE 的路径有随机性(不同轨迹)、ODE 的路径确定(给定起点唯一轨迹)。<strong>DDPM 与 DDIM 的对应</strong>——(a) DDPM 对应某个特定 SDE 的离散化(Euler-Maruyama),每步加噪;(b) DDIM 对应概率流 ODE 的一阶离散化(σ=0);(c) 故'DDPM 与 DDIM 是同一框架的两种采样'。<strong>实践中的 SDE 变体</strong>——(a) <strong>Euler-a</strong>(Karras 等)——在 SDE 中引入'时间步相关的噪声尺度'(churn),使各步的噪声注入可控;(b) <strong>Langevin 修正</strong>——在某些步用 Langevin 动力学提升质量。<strong>选择依据</strong>——(a) <strong>确定性(ODE)</strong>——可复现、可用大步长(少步采样)、支持 inversion(图像编辑)、支持插值;<strong>缺点</strong>——多样性较低(需靠不同起点)。(b) <strong>随机(SDE)</strong>——多样性更高(每步加噪引入变化);在'高分辨率生成'时有时质量更好(有研究显示 SDE 在细节上更优);<strong>缺点</strong>——不可复现、步数受限(随机项要求小步长)。<strong>混合方案</strong>——(a) <strong>部分步用 SDE、部分用 ODE</strong>;(b) <strong>Euler-a 的 churn 调度</strong>(在中间步注入噪声);(c) <strong>DPM-Solver++</strong>(ODE 求解器 + 可选的 SDE 修正)。<strong>度量</strong>——(a) <strong>FID/质量</strong>;(b) <strong>多样性</strong>(如 recall、LPIPS 分布);(c) <strong>步数与延迟</strong>。<strong>实践建议</strong>——(a) <strong>快速采样</strong> → ODE(DPM-Solver,10~20 步);(b) <strong>编辑/复现</strong> → ODE;(c) <strong>追求细节/多样性</strong> → SDE(Euler-a);(d) 按任务选。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'同边缘分布'是统一框架的核心</strong>——它解释了'为什么两种采样都正确';面试中能指出这一点是深度理解的标志。② <strong>'ODE 可大步长'</strong>——因为确定性 ODE 的数值积分可用高阶方法(误差可控);而 SDE 的随机项要求小步长。③ <strong>'SDE 多样性更高'</strong>——随机项引入变化;但在'同一 prompt 生成多样结果'上,ODE 也可通过不同起点实现(故差异不绝对)。④ <strong>'inversion 需要 ODE'</strong>——DDIM inversion 依赖确定性映射(可逆);这是'图像编辑'的基础。⑤ <strong>'Euler-a 的 churn'</strong>——它是在 SDE 框架下'可控地注入噪声'(在中间步加噪以提升细节);这是'随机 vs 确定'的连续调节旋钮。⑥ <strong>面试要点</strong>——被问'SDE vs ODE 采样',应给出'<strong>反向 SDE(随机,DDPM 系)vs 概率流 ODE(确定,DDIM/DPM-Solver)</strong>'与'<strong>同边缘分布、ODE 可大步长、SDE 多样性更高</strong>';能指出'ODE 是 inversion/编辑的基础'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 ODE 与 SDE 采样会得到不同分布(同边缘分布)
- ✕用随机采样做精确 inversion
🎯 Interviewer Follow-ups
- ?为什么两者边缘分布相同?
- ?什么时候该用 SDE?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.