M6-046M6: Multimodal & Generative ModelsDiffusion Models Foundations (DDPM)Hard
Mastery:
Diffusion Models Foundations (DDPM): 解释扩散模型的 ELBO 与简化损失的差异。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: ELBO 给出各时间步加权的 MSE;DDPM 的简化损失去掉权重用均匀 MSE,实践效果更好但不再是严格的似然下界。
📌 Key Takeaways
- •ELBO:变分下界,给出各时间步的加权 MSE(λ_t 与 β、ᾱ 有关)
- •简化损失:去掉权重、均匀 MSE;不再是严格的似然下界
- •简化损失实践更好(质量),但偏离'优化似然'的目标
📐 Mathematical Derivations
数学机理:<strong>ELBO 的推导思路</strong>——扩散模型的训练目标是最大化数据似然 log p(x_0);由于反向过程 p_θ(x_{t−1}|x_t) 的似然不可直接计算,用<strong>变分推断</strong>引入前向过程 q 作为近似后验,得到<strong>证据下界(ELBO)</strong>:log p(x_0) ≥ E_q[log(p_θ(x_{0:T})/q(x_{1:T}|x_0))]。把 ELBO 展开,可分解为:(a) 重建项(对应 t=1 的损失);(b) <strong>各时间步的 KL 项</strong>——KL(q(x_{t−1}|x_t,x_0) ‖ p_θ(x_{t−1}|x_t));由于两者都是高斯,KL 可化简为<strong>加权 MSE</strong>:L_ELBO=Σ_t λ_t·E‖ε−ε_θ(x_t,t)‖²,其中权重 λ_t 与 β_t、ᾱ_t 有关(具体形式在 t 小时较大)。<strong>简化损失(DDPM)</strong>——发现'去掉权重、用均匀的 MSE'(L_simple)<strong>效果更好</strong>。<strong>为什么去掉权重更好</strong>——(a) <strong>训练更均衡</strong>——加权会'偏重某些时间步'(如 t 小的步权重高),导致其他步训练不足;均匀加权使每个时间步都得到充分训练。(b) <strong>与'生成质量'的目标更匹配</strong>——生成质量更依赖'各时间步都去噪好'(而非'似然最大');故均匀加权更符合'采样质量'的目标。(c) <strong>实证</strong>——DDPM 论文报告 L_simple 的 FID 优于 L_ELBO(且训练更稳)。<strong>代价</strong>——L_simple <strong>不再是严格的似然下界</strong>(故不能用于'似然比较'或'有原则的模型选择');但在'生成质量'上更好。<strong>后续改进</strong>——(a) <strong>learned variance</strong>(Improved DDPM)——同时学习反向过程的方差(而非固定),并混合 L_simple 与 L_ELBO(用小的权重 λ 加 ELBO 项),可提升似然且不损质量;(b) <strong>Perception Prioritized Training</strong>——对'感知相关'的时间步加权(提升视觉质量);(c) <strong>v-prediction</strong>——改变参数化使各 SNR 区间的学习难度更均匀。<strong>理论视角</strong>——(a) L_simple 可视为'<strong>去噪 score matching</strong>'的目标(与 score matching 等价);(b) L_ELBO 是'似然优化'的目标;两者'目标不同'(似然 vs 生成质量),故'哪个更好'取决于评价标准。<strong>实践</strong>——(a) <strong>追求生成质量</strong> → L_simple(默认);(b) <strong>追求似然/压缩</strong> → L_ELBO(或混合);(c) 大多数生成任务用 L_simple。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'简化损失不是似然下界'是重要区分</strong>——它解释了'为什么扩散模型的似然不高但生成质量好';面试中能指出'目标不同(似然 vs 质量)'是深度理解的标志。② <strong>'加权会偏重某些步'</strong>——这是去掉权重的技术原因;均匀加权使所有时间步都得到训练。③ <strong>'感知加权'的改进</strong>——对'人类感知相关'的时间步(中等噪声)加权可提升视觉质量;说明'均匀'也不是绝对最优(取决于目标)。④ <strong>'learned variance'的价值</strong>——固定方差限制了似然(因为反向过程的方差不是最优);学习方差可提升似然且不损质量(但增加训练复杂度)。⑤ <strong>'与 score matching 的统一'</strong>——L_simple 等价于'去噪 score matching'(denoising score matching);这连接了扩散与 score-based 模型(见 score matching 题)。⑥ <strong>面试要点</strong>——被问'ELBO 与简化损失的差异',应给出'<strong>ELBO(变分下界,加权 MSE)vs 简化损失(去权重,均匀 MSE)</strong>'与'<strong>简化损失实践更好但不再是似然下界</strong>';能指出'目标不同(似然 vs 生成质量)'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为必须用 ELBO(简化损失更好)
- ✕用简化损失比较不同模型的似然
🎯 Interviewer Follow-ups
- ?为什么去掉权重反而更好?
- ?ELBO 的推导思路是什么?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.