M6-045M6: Multimodal & Generative ModelsDiffusion Models Foundations (DDPM)Medium
Mastery:

Diffusion Models Foundations (DDPM): 解释噪声调度(linear vs cosine)的影响。

📐 Mathematical Definition
linear: βt linear in t;cosine: αˉt=cos⁡2((t/T+s)π/2)cos⁡2(sπ/2)\text{linear}:\ \beta_t\ \text{linear in }t;\qquad \text{cosine}:\ \bar\alpha_t=\frac{\cos^2((t/T+s)\pi/2)}{\cos^2(s\pi/2)}
⚡ Executive Summary
Core Concept: 调度决定各时间步的信噪比分布;linear 在两端浪费(中间信噪比变化快),cosine 更均匀,质量更好。

📌 Key Takeaways

  • •
    linear:β_t 线性增长;低噪声段过密、高噪声段变化快
  • •
    cosine:按 ᾱ_t 的余弦形状设计,信噪比变化更均匀
  • •
    cosine 通常生成质量更好(尤其高分辨率)

📐 Mathematical Derivations

数学机理:<strong>噪声调度(noise schedule)</strong> 定义 β_t(或等价地 ᾱ_t)随 t 的变化,它决定'每个时间步的信噪比(SNR=ᾱ_t/(1−ᾱ_t))'。<strong>linear 调度(DDPM 原始)</strong>——β_t 从 β_1=1e−4 <strong>线性</strong>增长到 β_T=0.02。<strong>问题</strong>——(a) <strong>两端浪费</strong>——在 t 很小时 ᾱ_t≈1(信号几乎无损),故前若干步'几乎没加噪'(学到的任务太简单,浪费);在 t 很大时 ᾱ_t≈0(几乎纯噪声),也学不到有用信息;(b) <strong>中间变化快</strong>——在中间的若干步内信噪比<strong>急剧下降</strong>(从'清晰'到'全噪'),导致这部分时间步的'任务跨度大'(难学);(c) <strong>高分辨率时更严重</strong>——图像尺寸越大,'有用的细节'越多,linear 调度在高分辨率上表现更差。<strong>cosine 调度(Improved DDPM,Nichol & Dhariwal 2021)</strong>——直接对 <strong>ᾱ_t</strong> 设计:ᾱ_t=cos²((t/T+s)/(1+s)·π/2)/cos²(s·π/2)(s 是小偏移,避免 t=0 时 β 太小)。<strong>优点</strong>——(a) <strong>信噪比变化更均匀</strong>——各时间步的'信息破坏量'更均匀,避免了'中间骤降';(b) <strong>两端更少浪费</strong>——起点与终点的过渡更平滑;(c) <strong>生成质量更好</strong>——论文报告 cosine 调度在 CIFAR-10/ImageNet 上优于 linear(尤其高分辨率与少步数采样)。<strong>其他调度</strong>——(a) <strong>sigmoid / scaled-linear</strong>;(b) <strong>零终端 SNR(Zero Terminal SNR)</strong>——修正'训练与推理的 SNR 不匹配'(重要改进,见后续);(c) <strong>EDM 的 ρ 调度</strong>(Karras 等)。<strong>调度的影响机制</strong>——(a) <strong>训练</strong>——各时间步的'任务难度分布'变化(影响学习效率);(b) <strong>采样</strong>——各步的'去噪幅度'变化(影响少步采样的质量);(c) <strong>SNR 与'训练-推理不匹配'</strong>——若训练时最高噪声步的 ᾱ_T 不为 0,则推理从'纯噪声'出发时会遇到'未见过的 SNR'(导致质量下降)——这是 Zero Terminal SNR 要解决的问题。<strong>实践建议</strong>——(a) 默认用 <strong>cosine 或 scaled-linear</strong>;(b) 高分辨率/少步采样时尤其要注意调度;(c) 确保 <strong>ᾱ_T≈0</strong>(训练时最高噪声步接近纯噪声);(d) 调度的选择需与'参数化(ε/v/x_0)'配合(见 v-prediction 题)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'SNR 曲线'是理解调度的钥匙</strong>——调度设计本质是'设计信噪比随时间的曲线';linear 的问题在于曲线在中间陡降。② <strong>'高分辨率对调度更敏感'</strong>——因为高分辨率图像的'有效信息'更多、细节更丰富,故调度的不均匀性影响更大。③ <strong>'零终端 SNR'是重要改进</strong>——若 ᾱ_T>0(训练最高噪声步仍有信号),则推理从纯噪声出发时会遇到'训练未见过的 SNR',导致'生成偏亮/偏暗'等问题;修正方法是强制 ᾱ_T=0(并调整参数化)。④ <strong>'调度与参数化的耦合'</strong>——不同参数化(ε/v/x_0)在不同 SNR 区间的'学习难度'不同;故调度与参数化需联合设计(如 v-prediction 配合'零终端 SNR')。⑤ <strong>'调度影响少步采样'</strong>——少步采样(10~20 步)时,各步的'跨度'很大,故调度的均匀性更关键。⑥ <strong>面试要点</strong>——被问'噪声调度怎么选',应给出'<strong>linear(β 线性,两端浪费、中间陡降)vs cosine(按 ᾱ_t 设计,SNR 更均匀,质量更好)</strong>'与'<strong>零终端 SNR 修正训练-推理不匹配</strong>';能指出'调度本质是设计 SNR 曲线'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    沿用 DDPM 的 linear 调度(高分辨率下较差)
  • ✕
    不检查 ᾱ_T 是否接近 0(训练推理不匹配)
🎯 Interviewer Follow-ups
  • ?
    为什么 linear 调度有问题?
  • ?
    调度如何影响'信息被破坏的速度'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-044: Diffusion Models Foundations (DDPM): 解释 DDPM 与 DDIM 的采样差异。📋Back to BankNext →M6-046: Diffusion Models Foundations (DDPM): 解释扩散模型的 ELBO 与简化损失的差异。