M6-055M6: Multimodal & Generative ModelsGuidance & Fast Sampling (CFG / DDIM)Medium
Mastery:

Guidance & Fast Sampling (CFG / DDIM): 解释采样器(solver)对质量的影响。

📐 Mathematical Definition
DDIM: O(50 steps);DPM-Solver: O(15 steps);Euler-a: SDE, richer details\text{DDIM}:\ O(50\ \text{steps});\qquad \text{DPM-Solver}:\ O(15\ \text{steps});\qquad \text{Euler-a}:\ \text{SDE, richer details}
⚡ Executive Summary
Core Concept: 同一模型换采样器会显著改变质量与速度:DDIM/DPM-Solver 用更少步达同等质量;Euler-a 细节更丰富。

📌 Key Takeaways

  • •
    采样器把'去噪'视为 ODE/SDE 的数值求解;阶数决定每步的信息利用率
  • •
    DPM-Solver/UniPC 等高阶求解器 10~20 步即达质量
  • •
    Euler-a(SDE)细节更丰富但步数受限;确定性求解器可大步长

📐 Mathematical Derivations

数学机理:<strong>采样 = 数值求解 ODE/SDE</strong>——扩散采样本质是求解'概率流 ODE'或'反向 SDE';不同的采样器就是不同的<strong>数值积分方法</strong>。(1) <strong>DDIM</strong>——一阶 ODE 求解(欧拉法),每步只用当前点的信息;需 50~100 步。(2) <strong>DPM-Solver(Lu 等 2022)</strong>——利用 ODE 的<strong>解析形式</strong>(半线性结构)构造<strong>高阶求解器</strong>(二/三阶),每步利用多阶导数信息;<strong>10~20 步</strong>即可达到 1000 步 DDPM 的质量(约 50~100 倍加速)。(3) <strong>UniPC</strong>——统一预测-校正框架,进一步优化。(4) <strong>Euler / Heun</strong>——一阶/二阶 ODE 求解器(Karras 等的 EDM 框架)。(5) <strong>Euler-a(ancestral)</strong>——<strong>SDE</strong> 采样(每步加噪),细节更丰富但<strong>步数受限</strong>(随机项要求小步长);且不可复现。(6) <strong>LMS(线性多步)</strong>——用历史信息做多步预测。<strong>为什么高阶求解器能用更少步</strong>——数值积分的<strong>误差 ∝ 步长的阶数</strong>(一阶方法误差 O(h)、二阶 O(h²));故高阶方法可用更大步长(更少步数)达到同等精度。<strong>采样器与训练的关系</strong>——(a) <strong>独立</strong>——采样器不改变模型(只是'如何用模型的输出');故同一模型可换任何采样器(无需重训);(b) <strong>但有交互</strong>——不同参数化(ε/v)与调度会影响采样器的数值行为;(c) <strong>SDE 采样需'噪声调度'支持</strong>(Euler-a 需 α 调度)。<strong>对质量的影响</strong>——(a) <strong>确定性求解器(DDIM/DPM-Solver)</strong>——稳定、可复现、少步数可用;但细节可能'较平滑'(缺乏随机性带来的纹理);(b) <strong>SDE(Euler-a)</strong>——细节更丰富(有研究显示在高分辨率生成上更优);但需更多步、不可复现;(c) <strong>采样器的选择影响'不同噪声水平'的质量</strong>(如某些求解器在低噪声步更准)。<strong>实践建议</strong>——(a) <strong>默认</strong> → DPM-Solver++ / UniPC(10~20 步,质量与速度兼顾);(b) <strong>追求细节</strong> → Euler-a(但需更多步);(c) <strong>可复现/编辑</strong> → 确定性求解器;(d) <strong>参考各模型的推荐配置</strong>(不同模型有最优采样器)。<strong>度量</strong>——(a) <strong>步数 vs FID/CLIP-score 曲线</strong>(找'质量饱和'的步数);(b) 延迟;(c) 多样性与细节(人工或专门指标)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'采样器与训练独立'是重要认知</strong>——换采样器不需重训;故'采样器选择'是免费的优化空间(应充分探索)。② <strong>'高阶求解器用更少步'的代价</strong>——每步计算更贵(需多阶导数/额外前向);故'总成本 = 步数 × 每步成本'需权衡(通常高阶仍更划算)。③ <strong>'SDE 细节更丰富'的实证</strong>——有研究显示 SDE 在高分辨率/细节敏感场景更好;故'确定性 vs 随机'应按任务选(而非固定)。④ <strong>'步数饱和点'</strong>——超过某步数后质量不再提升(甚至下降,因为数值误差累积);故应找饱和点(通常 20~50 步)。⑤ <strong>'与 CFG 的交互'</strong>——CFG 使每步成本 ×2,故'少步 + CFG'的组合更经济。⑥ <strong>面试要点</strong>——被问'采样器怎么选',应给出'<strong>采样=数值求解 ODE/SDE + 阶数决定步数(高阶 10~20 步)+ 确定性 vs SDE 的取舍 + 与训练独立</strong>';能指出'应探索采样器(免费优化)'与'找步数饱和点'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为换采样器需要重训(独立)
  • ✕
    用固定步数而不找饱和点
🎯 Interviewer Follow-ups
  • ?
    为什么高阶求解器能用更少步?
  • ?
    采样器与训练目标是独立的吗?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-054: Guidance & Fast Sampling (CFG / DDIM): 解释 guidance scale 的权衡。📋Back to BankNext →M6-056: Guidance & Fast Sampling (CFG / DDIM): 解释扩散采样的随机性与可复现性。