返回 多模态 思维导图
中文·English
👁️ 多模态ID: sampler-acceleration

采样加速 (DDIM/DPM-Solver/LCM)

Sampler Acceleration (DDIM/DPM-Solver/LCM)
🎯核心定义
DDPM 原始采样需 1000 步, 主流加速分为三类:
📌核心概述
1. DDIM (Denoising Diffusion Implicit Models, 确定性隐式采样): 把前向链改写为非马尔可夫过程, 采样变成概率流 ODE 的确定性轨迹, 而训练目标与 DDPM 完全一致(无需重训练), 10–50 步即可出图:
📌核心概述
xt1=αˉt1(xt1αˉtϵθ(xt,t)αˉt)+1αˉt1σt2ϵθ(xt,t)+σtzx_{t-1} = \sqrt{\bar\alpha_{t-1}}\left(\dfrac{x_t - \sqrt{1-\bar\alpha_t}\,\epsilon_\theta(x_t,t)}{\sqrt{\bar\alpha_t}}\right) + \sqrt{1-\bar\alpha_{t-1} - \sigma_t^2}\,\epsilon_\theta(x_t,t) + \sigma_t z
📌核心概述
σt=0\sigma_t = 0 时退化为确定性 DDIM (即概率流 ODE 的 Euler 离散), 支持潜在空间插值与图像重建; σt>0\sigma_t > 0 时成为随机扩散采样 (DDPM 是其特例)。 2. 高阶 ODE 求解器: DPM-Solver / DPM++ 用二阶/三阶指数积分器精确求解概率流 ODE, 10–25 步即可达到近似 1000 步的质量。 3. 蒸馏: 渐进蒸馏 (Progressive Distillation) 每轮训练把步数减半; Latent Consistency Model (LCM) 把一致性模型 (Consistency Model) 用于潜空间, 直接学习把任意噪声映射到解轨迹的起点, 4 步出图甚至 1–2 步; LCM-LoRA 免训练即插即用; SDXL-Turbo/Lightning 用对抗蒸馏做到 1 步。
📌核心概述
权衡: 步数↓ → 延迟↓, 但 FID 与细节略有损失; 例如 4 步 LCM 通常略逊于 20 步 DPM++, 但延迟约低一个数量级。
💡使用场景
面试问 “怎么把扩散从 1000 步降到实时?”; 生产部署、交互式生成、视频生成与移动端的延迟优化。
解决的核心痛点
千步采样在实时交互/视频/移动端不可用; DDIM 无需重训练即可加速一个数量级, 高阶求解器在几乎无质量损失下把步数降到 10–25 步, 蒸馏类方法把单图延迟压到几十毫秒, 使扩散进入实时应用。
🎯5 个高频面试考点 (Exam Points)
1
写出 DDIM 采样公式, σ_t=0 时为什么是确定性 ODE 采样?
2
DDIM 与 DDPM 训练目标是否相同? 为什么 DDIM 无需重训练?
3
LCM/一致性模型如何做到 4 步出图? 一致性损失约束的是什么?
4
DPM-Solver/DPM++ 与 DDIM 的区别? 为什么高阶求解器步数更少质量更好?
5
采样步数与 FID/细节的权衡? 4 步 LCM vs 20 步 DPM++ 各自适用场景?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「采样加速 (DDIM/DPM-Solver/LCM)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点潜空间扩散 (LDM)下一个知识点视频生成

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用