返回 多模态 思维导图
中文·English
👁️ 多模态ID: latent-diffusion

潜空间扩散 (LDM)

Latent Diffusion (LDM)
🎯核心定义
Latent Diffusion Model (LDM, 潜空间扩散) 不在像素空间而是在 VAE 的潜空间里做 DDPM, 最后解码回像素。图像 xRH×W×3x \in \mathbb{R}^{H \times W \times 3} 由 VAE 编码器压缩为 zRh×w×cz \in \mathbb{R}^{h \times w \times c},Stable Diffusion 的空间降维 8×8\times: 512×512512\times 512 图像 → 64×64×464\times 64\times 4 潜变量(c=4c=4)。扩散去噪全程在 zz 上进行:
📌核心概述
zt=αˉtz0+1αˉtϵ,L=E[ϵϵθ(zt,t,c)2]z_t = \sqrt{\bar\alpha_t}\,z_0 + \sqrt{1-\bar\alpha_t}\,\epsilon,\qquad \mathcal{L} = \mathbb{E}\left[\Vert \epsilon - \epsilon_\theta(z_t, t, c)\Vert^2\right]
📌核心概述
条件 cc (如 CLIP 文本嵌入) 通过交叉注意力注入 U-Net/DiT 的中间层; 采样完成后的 z0z_0VAEdec\mathrm{VAE}_{dec} 还原高分辨率图像。整体训练损失含三项: 潜空间扩散重建 + 感知损失 (LPIPS) + 对抗/GAN 项, 并施加轻微 KL 正则, 兼顾像素级逼真与感知质量。架构演进: SD1/2 用 U-Net (自注意力 + 交叉注意力 + 时间嵌入), SD3/Flux 用 MMDiT (混合文本-图像 DiT, patchify + AdaLN-zero 注入时间步与文本条件)。
💡使用场景
Stable Diffusion 全系与多数文生图/文生视频模型的底座; 面试常问 “为什么在潜空间而不是像素空间扩散?”、“8× 降维省多少算力?”。
解决的核心痛点
像素空间扩散在 256×256256\times256 以上计算与显存不可承受——注意力与特征图随分辨率平方级增长; 潜空间 8×8\times 空间降维使特征图面积降为 1/641/64, 训练与采样计算量约降两个数量级, 同时视觉细节由解码器补齐、语义压缩由编码器完成, 且文本/ControlNet 等条件都能在潜空间统一插拔。
🎯5 个高频面试考点 (Exam Points)
1
为什么 Stable Diffusion 在 VAE 潜空间而不是像素空间扩散? 8× 降维省多少算力?
2
LDM 的总体训练损失由哪几部分组成? 为什么加感知损失和对抗项?
3
文本条件如何注入潜空间扩散网络? 交叉注意力在 U-Net/DiT 中的位置?
4
SD1/2 的 U-Net 与 SD3/Flux 的 MMDiT 在结构上的关键差异?
5
潜空间扩散相比像素空间扩散在训练速度、显存、图像质量上的权衡?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「潜空间扩散 (LDM)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Classifier-Free Guidance (CFG)下一个知识点采样加速 (DDIM/DPM-Solver/LCM)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示CLIP 应用CLIP 双塔架构