返回 多模态 思维导图
中文·English
👁️ 多模态ID: diffusion-vs-gan

扩散 vs GAN vs 自回归

Diffusion vs GAN vs Autoregressive
🎯核心定义
生成模型三大路线的对比, 核心是质量/多样性/速度三角。GAN 用生成器与判别器的零和博弈, 单步前向推理最快, 但对抗训练不稳定、易模式坍塌; 扩散/流模型通过逐步去噪生成, 训练是稳定回归、多样性好, 当前 SOTA FID 更低(质量上限更高); 自回归逐 token 预测, 擅长文本与离散模态、天然支持条件化, 但生成必须串行。对比表:
📌核心概述
| 维度 | GAN | 扩散 (DDPM/蒸馏) | 自回归 | |---|---|---|---| | 训练稳定性 | 差 (对抗不收敛) | 好 (MSE 回归) | 好 (交叉熵) | | 多样性 | 差 (模式坍塌) | 好 (覆盖全分布) | 好 | | 质量 (FID) | 模式内逼真 | 当前 SOTA 最低 FID | 图像上较弱 | | 采样速度 | 1 步 (最快) | 4–1000 步 (可蒸馏/DDIM) | 逐 token 串行 | | 高分辨率扩展 | 难稳定 | 潜空间 + DiT 可扩展 | 难 |
📌核心概述
FID (Fréchet Inception Distance): 把真实与生成图像分别过 Inception 网络取特征, 假设特征服从高斯分布, 计算两组均值与协方差之间的 Fréchet 距离:
📌核心概述
FID=μrμg2+Tr(Σr+Σg2(ΣrΣg)1/2)FID = \Vert \mu_r - \mu_g \Vert^2 + \mathrm{Tr}\left(\Sigma_r + \Sigma_g - 2(\Sigma_r\Sigma_g)^{1/2}\right)
📌核心概述
越低越好, 同时衡量真实度与多样性; 注意 FID 与多样性并不完全等价——GAN 可能 FID 尚可但多样性差。
💡使用场景
面试对比题 (为什么文生图 SOTA 是扩散而非 GAN?); 生成方案选型: 低延迟交互 (实时滤镜、SR 超分) 用 GAN 或蒸馏扩散, 质量/多样性优先 (文生图、视频) 用扩散。
解决的核心痛点
GAN 的对抗训练不稳定、模式坍塌与高分辨率难扩展; 扩散以更多采样步数为代价换来稳定训练、完整分布覆盖与更低 FID; 自回归在图像生成上的位置逐渐被扩散/流模型取代。
🎯5 个高频面试考点 (Exam Points)
1
扩散 vs GAN 在质量、多样性、速度上的对比? 为什么文生图 SOTA 用扩散?
2
写出 FID 公式并解释其含义, 为什么它不能完全代表多样性?
3
GAN 模式坍塌的成因与检测方法? 扩散如何天然规避这一问题?
4
自回归生成相比扩散的优缺点? 为什么自回归在图像上逐渐被取代?
5
实时场景(如手机端超分/滤镜)选 GAN 还是蒸馏扩散? 各自延迟与质量如何权衡?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「扩散 vs GAN vs 自回归」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DiT 与 3D Causal VAE下一个知识点扩散训练目标 (ε/v-pred 与 Zero-SNR)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用