🎯核心定义
生成模型三大路线的对比, 核心是质量/多样性/速度三角。GAN 用生成器与判别器的零和博弈, 单步前向推理最快, 但对抗训练不稳定、易模式坍塌; 扩散/流模型通过逐步去噪生成, 训练是稳定回归、多样性好, 当前 SOTA FID 更低(质量上限更高); 自回归逐 token 预测, 擅长文本与离散模态、天然支持条件化, 但生成必须串行。对比表:
📌核心概述
| 维度 | GAN | 扩散 (DDPM/蒸馏) | 自回归 |
|---|---|---|---|
| 训练稳定性 | 差 (对抗不收敛) | 好 (MSE 回归) | 好 (交叉熵) |
| 多样性 | 差 (模式坍塌) | 好 (覆盖全分布) | 好 |
| 质量 (FID) | 模式内逼真 | 当前 SOTA 最低 FID | 图像上较弱 |
| 采样速度 | 1 步 (最快) | 4–1000 步 (可蒸馏/DDIM) | 逐 token 串行 |
| 高分辨率扩展 | 难稳定 | 潜空间 + DiT 可扩展 | 难 |
📌核心概述
FID (Fréchet Inception Distance): 把真实与生成图像分别过 Inception 网络取特征, 假设特征服从高斯分布, 计算两组均值与协方差之间的 Fréchet 距离:
📌核心概述
FID=∥μr−μg∥2+Tr(Σr+Σg−2(ΣrΣg)1/2) 📌核心概述
越低越好, 同时衡量真实度与多样性; 注意 FID 与多样性并不完全等价——GAN 可能 FID 尚可但多样性差。
💡使用场景
面试对比题 (为什么文生图 SOTA 是扩散而非 GAN?); 生成方案选型: 低延迟交互 (实时滤镜、SR 超分) 用 GAN 或蒸馏扩散, 质量/多样性优先 (文生图、视频) 用扩散。
⚡解决的核心痛点
GAN 的对抗训练不稳定、模式坍塌与高分辨率难扩展; 扩散以更多采样步数为代价换来稳定训练、完整分布覆盖与更低 FID; 自回归在图像生成上的位置逐渐被扩散/流模型取代。