返回 深度学习 思维导图
中文·English
🧠 深度学习ID: wgan

WGAN 与 Wasserstein

WGAN & Wasserstein
🎯核心定义
WGAN 用 Wasserstein 距离 (推土机距离, 经 Kantorovich-Rubinstein 对偶) 度量两个分布: W(Pr,Pg)=supfL1ExPr[f(x)]Ezpz[f(G(z))]W(P_r, P_g) = \sup_{\Vert f \Vert_L \le 1} \mathbb{E}_{x \sim P_r}[f(x)] - \mathbb{E}_{z \sim p_z}[f(G(z))], 要求判别器 (critic) ff 满足 1-Lipschitz 约束。原始 WGAN 用权重裁剪实现 Lipschitz, 但裁剪易破坏分布; WGAN-GP 改为在真实与生成样本的线性插值点 x^\hat{x} 上施加梯度惩罚 λEx^Px^[(x^D(x^)21)2]\lambda \mathbb{E}_{\hat{x} \sim P_{\hat{x}}}\left[(\Vert \nabla_{\hat{x}} D(\hat{x}) \Vert_2 - 1)^2\right] (默认 λ=10\lambda = 10)。
💡使用场景
图像生成中替代标准 GAN 以获得稳定训练 (DCGAN 骨架 + WGAN-GP 损失); 面试必问 Wasserstein 与 JSD/KL 的对比、1-Lipschitz 约束的实现方式。
解决的核心痛点
标准 GAN 的 JSD 在真实与生成分布支撑集不重叠 (训练早期常见) 时趋近常数 log2\log 2, 梯度几乎处处为 0, 生成器收不到信号; Wasserstein 距离处处连续可导, 即使分布不重叠也提供有意义的梯度, 训练更稳定, 且 loss 不再饱和、可作收敛指标。代价: 必须维护 1-Lipschitz 约束 — 权重裁剪会致梯度爆炸/消失, 梯度惩罚是更稳健的实现。
🎯5 个高频面试考点 (Exam Points)
1
写出 Wasserstein 距离的定义与 Kantorovich-Rubinstein 对偶形式?
2
为什么 JSD/KL 在分布不重叠时梯度消失, 而 Wasserstein 距离不会?
3
1-Lipschitz 约束如何实现? 权重裁剪与梯度惩罚各有什么问题?
4
WGAN-GP 梯度惩罚项为什么在 x^D(x^)2=1\Vert \nabla_{\hat{x}} D(\hat{x}) \Vert_2 = 1 时最优?
5
为什么 WGAN 的 critic 输出不加 sigmoid? WGAN 的 loss 数值有什么含义?
📖 关联深度指南:📄 gan-and-generative-basics
更新于 2026-08-12
🎯
检验攻克程度:针对「WGAN 与 Wasserstein」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点GAN 对抗训练下一个知识点VAE 与重参数化

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化