TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
深度学习 思维导图
›
WGAN 与 Wasserstein
← 返回 深度学习 思维导图
中文
·
English
🧠 深度学习
ID:
wgan
WGAN 与 Wasserstein
WGAN & Wasserstein
🎯
核心定义
WGAN 用 Wasserstein 距离 (推土机距离, 经 Kantorovich-Rubinstein 对偶) 度量两个分布:
W
(
P
r
,
P
g
)
=
sup
∥
f
∥
L
≤
1
E
x
∼
P
r
[
f
(
x
)
]
−
E
z
∼
p
z
[
f
(
G
(
z
)
)
]
W(P_r, P_g) = \sup_{\Vert f \Vert_L \le 1} \mathbb{E}_{x \sim P_r}[f(x)] - \mathbb{E}_{z \sim p_z}[f(G(z))]
W
(
P
r
,
P
g
)
=
sup
∥
f
∥
L
≤
1
E
x
∼
P
r
[
f
(
x
)]
−
E
z
∼
p
z
[
f
(
G
(
z
))]
, 要求判别器 (critic)
f
f
f
满足 1-Lipschitz 约束。原始 WGAN 用权重裁剪实现 Lipschitz, 但裁剪易破坏分布; WGAN-GP 改为在真实与生成样本的线性插值点
x
^
\hat{x}
x
^
上施加梯度惩罚
λ
E
x
^
∼
P
x
^
[
(
∥
∇
x
^
D
(
x
^
)
∥
2
−
1
)
2
]
\lambda \mathbb{E}_{\hat{x} \sim P_{\hat{x}}}\left[(\Vert \nabla_{\hat{x}} D(\hat{x}) \Vert_2 - 1)^2\right]
λ
E
x
^
∼
P
x
^
[
(
∥
∇
x
^
D
(
x
^
)
∥
2
−
1
)
2
]
(默认
λ
=
10
\lambda = 10
λ
=
10
)。
💡
使用场景
图像生成中替代标准 GAN 以获得稳定训练 (DCGAN 骨架 + WGAN-GP 损失); 面试必问 Wasserstein 与 JSD/KL 的对比、1-Lipschitz 约束的实现方式。
⚡
解决的核心痛点
标准 GAN 的 JSD 在真实与生成分布支撑集不重叠 (训练早期常见) 时趋近常数
log
2
\log 2
lo
g
2
, 梯度几乎处处为 0, 生成器收不到信号; Wasserstein 距离处处连续可导, 即使分布不重叠也提供有意义的梯度, 训练更稳定, 且 loss 不再饱和、可作收敛指标。代价: 必须维护 1-Lipschitz 约束 — 权重裁剪会致梯度爆炸/消失, 梯度惩罚是更稳健的实现。
🎯
5 个高频面试考点 (Exam Points)
1
写出 Wasserstein 距离的定义与 Kantorovich-Rubinstein 对偶形式?
2
为什么 JSD/KL 在分布不重叠时梯度消失, 而 Wasserstein 距离不会?
3
1-Lipschitz 约束如何实现? 权重裁剪与梯度惩罚各有什么问题?
4
WGAN-GP 梯度惩罚项为什么在
∥
∇
x
^
D
(
x
^
)
∥
2
=
1
\Vert \nabla_{\hat{x}} D(\hat{x}) \Vert_2 = 1
∥
∇
x
^
D
(
x
^
)
∥
2
=
1
时最优?
5
为什么 WGAN 的 critic 输出不加 sigmoid? WGAN 的 loss 数值有什么含义?
📖 关联深度指南:
📄 gan-and-generative-basics →
更新于 2026-08-12
🎯
检验攻克程度:针对「WGAN 与 Wasserstein」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
GAN 对抗训练
下一个知识点 →
VAE 与重参数化
🔗 更多 深度学习 知识点卡片
激活函数演进
Adam/AdamW
Autograd 动态图
BatchNorm 批归一化