权重初始化 = 训练开始前为权重选择分布,目标是让前向激活与反向梯度在层间传递时方差保持(既不明显缩小、也不明显放大),从而不触发梯度消失/爆炸。零初始化或全部相同初始化是错误示范: 同层所有神经元权重相同 → 前向输出相同、反向梯度也相同 → 对称性无法破缺,所有神经元永远学习到同一功能(等价于一个神经元)。Xavier/Glorot 初始化(2010,面向 tanh/sigmoid 的近似线性区): 前向方差保持要求
Var(w)=1/din,反向要求
Var(w)=1/dout,取折中
Var(w)=din+dout2;均匀分布形式
w∼U[−din+dout6,din+dout6](
U[−a,a] 的方差为
a2/3,令
a2/3=2/(din+dout) 反解出
a=6/(din+dout)),或正态
N(0,2/(din+dout))。Kaiming/He 初始化(2015,面向 ReLU):
Var(w)=din2,均匀
U[−din6,din6] 或正态
N(0,2/din);PReLU 推广为
Var(w)=(1+a2)din2(a 为负半轴斜率)。核心推导(设
E[w]=0、
x 与
w 独立): 单输出
y=∑iwixi 满足
Var(y)=dinVar(w)Var(x),令输出方差等于输入方差即得
Var(w)=1/din;ReLU 把激活均方砍半(负半轴置零),故乘 2 得
2/din。