激活函数演进是深度学习非线性来源的主线。Sigmoid 将输出压缩到
(0,1):
σ(x)=1+e−x1,导数
σ′(x)=σ(x)(1−σ(x))=σ(1−σ),峰值仅
0.25,且两端饱和——深层连乘下梯度必然消失;Tanh 零中心、导数峰值为 1,仍两端饱和。ReLU:
ReLU(x)=max(0,x),正区间导数恒为 1,一举解决梯度消失,但负区间梯度为 0 造成 Dead ReLU;LeakyReLU 以
0.01x 修补。GELU 以标准正态 CDF
Φ(x) 作概率权重:
Φ(x)x+(1−Φ(x))0.5x(常用近似
xσ(1.702x)),平滑无硬截断,是 BERT/GPT 系列标配。SwiGLU 把门控思想引入 FFN:
xσ(xWg)⊗(xWu),LLaMA/Mistral 等现代 LLM 用它替换 ReLU。