Transformer 自注意力机制 Lipschitz 连续性上界与谱范数严格理论证明 (Lipschitz Continuity & Spectral Norm Bounds of Self-Attention) 是深度学习理论与泛化性分析中研究自注意力层在面对微小输入扰动时输出稳定性的核心数学工具;标准自注意力映射
f(X)=softmax(dXWQWKTXT)XWV 是一个高度非线性的矩阵值函数;通过结合矩阵范数相乘性质与 Softmax 的雅可比矩阵最大特征值(Softmax 映射关于
L∞ 范数的 Lipschitz 常数严格为 1,关于
L2 范数的 Lipschitz 常数有界于
N),严格推导证明了 Self-Attention 层关于输入矩阵
X 的 Lipschitz 常数有界于:
Lattn≤C⋅∥WV∥2⋅(1+d2∥WQ∥2∥WK∥2∥X∥2);该定理揭示了为什么限制权重矩阵的谱范数(Spectral Normalization)与进行除以
d 缩放是防止深层 Transformer 梯度爆炸与表征退化 (Rank Collapse / Token Uniformity) 的充要数学保障。