M1-040M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Hard
Mastery:

估计理论 (MLE/MAP): 什么是可辨识性(identifiability)?举一个不可辨识的例子。

📐 Mathematical Definition
pθ=pθ′ 但 θ≠θ′ ⇒ 不可辨识p_\theta=p_{\theta'}\ \text{但}\ \theta\ne\theta'\ \Rightarrow\ \text{不可辨识}
⚡ Executive Summary
Core Concept: 若不同参数产生同一分布,则不可辨识;如高斯混合的标签置换、因子分析的旋转不变性。

📌 Key Takeaways

  • •
    会导致优化景观有对称的等价解
  • •
    缓解:加约束、固定尺度、用对称不变的目标

📐 Mathematical Derivations

可辨识性指参数到分布的映射是单射:若 p_θ=p_θ' 则必有 θ=θ'。不可辨识时,即使有无限数据也无法唯一确定参数——因为数据只能确定<strong>分布</strong>,而分布对应多个参数值。<strong>三个经典例子</strong>:① <strong>高斯混合的标签置换</strong>——K 个分量的任意排列给出同一密度,故有 K! 个等价解;② <strong>因子分析的旋转不变性</strong>——若 X=ΛF+ε,则对任意正交阵 Q,ΛQ 与 QᵀF 给出同一协方差,故载荷矩阵 Λ 只在旋转意义下可辨识(需固定 Λ 的结构或用 Varimax 旋转);③ <strong>神经网络的多重对称性</strong>——同一层内神经元的置换、以及 ReLU 网络中的正缩放对称(W₁→W₁D、W₂→D⁻¹W₂ 对正对角阵 D 保持不变)都导致参数不可辨识。

🏭 Production Trade-offs

后果与缓解:① <strong>优化景观的对称性</strong>——不可辨识意味着损失函数存在大量<strong>等价的全局极小</strong>(由对称群连接),这解释了为什么神经网络能找到多个训练损失相同的解,但它们泛化性能可能不同(对称性不影响损失但影响隐式正则);② <strong>缓解手段</strong>——加约束(如 GMM 要求分量权重有序、方差相等)、固定尺度(因子分析中令 ΛᵀΨ⁻¹Λ 为对角)、用对称不变的目标(如直接优化似然而非参数);③ <strong>实践中的判断</strong>——若优化过程中参数在不同初始化下收敛到差异很大的值但损失相近,很可能存在不可辨识性;此时不应比较参数值,而应比较预测分布。另一个相关概念是<strong>弱可辨识</strong>(参数在有限数据下难以区分,如共线特征),它不会导致理论问题但会造成数值不稳。
⚠️ Common Interview Pitfalls
  • ✕
    试图通过更多数据解决不可辨识(数据无法区分等价参数)
  • ✕
    直接比较不可辨识模型的参数值
🎯 Interviewer Follow-ups
  • ?
    为什么高斯混合的对数似然是非凸且有多个等价极大?
  • ?
    深度学习中的置换对称性有何影响?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-039: 估计理论 (MLE/MAP): 什么是一致性与有效性?MLE 具备这两个性质吗。📋Back to BankNext →M1-041: Hypothesis Testing: 解释 p-value 的准确含义,并指出最常见的误解。