M1-036M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Easy
Mastery:

估计理论 (MLE/MAP): 定义最大似然估计(MLE),并给出一个完整例子。

📐 Mathematical Definition
θ^MLE=arg⁡max⁡θ∑ilog⁡p(xi∣θ)\hat\theta_{MLE}=\arg\max_\theta\sum_i\log p(x_i\mid\theta)
⚡ Executive Summary
Core Concept: MLE 选择让观测数据出现概率最大的参数;对高斯似然求导即得样本均值与方差。

📌 Key Takeaways

  • •
    似然不是概率(对参数不归一化)
  • •
    MLE 在小样本下可能过拟合(如方差估计有偏)

📐 Mathematical Derivations

MLE 的构造:写出似然 L(θ)=Πᵢp(xᵢ|θ),取对数把乘积变求和 ℓ(θ)=Σᵢlog p(xᵢ|θ),再对 θ 求导置零。<strong>完整例子(高斯)</strong>:ℓ(μ,σ²)=−n/2·log(2πσ²)−(1/2σ²)Σ(xᵢ−μ)²;对 μ 求导得 μ̂=(1/n)Σxᵢ(样本均值);对 σ² 求导得 σ̂²=(1/n)Σ(xᵢ−μ̂)²(注意分母是 n 而非 n−1,故是有偏估计)。<strong>另一例子(Bernoulli)</strong>:ℓ(p)=k log p+(n−k)log(1−p),求导得 p̂=k/n,即样本频率。MLE 的关键性质是<strong>参数化不变性</strong>——若 θ̂ 是 θ 的 MLE,则 g(θ̂) 是 g(θ) 的 MLE(对任意函数 g),这使其应用极广。

🏭 Production Trade-offs

三个必须掌握的要点:① <strong>似然不是概率</strong>——L(θ) 对 θ 不归一化(∫L(θ)dθ 通常不为 1),只有作为 θ 的函数才有意义;② <strong>MLE 的偏差</strong>——高斯方差估计 (1/n)Σ(xᵢ−μ̂)² 的期望是 (n−1)/n·σ²,故系统性低估,这就是 Bessel 校正(除以 n−1)的来源;在小样本下偏差显著,n→∞ 时消失(渐近无偏);③ <strong>MLE 的渐近性质</strong>——在正则条件下,√n(θ̂−θ)→N(0, I(θ)⁻¹)(I 为 Fisher 信息矩阵),即渐近正态且达到 Cramér-Rao 下界(渐近有效)。这使我们可以用 Fisher 信息构造置信区间,也是很多统计检验的理论基础。实践中 MLE 的失效情形包括:参数在边界(如方差为 0)、模型不可辨识(GMM 的标签置换)、完全分离(逻辑回归中可分数据导致系数发散)。
⚠️ Common Interview Pitfalls
  • ✕
    把似然当概率使用
  • ✕
    忽略小样本下 MLE 的偏差(方差估计需 Bessel 校正)
🎯 Interviewer Follow-ups
  • ?
    MLE 的一致性需要什么条件?
  • ?
    为什么 MLE 的方差估计要除以 n-1?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-035: Numerical Stability: 列举深度学习中常见的数值不稳定来源,以及各自的缓解手段。📋Back to BankNext →M1-037: 估计理论 (MLE/MAP): 定义 MAP 估计,并说明它与 MLE、正则化的关系。