M1-036M1: Mathematics & Statistics Fundamentals估计理论 (MLE/MAP)Easy
Mastery:
估计理论 (MLE/MAP): 定义最大似然估计(MLE),并给出一个完整例子。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: MLE 选择让观测数据出现概率最大的参数;对高斯似然求导即得样本均值与方差。
📌 Key Takeaways
- •似然不是概率(对参数不归一化)
- •MLE 在小样本下可能过拟合(如方差估计有偏)
📐 Mathematical Derivations
MLE 的构造:写出似然 L(θ)=Πᵢp(xᵢ|θ),取对数把乘积变求和 ℓ(θ)=Σᵢlog p(xᵢ|θ),再对 θ 求导置零。<strong>完整例子(高斯)</strong>:ℓ(μ,σ²)=−n/2·log(2πσ²)−(1/2σ²)Σ(xᵢ−μ)²;对 μ 求导得 μ̂=(1/n)Σxᵢ(样本均值);对 σ² 求导得 σ̂²=(1/n)Σ(xᵢ−μ̂)²(注意分母是 n 而非 n−1,故是有偏估计)。<strong>另一例子(Bernoulli)</strong>:ℓ(p)=k log p+(n−k)log(1−p),求导得 p̂=k/n,即样本频率。MLE 的关键性质是<strong>参数化不变性</strong>——若 θ̂ 是 θ 的 MLE,则 g(θ̂) 是 g(θ) 的 MLE(对任意函数 g),这使其应用极广。
🏭 Production Trade-offs
三个必须掌握的要点:① <strong>似然不是概率</strong>——L(θ) 对 θ 不归一化(∫L(θ)dθ 通常不为 1),只有作为 θ 的函数才有意义;② <strong>MLE 的偏差</strong>——高斯方差估计 (1/n)Σ(xᵢ−μ̂)² 的期望是 (n−1)/n·σ²,故系统性低估,这就是 Bessel 校正(除以 n−1)的来源;在小样本下偏差显著,n→∞ 时消失(渐近无偏);③ <strong>MLE 的渐近性质</strong>——在正则条件下,√n(θ̂−θ)→N(0, I(θ)⁻¹)(I 为 Fisher 信息矩阵),即渐近正态且达到 Cramér-Rao 下界(渐近有效)。这使我们可以用 Fisher 信息构造置信区间,也是很多统计检验的理论基础。实践中 MLE 的失效情形包括:参数在边界(如方差为 0)、模型不可辨识(GMM 的标签置换)、完全分离(逻辑回归中可分数据导致系数发散)。
⚠️ Common Interview Pitfalls
- ✕把似然当概率使用
- ✕忽略小样本下 MLE 的偏差(方差估计需 Bessel 校正)
🎯 Interviewer Follow-ups
- ?MLE 的一致性需要什么条件?
- ?为什么 MLE 的方差估计要除以 n-1?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.