返回 数理基础 思维导图
中文·English
📐 数理基础ID: estimation

点估计 MLE/矩估计

Point Estimation
🎯核心定义
点估计 (Point Estimation) 用样本构造单个参数值: 极大似然估计 (MLE) 选取使观测数据出现概率最大的参数, θ^=argmaxθi=1np(xiθ)\hat{\theta} = \arg\max_{\theta} \prod_{i=1}^{n} p(x_i \mid \theta);因对数单调, 实际是最大化对数似然 (θ)=ilogp(xiθ)\ell(\theta) = \sum_i \log p(x_i \mid \theta) 并求导置零。
💡使用场景
几乎所有参数模型的求解入口——正态参数、逻辑回归、混合模型 (EM 的 M 步);面试常考正态均值的 MLE 推导、Fisher 信息量与 CRLB、MLE 与矩估计 (MoM) 的对比。
解决的核心痛点
相比矩估计只匹配前 kk 阶样本矩 (小样本有偏、可能低效), MLE 在正则条件下渐近无偏、一致且渐近有效, 方差达到信息论下界:
📌核心概述
Var(θ^)1I(θ)\text{Var}(\hat{\theta}) \ge \frac{1}{I(\theta)} (Cramér–Rao 下界), 其中 I(θ)=E[2θ2logL(θ)]I(\theta) = -\mathbb{E}[\frac{\partial^2}{\partial \theta^2} \log L(\theta)] 为 Fisher 信息量;代价是小样本可能有偏 (如 σ^2\hat{\sigma}^2 需用 n1n-1 校正) 且需要数值优化。
🎯5 个高频面试考点 (Exam Points)
1
写出 MLE 的定义式, 并推导正态分布均值的 MLE。
2
为什么 MLE 通常取对数似然再求导?是否改变最优解?
3
Cramér–Rao 下界 Var(θ^)1/I(θ)\text{Var}(\hat{\theta}) \ge 1/I(\theta) 的含义与 Fisher 信息量的定义?
4
MLE 与矩估计 (MoM) 的区别及各自的优缺点?
5
MLE 的大样本性质(一致性、渐近正态、渐近有效)是什么?
更新于 2026-08-12
🎯
检验攻克程度:针对「点估计 MLE/矩估计」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点中心极限定理 CLT下一个知识点假设检验

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导贝叶斯推断偏差方差分解Bootstrap