M1-008M1: Mathematics & Statistics FundamentalsCommon DistributionsMedium
Mastery:
Common Distributions: 高斯分布为什么无处不在?中心极限定理的准确表述是什么。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: i.i.d. 有限方差下,标准化样本均值依分布收敛到 N(0,1);误差是多因素叠加的自然结果。
📌 Key Takeaways
- •CLT 解释 A/B 检验能用 z/t 检验
- •不要求原始数据正态,只要求均值的抽样分布近似正态
- •重尾分布下 CLT 收敛很慢,需 bootstrap 或稳健方法
📐 Mathematical Derivations
CLT 的准确表述:设 X₁,…,Xₙ 独立同分布,E[X]=μ、Var[X]=σ²<∞,则 √n(X̄−μ)/σ 依分布收敛于 N(0,1)。三个前提必须同时满足——<strong>独立</strong>、<strong>同分布</strong>(或至少 Lindeberg 条件)、<strong>有限方差</strong>。证明思路用特征函数:φ_{√n(X̄−μ)/σ}(t)=[φ((t)/(σ√n))]ⁿ,对 log φ 做二阶泰勒展开,高阶项在 n→∞ 时消失,留下 −t²/2,正是标准正态的特征函数对数。高斯'无处不在'的另一个解释是<strong>最大熵</strong>:在给定均值与方差的所有分布中,正态的熵最大——即它是信息量最少(假设最弱)的选择。
🏭 Production Trade-offs
工程含义有三层:① <strong>A/B 测试的合法性</strong>来自 CLT——即使指标(如转化率)本身是 Bernoulli,样本均值在大 n 下近似正态,故可用 z/t 检验;② <strong>重尾下 CLT 收敛极慢</strong>:若分布是 Pareto(α=1.5),收敛速度远慢于指数,小样本下置信区间严重低估不确定性,此时应用 bootstrap 或稳健统计;③ <strong>CLT 只管均值,不管极值</strong>——最大值/分位数的分布由极值理论(GEV 分布)刻画,与正态无关。此外,误差的正态性是'多因素独立叠加'的结果(Lindeberg-Feller 条件),当存在单一主导因素时该假设失效。
⚠️ Common Interview Pitfalls
- ✕认为 CLT 要求原始数据正态(只要求均值的抽样分布)
- ✕在强相关数据(时间序列/聚类数据)上直接套用 CLT
🎯 Interviewer Follow-ups
- ?CLT 不适用的情况?(无限方差、强相关、极小样本)
- ?与 LNN 的区别?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.