M1-064M1: Mathematics & Statistics FundamentalsCommon DistributionsHard
Mastery:

Common Distributions: 什么是指数族分布?为什么它在统计学习中重要?

📐 Mathematical Definition
f(y;θ)=exp⁡ ⁣[yθ−b(θ)a(ϕ)+c(y,ϕ)],E[Y]=b′(θ), Var[Y]=b′′(θ)a(ϕ)f(y;\theta)=\exp\!\Big[\frac{y\theta-b(\theta)}{a(\phi)}+c(y,\phi)\Big],\qquad \mathbb E[Y]=b'(\theta),\ \mathrm{Var}[Y]=b''(\theta)a(\phi)
⚡ Executive Summary
Core Concept: 统一形式 f(y;θ)=exp[(yθ−b(θ))/a(φ)+c(y,φ)];涵盖高斯/伯努利/泊松/Gamma 等,是 GLM 的基础。

📌 Key Takeaways

  • •
    充分统计量存在且维度固定
  • •
    共轭先验存在(指数族是自共轭的)
  • •
    GLM 的统一框架

📐 Mathematical Derivations

指数族的统一形式把大量常见分布写成同一结构,其中 θ 是自然参数、b(θ) 是累积量函数、a(φ) 是离散参数。<strong>三个核心性质</strong>:① <strong>矩由 b 的导数给出</strong>——E[Y]=b'(θ)、Var[Y]=b''(θ)a(φ),故'方差函数' V(μ)=b''(θ) 完全刻画了分布族(高斯 V(μ)=1、泊松 V(μ)=μ、伯努利 V(μ)=μ(1−μ)、Gamma V(μ)=μ²);② <strong>充分统计量存在且维度固定</strong>——对 n 个样本,Σyᵢ(及 Σyᵢ²)即为充分统计量,无需保存原始数据;③ <strong>共轭先验存在</strong>——指数族与自身的共轭先验族配对(Beta-Bernoulli、Dirichlet-Multinomial、Normal-Normal、Gamma-Poisson),使贝叶斯更新有解析形式。

🏭 Production Trade-offs

为什么重要:① <strong>GLM 的统一基础</strong>——广义线性模型 = 指数族(随机成分)+ 线性预测子(系统成分)+ 链接函数;只要指定分布族与链接函数,损失函数与估计算法(IRLS)自动确定,无需人工设计;② <strong>最大熵解释</strong>——在给定充分统计量的约束下,指数族是<strong>熵最大</strong>(假设最少)的分布;这给出了'为什么用这些分布'的信息论依据;③ <strong>充分统计量的工程价值</strong>——可以只存储 Σyᵢ 与 Σyᵢ² 而非全部数据(流式计算、隐私保护、分布式聚合);④ <strong>自然参数与链接函数</strong>——GLM 的<strong>正则链接</strong>(canonical link)恰好使自然参数等于线性预测子,此时对数似然是凹的、IRLS 收敛快;⑤ <strong>局限</strong>——指数族只覆盖'方差是均值的函数'的分布,对<strong>过度离散</strong>(方差 > 均值)、<strong>零膨胀</strong>(大量零值)、<strong>多峰</strong>等情形需扩展(负二项、零膨胀模型、混合模型)。
⚠️ Common Interview Pitfalls
  • ✕
    认为指数族涵盖所有分布(不涵盖过度离散/多峰等)
  • ✕
    忽略方差函数 V(μ) 对建模选择的意义
🎯 Interviewer Follow-ups
  • ?
    为什么指数族有共轭先验?
  • ?
    指数族与最大熵的关系?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-063: Common Distributions: 解释对数正态分布与它的适用场景。📋Back to BankNext →M1-065: Information Theory: 解释 JS 散度与它相对 KL 的改进。