M1-009M1: Mathematics & Statistics FundamentalsCommon DistributionsMedium
Mastery:

Common Distributions: 解释 Beta 分布的形状参数含义,以及它在 A/B 测试中的应用。

📐 Mathematical Definition
f(x;a,b)=xa−1(1−x)b−1B(a,b),E[X]=aa+bf(x;a,b)=\frac{x^{a-1}(1-x)^{b-1}}{B(a,b)},\qquad \mathbb E[X]=\frac{a}{a+b}
⚡ Executive Summary
Core Concept: Beta(a,b) 定义在 [0,1],a、b 可理解为'成功/失败伪计数';是 Bernoulli 的共轭先验。

📌 Key Takeaways

  • •
    后验更新极简:观察 s 次成功、f 次失败 → Beta(a+s, b+f)
  • •
    Thompson Sampling 直接从后验采样决策

📐 Mathematical Derivations

Beta(a,b) 的密度正比于 x^{a−1}(1−x)^{b−1},形状由 a、b 相对大小决定:a=b 时对称(a=b=1 即均匀分布);a>1,b>1 时单峰;a<1 或 b<1 时在端点发散(U 型)。把它看成'伪计数'后,共轭更新极其简洁:若先验 Beta(a,b),观测到 s 次成功、f 次失败,则后验为 Beta(a+s,b+f)——后验均值 (a+s)/(a+b+s+f) 恰是带平滑的样本比例,平滑强度由 a+b 控制。这正是 CTR 平滑的贝叶斯解释:Beta(1,1) 先验给出拉普拉斯平滑,Beta(α,β) 给出更强的先验收缩。

🏭 Production Trade-offs

工业应用有三条主线:① <strong>Thompson Sampling</strong>:多臂老虎机中直接从各臂的后验 Beta 采样并选最大值,天然平衡探索与利用,且比 UCB 更易扩展到复杂奖励;② <strong>贝叶斯 A/B 测试</strong>:直接报告 P(p_A>p_B) 与预期损失,避免频率派 p 值的'无差异'困境,且允许中途查看(无 peeking 问题,因为后验随数据更新是合法的);③ <strong>冷启动平滑</strong>:新商品/新用户点击率用 Beta 先验收缩到全局均值,防止 1/1=100% 的极端估计。局限在于共轭只对指数族成立,复杂模型需 MCMC/变分近似。Dirichlet 是 Beta 的多类别推广,用于多项分布的共轭先验。
⚠️ Common Interview Pitfalls
  • ✕
    把 a、b 当作概率而非计数
  • ✕
    先验强度过大导致后验被先验主导(数据量小时尤甚)
🎯 Interviewer Follow-ups
  • ?
    Beta 与 Dirichlet 的关系?
  • ?
    共轭先验的实用价值与局限?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-008: Common Distributions: 高斯分布为什么无处不在?中心极限定理的准确表述是什么。📋Back to BankNext →M1-010: Common Distributions: 什么是重尾分布?它对均值估计和 A/B 测试有什么影响?