M2-007M2: Classical Machine LearningLogistic Regression & GLMEasy
Mastery:

Logistic Regression & GLM: 解释 odds 与 log-odds,以及系数如何解释。

📐 Mathematical Definition
log⁡p1−p=w⊤x,OR=eβj\log\frac{p}{1-p}=w^\top x,\qquad \text{OR}=e^{\beta_j}
⚡ Executive Summary
Core Concept: odds=p/(1-p),logit 是 log-odds;系数表示特征每增 1 单位,log-odds 变化 β。

📌 Key Takeaways

  • •
    β>0 提升正类概率
  • •
    e^β 是优势比,便于业务解释

📐 Mathematical Derivations

三个概念层层递进:<strong>概率</strong> p∈[0,1](线性预测无法直接建模,因为 wᵀx∈(−∞,∞));<strong>优势(odds)</strong> p/(1−p)∈[0,∞)(解决了下界问题但仍有上界问题);<strong>对数优势(log-odds / logit)</strong> log(p/(1−p))∈(−∞,∞)(可与线性预测直接相等)。因此逻辑回归建模的是 log-odds 的线性性。系数解释:βⱼ 表示'xⱼ 增加 1 单位、其他特征不变时,log-odds 增加 βⱼ',等价于<strong>优势变为原来的 e^{βⱼ} 倍</strong>(优势比 OR)。例如 β=0.693 对应 OR=e^0.693=2,即优势翻倍。

🏭 Production Trade-offs

实践中的注意点:① <strong>优势比 ≠ 概率比</strong>——OR=2 不意味着概率翻倍;当基准概率很低(如 p=0.01)时 OR≈风险比(RR),但当 p 接近 0.5 时两者差异巨大(p 从 0.5 到 0.667 是 OR=2 但概率仅增 0.167)。② <strong>多分类的 softmax 系数</strong>——K 类时只有 K−1 组系数可辨识(存在'参照类'),解释为'相对参照类的 log-odds 变化';系数之和为零的约束是常见参数化。③ <strong>业务友好的替代</strong>——在风控评分卡中常用 <strong>WOE(证据权重)</strong> 与 <strong>评分刻度</strong>(score=A−B·log(odds)),把 log-odds 线性变换为整数分,便于业务沟通与阈值设定。④ <strong>共线性的影响</strong>——系数解释要求'其他特征不变',但共线时该条件无法满足,故 OR 会不稳定。
⚠️ Common Interview Pitfalls
  • ✕
    把优势比当作概率比或风险比
  • ✕
    在多分类中试图解释全部 K 组系数(只有 K−1 组可辨识)
🎯 Interviewer Follow-ups
  • ?
    如何解释多分类 softmax 的系数?
  • ?
    为什么业务方喜欢 odds ratio?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-006: Logistic Regression & GLM: 写出逻辑回归的模型形式与损失函数。📋Back to BankNext →M2-008: Logistic Regression & GLM: 什么是广义线性模型(GLM)?它由哪三部分组成。