M2-094M2: Classical Machine LearningLogistic Regression & GLMMedium
Mastery:
Logistic Regression & GLM: 解释多项逻辑回归(softmax 回归)与它的参数辨识性问题。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用 softmax 输出 K 类概率;K 组参数不可唯一辨识,需固定参照类或加约束。
📌 Key Takeaways
- •参数平移不变性:w_k ← w_k + c 不改变概率
- •常用参照类(w_K=0)或 L2 正则消除歧义
📐 Mathematical Derivations
多项逻辑回归用 softmax 把 K 个线性得分转为概率。<strong>辨识性问题的来源</strong>:注意到对<strong>所有</strong> w_k 同时加上同一个向量 c,分子分母同乘 e^{cᵀx} 后概率不变——即参数存在 <strong>K 维的平移不变性</strong>(实际是 K−1 维的冗余)。因此参数解不唯一,海森矩阵奇异,优化不收敛。<strong>两种消除方式</strong>:① <strong>固定参照类</strong>——令 w_K=0(把第 K 类作为基准),此时参数为'相对基准类的 log-odds':log[P(k)/P(K)]=w_kᵀx,共 K−1 组参数,唯一可辨识;② <strong>加 L2 正则</strong>——惩罚 Σ‖w_k‖² 使解唯一(且在数值上更稳定),此时不设参照类也可。<strong>与 one-vs-rest 的区别</strong>:OvR 训练 K 个独立的二分类器(可能给出概率和不为 1 的结果,需归一化),多项 LR 联合训练(概率天然和为 1,参数共享分母,统计上更正确)。
🏭 Production Trade-offs
实践要点:① <strong>系数解释</strong>——在参照类参数化下,w_k 表示'特征每增 1 单位时,类 k 相对参照类的 log-odds 变化';优势比 e^{w_kj} 是相对基准类的优势倍数。② <strong>正则化的必要性</strong>——若某类在训练集中样本极少或完全分离,未正则化的解会发散(同二分类的分离问题);L2 正则同时解决辨识性与分离问题。③ <strong>计算</strong>——用交叉熵损失 + softmax,梯度形式简洁:∇_{w_k}=Σᵢ(p_{ik}−y_{ik})xᵢ(与二分类形式一致);损失是凸的(唯一最优,前提是正则化或参照类约束)。④ <strong>类别数很多时</strong>——K 很大(如万级)时 softmax 的分母计算昂贵(需遍历所有类),此时用<strong>层次 softmax</strong>(树结构,O(log K))或<strong>负采样</strong>(近似,如 word2vec);这与推荐系统的'全量 softmax vs 采样'问题相同。⑤ <strong>与神经网络的 softmax 层等价</strong>——多项逻辑回归 = 单层神经网络 + softmax 输出层,只是术语与优化方式不同。⑥ <strong>类别不平衡</strong>——softmax 下可用类权重(损失加权)或先验调整(logit adjustment)。
⚠️ Common Interview Pitfalls
- ✕不设参照类也不加正则(参数不唯一)
- ✕用 OvR 的概率直接当作互斥类别概率(需归一化)
🎯 Interviewer Follow-ups
- ?为什么会有辨识性问题?
- ?softmax 与 K 个二分类(one-vs-rest)的区别?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.