M2-028M2: Classical Machine Learning集成方法 (Bagging/RF)Easy
Mastery:
集成方法 (Bagging/RF): 随机森林的两个随机性来源是什么?各自作用。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 行采样(bootstrap)+ 特征子采样;前者降方差,后者降低树间相关性。
📌 Key Takeaways
- •相关性 ρ 是关键:特征子采样降 ρ
- •B 增大收益递减
📐 Mathematical Derivations
方差分解公式给出了关键洞察:B 棵树平均后的方差 = ρσ² + (1−ρ)σ²/B,其中 ρ 是任意两棵树预测的相关系数,σ² 是单棵树的方差。第一项 ρσ² <strong>不随 B 增大而消失</strong>——这是方差的下界,只能通过降低树间相关性 ρ 来降低。两个随机性来源正是为此设计:① <strong>Bootstrap 行采样</strong>(每棵树用有放回抽样的 ~63.2% 样本)——使树看到不同数据,降低相关性并直接降方差;② <strong>特征子采样</strong>(每次分裂只从随机 m 个特征中选最优,分类默认 m=√p,回归默认 m=p/3)——这是<strong>降低 ρ 的主要手段</strong>,因为若某特征很强,所有树都会用它做首要分裂,导致树高度相关;限制特征候选使树的结构多样化。
🏭 Production Trade-offs
实践要点:① <strong>m 是最关键的超参</strong>——m 越小 ρ 越低但单树越弱(偏差上升),需权衡;默认 √p(分类)与 p/3(回归)是经验最优起点。② <strong>B 的收益递减</strong>——由于 (1−ρ)σ²/B 项,B 增大有收益但递减;实践中 B=100–500 通常足够,再增大对精度提升有限(但不会有害)。③ <strong>OOB 估计</strong>——每棵树未抽到的 ~36.8% 样本构成袋外样本,可免费估计泛化误差,无需单独验证集。④ <strong>ExtraTrees 的差异</strong>——除行采样与特征子采样外,<strong>分裂阈值也随机</strong>(不用搜索最优阈值,而是随机选),这进一步降低方差(更快、偏差略高),在噪声特征多时表现更好。⑤ <strong>偏差问题</strong>——RF 的偏差与单棵深树相近(Bagging 不降偏差),故若需更低偏差应转向 Boosting。
⚠️ Common Interview Pitfalls
- ✕认为 B 越大越好(收益递减,且 ρσ² 项无法消除)
- ✕忽略 m 的调节作用(它是降相关性的关键)
🎯 Interviewer Follow-ups
- ?为什么树间相关性决定集成效果?
- ?极端随机树(ExtraTrees)差在哪?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.