M2-061M2: Classical Machine LearningDimensionality ReductionHard
Mastery:

Dimensionality Reduction: 如何选择降维后的维度?解释方差比例法的思路与局限。

📐 Mathematical Definition
ratiok=∑i≤kλi∑iλi\text{ratio}_k=\frac{\sum_{i\le k}\lambda_i}{\sum_i\lambda_i}
⚡ Executive Summary
Core Concept: 选累计解释方差达 90–95% 的维度;但该准则与下游任务无关,最好用下游验证性能选择。

📌 Key Takeaways

  • •
    方差小不代表对任务无用
  • •
    有监督场景应用 LDA/特征选择

📐 Mathematical Derivations

<strong>解释方差比例法</strong>:计算前 k 个主成分的方差和占总方差的比例,选使累计比例达到阈值(常用 90%、95%、99%)的最小 k。实现上画'碎石图'(scree plot,特征值随序号的曲线)找肘点,或直接设阈值。<strong>优点</strong>:简单、确定、无需额外评估。<strong>局限</strong>:① <strong>与下游任务无关</strong>——它只保证保留数据的总方差,而方差大 ≠ 对任务重要;例如若两类的差异体现在一个方差很小的方向上,PCA 会先丢弃它。② <strong>阈值主观</strong>——90% vs 95% 可能差很多维度,且'总方差'的定义依赖是否标准化。③ <strong>噪声与信号</strong>——若数据噪声方差大(如传感器噪声),PCA 会优先保留噪声方向(因为噪声方差大),反而有害。④ <strong>非线性结构</strong>——解释方差比例对线性 PCA 有意义,对 KPCA/自编码器无直接对应。

🏭 Production Trade-offs

实践建议:① <strong>有监督任务用下游性能选维度</strong>——把降维作为预处理管道的一环,用交叉验证选使下游指标最优的 k(网格搜索 k 值)。② <strong>有监督降维替代</strong>——LDA(最大化类间/类内散度比,最多降到 K−1 维)、偏最小二乘(PLS,同时考虑 X 与 Y 的协方差)、或直接用带 L1 的线性模型做特征选择。③ <strong>降维作为正则化</strong>——减少维度可降低过拟合风险,故 k 的选择也是偏差-方差权衡;小样本时宜取较小 k。④ <strong>可视化辅助</strong>——用碎石图 + 累计方差图共同判断(拐点 + 阈值)。⑤ <strong>k 的经验范围</strong>——实践中常保留 10–50 维(覆盖大部分方差且计算可控);若用于加速模型训练,可试更小的 k 并验证性能。⑥ <strong>注意标准化对比例的影响</strong>——标准化后各特征方差为 1,'总方差 = p',故解释方差比例的含义更清晰;不标准化时大尺度特征主导,比例会误导。
⚠️ Common Interview Pitfalls
  • ✕
    仅凭 90% 方差阈值决定维度而不验证下游性能
  • ✕
    在噪声方差大的数据上盲信 PCA 保留的'主要方向'
🎯 Interviewer Follow-ups
  • ?
    为什么低方差方向可能对分类很重要?
  • ?
    如何做有监督降维?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-060: Dimensionality Reduction: 比较 t-SNE 与 UMAP 的原理与适用场景。📋Back to BankNext →M2-062: Feature Engineering: 列举类别特征的常见编码方式及适用场景。