M2-059M2: Classical Machine LearningDimensionality ReductionMedium
Mastery:

Dimensionality Reduction: PCA 有哪些局限?什么时候不该用 PCA。

📐 Mathematical Definition
PCA 无监督; LDA 有监督\text{PCA}\ \text{无监督};\ \text{LDA}\ \text{有监督}
⚡ Executive Summary
Core Concept: 只捕捉线性结构、对方差敏感、可解释性差、监督信息未用;不适合非线性流形与分类判别。

📌 Key Takeaways

  • •
    替代:KPCA、t-SNE/UMAP(可视化)、自编码器、LDA
  • •
    PCA 对尺度敏感

📐 Mathematical Derivations

四个核心局限:① <strong>只捕捉线性结构</strong>——PCA 找的是线性子空间,若数据分布在非线性流形上(如瑞士卷、环形),PCA 无法展开流形,会混合不同部分的样本;替代是 KPCA、自编码器、UMAP。② <strong>以方差为导向</strong>——PCA 保留方差大的方向,但<strong>方差大 ≠ 有判别力</strong>:若区分两类的方向恰好方差小,PCA 会丢弃它;这是无监督降维的根本局限(对比 LDA 最大化类间/类内方差比)。③ <strong>可解释性差</strong>——主成分是全部原始特征的线性组合,通常难以命名与解释;若需可解释降维应用稀疏 PCA 或特征选择。④ <strong>对尺度与异常值敏感</strong>——量纲不同会主导结果(需标准化),异常值会扭曲方差方向(可用稳健 PCA)。⑤ <strong>线性组合可能无意义</strong>——若特征间存在语义冲突(如'价格'与'销量'),线性组合可能没有物理意义。

🏭 Production Trade-offs

实践建议:① <strong>有监督任务优先 LDA/有监督降维</strong>——LDA 最大化类间散度与类内散度的比值,直接服务于分类;但它假设各类高斯同协方差且最多降到 K−1 维。② <strong>可视化用 t-SNE/UMAP,但不要用于下游</strong>——t-SNE 只保留局部邻域结构,其坐标与距离<strong>无全局意义</strong>(不能用于聚类或作为特征输入模型);UMAP 稍好(保留更多全局结构)但仍不推荐作为特征。③ <strong>需要可逆或生成时用自编码器</strong>——自编码器可学习非线性降维且能解码重建,适合生成任务;但需更多数据与调参。④ <strong>作为预处理</strong>——PCA 常用于加速(降维后训练更快)、去噪(丢弃小方差方向即去噪)、以及可视化;在这些场景 PCA 仍是首选(快、确定、无超参)。⑤ <strong>白化(whitening)</strong>——PCA 白化使各主成分方差为 1,常用于需要各向同性输入的算法(如某些神经网络、ICA)。
⚠️ Common Interview Pitfalls
  • ✕
    用 PCA 做有监督分类的降维(可能丢弃判别方向)
  • ✕
    把 t-SNE 的坐标当作下游特征使用
🎯 Interviewer Follow-ups
  • ?
    t-SNE 为什么不适合做下游特征?
  • ?
    LDA 与 PCA 的目标差异?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-058: Dimensionality Reduction: PCA 与 SVD 的关系是什么?📋Back to BankNext →M2-060: Dimensionality Reduction: 比较 t-SNE 与 UMAP 的原理与适用场景。