M2-060M2: Classical Machine LearningDimensionality ReductionMedium
Mastery:

Dimensionality Reduction: 比较 t-SNE 与 UMAP 的原理与适用场景。

📐 Mathematical Definition
t-SNE: min⁡KL(P∥Q),qij∝(1+∥yi−yj∥2)−1\text{t-SNE}:\ \min\mathrm{KL}(P\|Q),\quad q_{ij}\propto(1+\|y_i-y_j\|^2)^{-1}
⚡ Executive Summary
Core Concept: t-SNE 保持局部邻域概率分布(KL 最小化),适合可视化;UMAP 基于流形与拓扑,更快且更好保留全局结构。

📌 Key Takeaways

  • •
    t-SNE 超参敏感(perplexity)、不可外推
  • •
    UMAP 可变换新样本、保留更多全局结构

📐 Mathematical Derivations

<strong>t-SNE 的原理</strong>:① 在高维空间为每对点定义相似度 p_{ij}(以各点为中心的高斯核,带宽由 perplexity 控制);② 在低维空间用 t 分布(重尾)定义相似度 q_{ij}∝(1+‖yᵢ−yⱼ‖²)⁻¹;③ 最小化 KL(P‖Q)(梯度下降)。重尾 t 分布的作用是缓解'拥挤问题'(低维空间中,中等距离的点会被挤在一起,重尾使它们更容易分开)。<strong>UMAP 的原理</strong>:① 用<strong>局部自适应</strong>的度量构造高维模糊图(每个点的邻居数由 n_neighbors 控制,且不同点可有不同带宽);② 在低维空间构造类似的模糊图,用<strong>交叉熵</strong>(而非 KL)最小化两者的差异;③ 用负采样与随机梯度下降加速。UMAP 的理论基础是<strong>黎曼几何 + 代数拓扑</strong>(假设数据均匀分布在局部连通的流形上)。

🏭 Production Trade-offs

实践对比与要点:① <strong>速度</strong>——UMAP 显著快于 t-SNE(尤其大数据),且内存占用更低。② <strong>全局结构</strong>——t-SNE 只保证局部邻域关系,簇间的<strong>距离与相对位置无意义</strong>(两次运行的簇间距离可能不同);UMAP 更好地保留全局结构(簇的相对位置更稳定),但仍不应过度解读距离。③ <strong>外推能力</strong>——t-SNE <strong>不能</strong>变换新样本(需重跑,且结果与之前不可比);UMAP 可用 <code>transform</code> 映射新样本(尽管保真度有限)。④ <strong>超参</strong>——t-SNE 的 perplexity(5–50,近似'有效邻居数')非常敏感,不同值给出很不同的图;UMAP 的 n_neighbors 与 min_dist 也需调,但相对稳健。⑤ <strong>使用建议</strong>——两者都<strong>只用于可视化</strong>,不可作为下游特征(坐标无绝对意义、不可复现、无外推);若需可视化可用 UMAP(快、全局结构好),若数据小且追求局部细节可用 t-SNE。⑥ <strong>常见误用</strong>——把 t-SNE 图中的簇间距离解释为'相似度'、用 t-SNE 坐标做聚类、或比较不同 perplexity 下的簇大小。
⚠️ Common Interview Pitfalls
  • ✕
    把 t-SNE 的簇间距离解释为相似度
  • ✕
    用 t-SNE/UMAP 坐标作为下游模型特征
🎯 Interviewer Follow-ups
  • ?
    为什么 t-SNE 的距离不能解释为相似度?
  • ?
    perplexity 的作用?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM2-059: Dimensionality Reduction: PCA 有哪些局限?什么时候不该用 PCA。📋Back to BankNext →M2-061: Dimensionality Reduction: 如何选择降维后的维度?解释方差比例法的思路与局限。