M2-053M2: Classical Machine LearningClustering AlgorithmsEasy
Mastery:
Clustering Algorithms: 如何选择聚类数 K?列出主要方法。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 肘部法、轮廓系数、Gap 统计量、BIC/AIC(模型法)、业务可解释性。
📌 Key Takeaways
- •轮廓系数越接近 1 越好
- •肘部法主观,建议多指标交叉验证
📐 Mathematical Derivations
四种方法:① <strong>肘部法(Elbow)</strong>——画目标函数 J(簇内平方和)随 K 的曲线,找'下降速度明显变缓'的拐点。缺点是拐点常不明确(曲线平滑),主观性强。② <strong>轮廓系数(Silhouette)</strong>——对每个点计算 a(到同簇其他点的平均距离)与 b(到最近其他簇的平均距离),s=(b−a)/max(a,b)∈[−1,1];取所有点的均值作为该 K 的分数,选最高者。优点是同时反映簇内紧密度与簇间分离度;缺点是<strong>偏向凸形簇</strong>(对非凸簇给低分)。③ <strong>Gap 统计量</strong>——比较 log(J) 与'在数据边界框内均匀生成的参考数据的期望 log(J)'的差;Gap 最大的 K 是候选(还需考虑标准差)。优点是提供了'K=1(无结构)'的检验;缺点是计算贵。④ <strong>模型法</strong>——若用 GMM,可用 BIC/AIC 选分量数(BIC 惩罚更强,倾向更少的分量)。
🏭 Production Trade-offs
实践要点:① <strong>不要只依赖单一指标</strong>——不同指标常给出不同答案,应综合多个指标 + 业务可解释性(如营销场景希望簇数对应可执行的用户分层数)。② <strong>轮廓系数的适用边界</strong>——它在凸簇上可靠;对 DBSCAN 等密度聚类,应改用其他指标(如密度有效性指标 DBCV)。③ <strong>稳定性检验</strong>——用不同随机种子/子采样重复聚类,检查簇结构的稳定性(如 ARI 一致性);不稳定的 K 不可靠。④ <strong>层次聚类的树状图</strong>——可用 dendrogram 的'最大间隙'辅助选 K。⑤ <strong>业务导向</strong>——最终 K 常由可执行性决定(如 K=5 对应 5 类客户画像),而非纯统计最优;此时应报告统计指标作为参考而非唯一依据。⑥ <strong>注意 K-means 的 K 与 GMM 的分量数含义不同</strong>——GMM 的软分配可容纳重叠,BIC 选的 K 可能大于 K-means 的肘点。
⚠️ Common Interview Pitfalls
- ✕只用一个指标选 K
- ✕在非凸簇上用轮廓系数判断质量
🎯 Interviewer Follow-ups
- ?轮廓系数在非凸簇上可靠吗?
- ?Gap statistic 的思路?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.