M2-056M2: Classical Machine LearningClustering AlgorithmsHard
Mastery:
Clustering Algorithms: 如何评估聚类质量(无标签)?内部与外部指标各有哪些。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 内部:轮廓系数、DB 指数、CH 指数;外部(有标签):ARI、NMI、纯度。
📌 Key Takeaways
- •ARI 对簇数不敏感、可比较随机划分
- •内部指标偏向凸簇
📐 Mathematical Derivations
<strong>外部指标</strong>(有真实标签,用于验证算法或调参):① <strong>纯度(Purity)</strong>——每个簇取最多的真实类别,求和除以 n;缺点是<strong>随簇数单调上升</strong>(簇数=n 时纯度为 1),故不能单独使用。② <strong>NMI(归一化互信息)</strong>——聚类与真实划分的互信息除以熵的归一化,取值 [0,1],对簇数不敏感。③ <strong>ARI(调整兰德指数)</strong>——衡量两划分的一致性,并对随机划分做了期望校正(随机划分的 ARI 期望为 0,相同划分为 1);这是<strong>最推荐的指标</strong>,因为它对簇数与簇大小不敏感。<strong>内部指标</strong>(无标签,仅看簇内紧密度与簇间分离度):① <strong>轮廓系数</strong>——见前述,偏向凸簇;② <strong>Calinski-Harabasz(CH)指数</strong>——簇间离散度/簇内离散度的比值(类似 F 统计量),越大越好,计算快;③ <strong>Davies-Bouldin(DB)指数</strong>——簇内散度与簇间距离的比值,越小越好。
🏭 Production Trade-offs
实践要点:① <strong>内部指标的偏见</strong>——所有基于距离的内部指标都<strong>偏好凸形、等大小</strong>的簇,故对 DBSCAN/谱聚类的结果会给出误导性低分;此时应改用密度感知指标(DBCV)或人工检查。② <strong>ARI 的优势</strong>——它对簇数不敏感且校正了随机一致性,故在比较不同算法/参数时最可靠;但需真实标签。③ <strong>稳定性评估</strong>——无标签时可用<strong>聚类稳定性</strong>(不同子采样/种子下结果的一致性,用 ARI 度量)作为质量代理;稳定的聚类更可信。④ <strong>业务有用性</strong>——最终应评估聚类是否<strong>可执行</strong>(每簇是否有清晰的业务画像、可采取不同策略)与<strong>可解释</strong>(簇内特征是否一致);纯统计指标无法捕捉这些。⑤ <strong>注意事项</strong>——不要用聚类指标反向调参以求'好看的分数'(这是聚类版的 p-hacking);应先用领域知识确定合理的簇数与结构,再用指标确认。
⚠️ Common Interview Pitfalls
- ✕用纯度比较不同簇数的聚类(偏向簇数多)
- ✕在非凸簇上用轮廓系数判断质量
🎯 Interviewer Follow-ups
- ?ARI 为什么优于纯度?
- ?如何评估'业务有用性'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.