返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-data-quality-cleaning-gates

数据质量四大威胁与清洗管线

Data Quality Threats & Clean Gates
🎯核心定义
工业级数据质量四大威胁与自动化清洗管线 (Data Quality Threats & Automated Cleaning Pipeline) 是机器学习工程师确保“垃圾进,垃圾出 (Garbage In, Garbage Out)”不污染下游模型的最前置防御系统;数据质量四大核心威胁:1) 漏标与标签噪声 (Missing & Noisy Labels: 误点击、爬虫异常流量、弱监督伪标签污染);2) 样本重复与分布偏移 (Duplicate Samples: 网络重试/采集重复导致验证集数据泄漏);3) 异常离群值 (Extreme Outliers: 传感器故障/恶意攻击产生的物理不可能数值);4) 特征穿越 (Data Leakage);清洗管线通过 MinHash/Embedding 余弦相似度去重、置信学习 (Confident Learning) 清除翻转标签、IQR / Isolation Forest 截断异常值,构建高质鲁棒数据集。
💡使用场景
生产级 ML 特征管道接入、大数据清洗作业、大模型预训练语料清洗与数据去毒。
解决的核心痛点
真实业务数据中存在高达 5%~15% 的脏数据与噪声标签,直接训练会导致模型学习到虚假相关性并损害线上效果;数据质量闸门在特征进入训练池前拦截 99% 的异常脏数据。
🎯5 个高频面试考点 (Exam Points)
1
置信学习 (Confident Learning: Cleanlab 核心算法) 如何通过预测概率矩阵与计数矩阵估计联合概率分布 P(y~,y)P(\tilde{y}, y^*) 并自动识别噪声标签?
2
基于 MinHash 与局部敏感哈希 (LSH) 的海量文本/样本去重算法原理与 Jaccard 相似度快速近似?
3
异常值处理策略:四分位距 (IQR / Tukey's Fences: [Q11.5IQR,Q3+1.5IQR][Q_1 - 1.5\text{IQR}, Q_3 + 1.5\text{IQR}]) 与缩尾处理 (Winsorization) 的优劣对比?
4
爬虫与异常机器人流量识别:如何结合 User-Agent 熵、点击间隔方差与 IP 请求频次过滤虚假正负样本?
5
自动化数据校验工具(如 Great Expectations, Deequ)在 CI/CD 管道中定义数据断言 (Expectation Suites) 的工程实践?
更新于 2026-08-14
🎯
检验攻克程度:针对「数据质量四大威胁与清洗管线」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点手写逻辑回归梯度下降与 L2下一个知识点缺失值填充策略对比与 MICE

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则模型集成 Stacking 与 Blending