返回 MLE 工程师 思维导图
中文·English
💻 MLE 工程师ID: mle-missing-value-imputation

缺失值填充策略对比与 MICE

Missing Value Imputation & MICE
🎯核心定义
缺失值填充策略与多重链式方程插补 (Missing Value Imputation Strategies & MICE Framework) 是机器学习特征工程中对数据缺失机制进行科学分类与数学插补的决策体系;首先必须判定数据缺失的三大统计机制:1) MCAR (完全随机缺失: 缺失与自身及其他变量均无关);2) MAR (随机缺失: 缺失依赖于其他可观测变量);3) MNAR (非随机缺失: 缺失依赖于未观测变量或变量自身取值,需显式引入 Missing Indicator 哑变量指示特征);填充算法演进:简单单变量填充(均值、中位数、众数、固定常数如 -999) \to 算法原生处理(XGBoost/LightGBM 将缺失值自动归入默认分裂方向) \to 多重链式方程插补 (MICE / Iterative Imputer: 将各特征交替作为目标变量,用其他特征拟合回归/分类器迭代预测缺失值)。
💡使用场景
金融风控征信缺失数据填充、医疗临床指标补全、高维表格特征工程。
解决的核心痛点
粗暴丢弃含有缺失值的样本会导致 50%+ 宝贵训练数据丢失;简单填充常数会扭曲特征原始概率分布与协方差结构;MICE 多重插补完美保留了多变量之间的非线性关联与不确定性。
🎯5 个高频面试考点 (Exam Points)
1
详细对比 MCAR、MAR 与 MNAR 三种缺失机制,为什么在 MNAR 场景下添加“缺失指示变量 (Missing Indicator Feature)”是关键提分技巧?
2
多重链式方程插补 (MICE / Iterative Imputer) 的多轮迭代收敛算法步骤与如何处理多变量混合类型(连续 vs 类别)?
3
LightGBM / XGBoost 在树分裂时如何自动寻找缺失值的最优默认分支 (Default Split Direction)?
4
时序数据缺失值填充:为什么严禁使用全局均值或后向填充 (Backward Fill),而必须使用前向填充 (Forward Fill / LOCF) 或时序插值以防止穿越?
5
在生产环境部署时,训练集拟合的插补器对象 (Imputer Fitted on Train) 如何无缝保存为 Pipeline 并在在线 Serving 时直接复用?
🔗核心前置底层技术卡片 (点击穿透复习)
更新于 2026-08-14
🎯
检验攻克程度:针对「缺失值填充策略对比与 MICE」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点数据质量四大威胁与清洗管线下一个知识点OOF 目标编码与防目标穿越机制

🔗 更多 MLE 工程师 知识点卡片

偏差-方差权衡与过拟合诊断常见损失函数选型与梯度特性优化器收敛性与动量选型准则模型集成 Stacking 与 Blending