目标编码(Target Encoding)用“该类别下目标均值”编码高基数类别特征(如 user_id、城市、商品 ID)。平滑公式:
TE=λ(ni)⋅mean(yi)+(1−λ(ni))⋅global_mean,其中置信度权重
λ(ni)=ni+mni——样本量
ni 越大越相信组内均值, 平滑参数
m 控制收缩强度, 防止小样本组的编码被噪声带偏。泄漏风险: 若直接对全量数据求组均值, 训练与验证特征都携带了目标信息(CV 分数虚高、线上崩溃), 这是 TE 最大的坑。解法: OOF (out-of-fold) 编码——对某样本用“不包含它的那一折之外”的数据算均值; CatBoost 更进一步用 Ordered Target Statistics——按时间/顺序只用该样本之前的历史样本计算统计量, 从机制上切断泄漏。