🎯核心定义
预训练数据工程是决定模型能力上限的数据管线: 清洗 → 去重 → 质量过滤 → 域配比 → 退火注入。机制上, 去重用 MinHash+LSH: MinHash 把文档哈希为约 128 位签名, LSH 将签名分成多个 band 分桶, 桶内碰撞即为候选重复对;质量过滤用预训练语言模型的 PPL(困惑度)打分筛掉低质量文本; 域配比按 Web:Code:Math 等比例混合;退火期(最后约 5% 的 token)注入高质量数据与合成数据, 如 Evol-Instruct 逐轮进化生成高难度指令。