M5-007M5: NLP & Large Language ModelsPretraining Objectives & Data CurationEasy
Mastery:

Pretraining Objectives & Data Curation: 解释因果语言建模(CLM)与掩码语言建模(MLM)的差异。

📐 Mathematical Definition
CLM: L=−∑tlog⁡p(xt∣x<t);MLM: L=−∑i∈Mlog⁡p(xi∣x∖M)\text{CLM}:\ \mathcal{L}=-\sum_t\log p(x_t|x_{<t});\qquad \text{MLM}:\ \mathcal{L}=-\sum_{i\in\mathcal{M}}\log p(x_i|x_{\setminus\mathcal{M}})
⚡ Executive Summary
Core Concept: CLM 预测下一个 token(因果 mask,可生成);MLM 随机掩码预测被掩位置(双向,不能直接生成)。

📌 Key Takeaways

  • •
    CLM:因果注意力,每 token 一个监督信号,天然可生成
  • •
    MLM:双向注意力,只监督被掩位置(约 15%),不能直接生成
  • •
    CLM 是当前 LLM 主流;MLM 主要用于编码器/表示学习

📐 Mathematical Derivations

数学机理:<strong>CLM(Causal Language Modeling)</strong>——用因果(下三角)mask 的注意力,目标是最小化'预测下一个 token'的负对数似然:L=−Σ_t log p(x_t|x_{<t})。<strong>特点</strong>:(a) <strong>每个位置都是监督信号</strong>(N 个 token 提供 N 个预测任务),训练信号密集;(b) <strong>天然可生成</strong>(自回归采样与训练目标一致);(c) 只需单向上下文(与生成场景一致);(d) 可复用 KV cache 做增量推理。<strong>MLM(Masked Language Modeling,BERT)</strong>——随机把约 15% 的 token 替换为 <code>[MASK]</code>(其中 80% 替换、10% 随机替换、10% 保持,以缓解'预训练-微调不一致'),用<strong>双向注意力</strong>预测被掩位置的原始 token:L=−Σ_{i∈M} log p(x_i|x_{\setminus M})。<strong>特点</strong>:(a) <strong>双向上下文</strong>(每个位置可看左右),故表示更适合<strong>理解类任务</strong>(分类、NER、抽取);(b) <strong>训练信号稀疏</strong>(只监督 15% 的位置);(c) <strong>不能直接生成</strong>(因为训练时看到未来、且目标是'填空'而非'续写');(d) 存在 <strong>预训练-微调不一致</strong>(预训练有 <code>[MASK]</code>、下游任务没有)。<strong>关键差异总结</strong>——(a) <strong>注意力方向</strong>:CLM 因果、MLM 双向;(b) <strong>监督密度</strong>:CLM 100%、MLM 15%;(c) <strong>可用性</strong>:CLM 可生成、MLM 擅理解;(d) <strong>规模效应</strong>:CLM 随规模持续提升(且可统一所有任务为生成),MLM 的收益在规模化上不如 CLM——这是 Decoder-only + CLM 成为主流的原因。<strong>其他目标</strong>——(a) <strong>Prefix-LM</strong>(前缀双向 + 后缀因果);(b) <strong>Span corruption</strong>(T5:掩码连续片段并预测,兼顾两者);(c) <strong>FIM(Fill-in-the-Middle)</strong>(代码场景,把中间段移到末尾预测,使 CLM 具备'填空'能力);(d) <strong>去噪目标</strong>(BART)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'监督密度'的量化价值</strong>——CLM 每 token 都是监督,MLM 只有 15%;若以'每个 token 的监督次数'衡量,CLM 的数据效率(按此口径)更高。但 MLM 的双向性带来更强的表示质量——这是'效率 vs 表示质量'的权衡。② <strong>MLM 的 80/10/10 技巧</strong>——直接用 <code>[MASK]</code> 会让模型学到'只在看到 <code>[MASK]</code> 时预测',造成预训练-微调不一致;故 BERT 用 80% <code>[MASK]</code>、10% 随机词、10% 原词的混合。这是'缓解分布不匹配'的经典手法。③ <strong>CLM 的统一性优势</strong>——CLM 可把<strong>所有任务</strong>表达为'条件续写'(分类=续写标签、抽取=续写答案、翻译=续写译文),故一个模型可覆盖多任务,且 in-context learning 天然涌现。这是 Decoder-only 胜出的结构性原因。④ <strong>与长上下文的关系</strong>——CLM 的因果性使 KV cache 增量推理可行(生成第 t 个 token 只需新 token 的 Q 与历史的 K/V);MLM 的双向性则无法做增量生成。⑤ <strong>FIM 的工程价值</strong>——代码补全需要'在中间插入'(而非只在末尾续写);FIM 把'前缀 + 后缀 + 中间'重排为'前缀 + 后缀 → 中间',使 CLM 学会填空;这是'用重排让 CLM 支持新任务'的巧妙手法。⑥ <strong>面试要点</strong>——被问'CLM vs MLM',应给出'<strong>注意力方向 + 监督密度 + 是否可生成 + 规模效应</strong>'四维对比,并说明'CLM 因统一性与可生成性成为主流';能提到'FIM 让 CLM 支持填空'与'MLM 的 80/10/10'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为 MLM 也能直接用于生成
  • ✕
    忽略 MLM 的预训练-微调不一致问题
🎯 Interviewer Follow-ups
  • ?
    为什么 MLM 需要 mask token 而 CLM 不需要?
  • ?
    MLM 的训练信号密度如何?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-006: Tokenization (BPE / WordPiece / Unigram): 解释词表扩展(vocabulary expansion)的做法与注意点。📋Back to BankNext →M5-008: Pretraining Objectives & Data Curation: 解释数据质量与配比对预训练的影响。