M4-010M4: Sequences & TransformersSeq2Seq & Attention OriginsMedium
Mastery:
Seq2Seq & Attention Origins: 解释 teacher forcing 与 exposure bias。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: teacher forcing 训练时用真实前缀,推理时用模型自己的输出;训练-推理输入分布不一致导致误差累积(exposure bias)。
📌 Key Takeaways
- •训练用真值前缀,推理用自生成前缀(分布不同)
- •一步错误会改变后续输入分布,导致误差累积
- •缓解:scheduled sampling、序列级训练、RL/最小风险训练
📐 Mathematical Derivations
数学机理:<strong>teacher forcing</strong> 是自回归模型的标准训练方式:第 t 步的输入是<strong>真实</strong>的前缀 y*_{<t}(来自训练数据),而非模型自己的预测;这使得每一步的训练信号都是'干净'的、且所有时间步可并行计算(因为输入不依赖模型输出)。<strong>exposure bias(暴露偏差)</strong> 指训练与推理的<strong>输入分布不一致</strong>:训练时模型只见过'正确前缀',推理时(第 t 步)输入是<strong>模型自己生成的</strong> ŷ_{<t},一旦某步生成错误,后续步骤的输入就落入了训练时<strong>从未见过</strong>的分布区域——模型在这个分布外区域的预测质量无保证,可能继续出错,形成<strong>误差累积</strong>(error accumulation)。形式上,训练优化的是 Σ_t log p(y*_t|y*_{<t}),而推理时的目标是 Σ_t log p(ŷ_t|ŷ_{<t}),两者条件分布不同。<strong>序列长度的影响</strong>——误差累积的概率随长度增长(每步有 ε 的概率偏离,T 步后偏离概率约 1−(1−ε)^T),故长序列上 exposure bias 更严重。<strong>缓解手段</strong>:(a) <strong>scheduled sampling</strong>(Bengio 等 2015)——训练时以概率 p 用模型自己的输出替代真值,p 随训练从 0 退火到某上界;(b) <strong>序列级训练</strong>(最小风险训练 MRT、BLEU 作为目标);(c) <strong>强化学习</strong>(用序列级奖励做 policy gradient,如 SCST);(d) <strong>RLHF/DPO</strong>(用偏好数据直接优化生成质量)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>为什么不能完全用自回归训练</strong>——若一开始就用模型自己的输出,早期模型输出质量极差、梯度信号混乱,训练无法启动;故需要'从 teacher forcing 逐步过渡'(scheduled sampling 的退火)或'两阶段'(先 teacher forcing 预训练、再序列级微调)。② <strong>scheduled sampling 的副作用</strong>——它引入了训练/推理的另一种不一致(随机混合),且梯度估计有偏(每步依赖采样);实践中效果不稳定,故更常用'两阶段 + 序列级微调'。③ <strong>现代 LLM 的立场</strong>——LLM 的预训练与 SFT <strong>几乎全用 teacher forcing</strong>(因为规模足够大、数据足够多样,模型对'自己生成的分布'也见得多);exposure bias 主要通过 (a) 海量数据、(b) RLHF/DPO 的偏好对齐、(c) 推理时的解码策略(beam search、温度)缓解。这说明'exposure bias 的重要性随数据规模下降'。④ <strong>与 teacher forcing 并行的效率优势</strong>——teacher forcing 使所有时间步可并行(输入已知),这是 Transformer 训练高效的前提;纯自回归训练(每步依赖上一步输出)无法并行。⑤ <strong>与'off-policy/on-policy'的类比</strong>——teacher forcing 相当于 <strong>off-policy</strong>(用行为策略的数据),自回归推理是 <strong>on-policy</strong>(用自身策略);RLHF 的核心正是'在 on-policy 数据上优化'。⑥ <strong>面试要点</strong>——被问'exposure bias',应给出'<strong>训练用真值前缀、推理用自生成前缀 → 分布不一致 → 误差累积</strong>'的因果链,并说明'长序列更严重'与'三阶段缓解方案';能类比 off-policy/on-policy 是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 teacher forcing 的并行性是免费的(代价是暴露偏差)
- ✕把 exposure bias 与'过拟合'混为一谈
🎯 Interviewer Follow-ups
- ?为什么 exposure bias 在长序列上更严重?
- ?scheduled sampling 的退火策略怎么设计?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.