返回 大语言模型 思维导图
中文·English
大语言模型ID: pretrain-training-details

训练目标与优化器细节

Pre-Training Objectives & Optimizer Details
🎯核心定义
预训练目标主流是 Next-Token Prediction(自回归交叉熵 L=logP(xtx<t)L = -\sum \log P(x_t | x_{<t}));代码模型常用 FIM(Fill-in-the-Middle)目标: 把文档拆成 prefix/suffix/middle 三段, 按约 50% 概率用'前后文预测中间'训练, 让模型利用双向上下文。优化器标配 AdamW(β₁=0.9、β₂=0.95、weight decay=0.1), 配合梯度裁剪(global norm 1.0)与 warmup + 余弦学习率;训练中遇 Loss Spike(损失尖峰)时回退到 spike 前的 checkpoint 重新训练。
💡使用场景
预训练与继续预训练、代码大模型训练、训练不收敛/爆梯度排查。
解决的核心痛点
纯 Next-Token 无法利用右侧上下文, 代码补全质量受限——FIM 让模型同时看左右两侧, 代码续写能力显著提升;β₂=0.95 比标准 0.999 对梯度方差估计衰减更快、更适合大模型, wd=0.1 的强权重衰减抑制过拟合;梯度裁剪 1.0 防止单步梯度爆炸; Loss spike 一次可毁掉数小时训练, 回退策略把事故成本从'整段重来'降到'重跑 spike 前最后一段'的分钟级开销。
🎯5 个高频面试考点 (Exam Points)
1
Next-Token 与 FIM 目标的区别? FIM 样本如何构造?
2
AdamW 为什么 β₂=0.95、wd=0.1? 与标准 Adam 的差异?
3
梯度裁剪的作用与实现(global norm vs per-parameter)?
4
Loss Spike 的成因与回退策略如何执行?
5
学习率调度(warmup + cosine)如何设计?
📖 关联深度指南:📄 llm-foundations-and-sota
更新于 2026-08-12
🎯
检验攻克程度:针对「训练目标与优化器细节」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点预训练数据工程下一个知识点分词 BPE/WordPiece

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA