预训练目标主流是 Next-Token Prediction(自回归交叉熵
L=−∑logP(xt∣x<t));代码模型常用 FIM(Fill-in-the-Middle)目标: 把文档拆成 prefix/suffix/middle 三段, 按约 50% 概率用'前后文预测中间'训练, 让模型利用双向上下文。优化器标配 AdamW(β₁=0.9、β₂=0.95、weight decay=0.1), 配合梯度裁剪(global norm 1.0)与 warmup + 余弦学习率;训练中遇 Loss Spike(损失尖峰)时回退到 spike 前的 checkpoint 重新训练。