返回 大语言模型 思维导图
中文·English
大语言模型ID: sft-basics

指令微调 SFT

Supervised Fine-Tuning (SFT)
🎯核心定义
SFT(Supervised Fine-Tuning, 指令微调)用高质量'指令-回答'监督数据微调预训练模型, 把底座从'续写文本'变成'遵循指令'。机制: 目标函数仍是交叉熵 L=logP(yx)L = -\sum \log P(y|x), 但数据换成指令对; 一般只训练 1-3 个 epoch、学习率 1e-5 量级(远低于预训练), 数据按全局 batch 拼接。核心经验是'数据质量 > 数量': Alpaca 仅用 52K 条 GPT 生成指令数据即复现 ChatGPT 级指令遵循。
💡使用场景
让通用模型具备对话/指令能力、领域化(医疗/法律/金融)微调、作为 RLHF 的初始策略。
解决的核心痛点
预训练模型只会续写、不遵循指令。SFT 用几千到几万条高质量数据完成行为对齐, 效果远好于盲目堆量——epoch 超过 3 个会过拟合指令数据、损害通用能力(灾难性遗忘);相比预训练 1.4T tokens, SFT 数据量低约 7 个数量级(52K vs 1.4T), 训练成本骤降, 同时为 RLHF 提供良好初始策略。
🎯5 个高频面试考点 (Exam Points)
1
SFT 与预训练的区别(数据、目标、epoch)?
2
为什么 SFT 数据质量 > 数量?
3
SFT 会过拟合吗? epoch 与学习率怎么选?
4
SFT 与 RLHF/DPO 的关系?
5
指令数据如何构造与过滤(人工/LLM 生成)?
更新于 2026-08-12
🎯
检验攻克程度:针对「指令微调 SFT」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点FlashAttention下一个知识点LoRA/QLoRA 低秩适配

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA