M5-025M5: NLP & Large Language ModelsInstruction Tuning & Supervised Fine-TuningHard
Mastery:

Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 与 RLHF/DPO 的分工。

📐 Mathematical Definition
SFT: max⁡log⁡p(y∣x);RLHF/DPO: max⁡ E[r(x,y)] s.t. KL(π∥πref)≤δ\text{SFT}:\ \max\log p(y|x);\qquad \text{RLHF/DPO}:\ \max\ \mathbb{E}[r(x,y)]\ \text{s.t.}\ \text{KL}(\pi\|\pi_{\text{ref}})\le\delta
⚡ Executive Summary
Core Concept: SFT 用演示教'格式与基本行为'(模仿);RLHF/DPO 用偏好教'质量与取舍'(优化),后者需前者提供起点。

📌 Key Takeaways

  • •
    SFT:模仿演示(教'怎么说'),受演示质量上限约束
  • •
    RLHF/DPO:优化偏好(教'说得多好'),可超越演示
  • •
    顺序:预训练 → SFT → 偏好优化

📐 Mathematical Derivations

数学机理:<strong>两者的目标函数不同</strong>。<strong>SFT</strong> 最大化<strong>演示数据的似然</strong>(模仿学习):L=−Σ log p(y|x);它学到的是'人类示范的样子',故其<strong>上限是演示数据的质量</strong>(若演示都不好,学不出更好)。<strong>RLHF/DPO</strong> 优化<strong>偏好</strong>(而非模仿):给定(更好 y_w,更差 y_l)的偏好对,RLHF 用奖励模型 + PPO 最大化期望奖励(带 KL 约束),DPO 直接用偏好对做对比损失。<strong>关键差异</strong>:(a) <strong>信号类型</strong>——SFT 是'应该这样写'(正例),偏好优化是'这样比那样好'(<strong>相对</strong>比较);(b) <strong>信息效率</strong>——偏好比较<strong>更容易获得</strong>(人类比较两个回答比'写出完美回答'容易得多),且<strong>可表达 SFT 无法表达的'取舍'</strong>(如'更简洁但略不完整'vs'更完整但冗长');(c) <strong>上限</strong>——SFT 受演示质量限制,偏好优化<strong>可以超越演示</strong>(因为只需'判断哪个更好',不需'演示最好');(d) <strong>行为</strong>——SFT 教<strong>格式与基本能力</strong>,偏好优化教<strong>质量、风格、安全、诚实</strong>(如'承认不知道')。<strong>分工与顺序</strong>——(a) <strong>SFT 先行</strong>(教模型'会说人话'、能遵循指令),否则 RLHF 的起点太差(策略无法生成有意义的回答);(b) <strong>偏好优化在后</strong>(提升质量与对齐);(c) 两者可<strong>迭代</strong>(SFT → DPO → 用新模型生成偏好数据 → 再 DPO,即 iterative/online DPO)。<strong>能否跳过 SFT</strong>——若基座模型已具备指令遵循能力(如经过指令预训练的模型),可直接做 DPO;但对纯预训练模型,直接 DPO 效果差(起点太弱)。<strong>实证</strong>——Tulu、Zephyr 等显示'SFT + DPO'在同等数据下优于'SFT only'与'RLHF'(成本更低、效果接近)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'偏好比演示更容易获得'是核心经济性</strong>——写出'完美回答'需要专家(贵);而'比较两个回答哪个好'可由普通标注者或 AI 完成(便宜、快)。故偏好数据的<strong>规模</strong>通常远大于演示数据。② <strong>'可超越演示'的机制</strong>——偏好优化在<strong>回答空间</strong>上做搜索(通过策略采样 + 奖励/偏好信号),故可发现'比任何演示都好的回答';这是 SFT 做不到的(SFT 只能在演示分布的支撑集内插值)。③ <strong>KL 约束的双重作用</strong>——RLHF/DPO 中的 KL 约束(或 DPO 的隐式参考模型)同时 (a) <strong>防奖励黑客</strong>(不让策略偏离太远以钻奖励空子)、(b) <strong>防灾难性遗忘</strong>(保持原能力)。④ <strong>'SFT 阶段该多强'的权衡</strong>——SFT 过强(多 epoch、高 lr)会导致遗忘与僵化,且可能'锁死'在演示分布(不利于后续偏好优化探索);故实践中 SFT 常'适度'(1~3 epoch),把质量提升留给偏好优化。⑤ <strong>与'拒绝采样微调(RFT)'的关系</strong>——RFT 用模型自己生成、筛选正确的做 SFT;它是'SFT 与 RL 的中间形态'(用自生成数据扩大演示集),常用于推理模型。⑥ <strong>面试要点</strong>——被问'SFT 和 RLHF 的分工',应给出'<strong>目标函数(模仿 vs 优化偏好)+ 信号(正例 vs 相对比较)+ 上限(受演示限制 vs 可超越演示)+ 顺序(SFT 先、偏好优化后)</strong>',并说明'偏好数据更易获得'与'KL 约束的双重作用';能指出'SFT 过强不利于后续探索'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    认为 SFT 数据够好就无需偏好优化
  • ✕
    跳过 SFT 直接对纯预训练模型做 DPO
🎯 Interviewer Follow-ups
  • ?
    为什么 SFT 不能超越演示质量?
  • ?
    什么情况下可以跳过 SFT 直接 DPO?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-024: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 数据配比与多任务平衡。📋Back to BankNext →M5-026: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 的学习率与训练轮数的选择。