M5-030M5: NLP & Large Language ModelsAlignment & RLHFEasy
Mastery:

Alignment & RLHF: 描述 RLHF 的三阶段流程。

📐 Mathematical Definition
SFT→RM: L=−log⁡σ(rϕ(x,yw)−rϕ(x,yl))→PPO: max⁡E[rϕ]−βKL(π∥πref)\text{SFT}\to\text{RM}:\ \mathcal{L}=-\log\sigma(r_\phi(x,y_w)-r_\phi(x,y_l))\to\text{PPO}:\ \max\mathbb{E}[r_\phi]-\beta\mathrm{KL}(\pi\|\pi_{\text{ref}})
⚡ Executive Summary
Core Concept: ① SFT 得到初始策略;② 用人类偏好比较训练奖励模型;③ 用 PPO 在奖励模型上优化策略(带 KL 约束)。

📌 Key Takeaways

  • •
    阶段一:SFT(监督微调)建立'会说人话'的起点
  • •
    阶段二:奖励建模(用偏好对训练打分器)
  • •
    阶段三:PPO 优化(带 KL 约束防偏离)

📐 Mathematical Derivations

数学机理:<strong>三阶段流程(InstructGPT 范式)</strong>。<strong>阶段一:SFT(Supervised Fine-Tuning)</strong>——用(指令,示范回答)对做监督微调,得到一个'能遵循指令、会说人话'的初始策略 π_SFT。<strong>为什么必要</strong>——(a) 纯预训练模型只会'续写',无法生成有意义的回答,故 PPO 的采样质量太差、无法启动;(b) SFT 提供了'回答的格式与基本行为',为 RL 提供了合理的起点。<strong>阶段二:奖励建模(Reward Modeling)</strong>——让人类对同一 prompt 的<strong>多个回答</strong>做<strong>偏好比较</strong>(哪个更好),得到偏好对 (x, y_w, y_l);用 <strong>Bradley-Terry 模型</strong>假设'更好的回答有更高的潜在分数',训练奖励模型 r_φ 使 L=−log σ(r_φ(x,y_w)−r_φ(x,y_l)) 最小化。<strong>为什么用比较而非打分</strong>——人类做'哪个更好'比'打绝对分数'更一致、更可靠(绝对分数在不同人之间不可比)。<strong>阶段三:PPO 强化学习</strong>——用奖励模型作为环境奖励,用 PPO 优化策略 π_θ:max_θ E_{x,y∼π_θ}[r_φ(x,y)] − β·KL(π_θ‖π_ref),其中 <strong>KL 项</strong>约束策略不偏离参考模型(π_ref,通常是 SFT 模型)太远。<strong>为什么需要 KL 约束</strong>——(a) 防止<strong>奖励黑客</strong>(策略钻奖励模型的空子);(b) 防止<strong>灾难性遗忘</strong>与'语言退化'(过度优化会让输出变得不自然);(c) 保持输出多样性。<strong>结果</strong>——InstructGPT 显示 RLHF 后的模型(1.3B)在人类偏好上优于大 100 倍的 GPT-3(175B),说明对齐的杠杆作用巨大。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'为什么用比较而非打分'是核心设计</strong>——人类的绝对打分受主观尺度影响(不同人、不同时间的'7 分'含义不同);比较是<strong>相对判断</strong>,更一致、更可复现。这使偏好数据的质量显著高于打分数据。② <strong>KL 系数 β 的作用</strong>——β 越大越保守(贴近参考模型,但可能学不到新行为);β 越小越激进(可能奖励黑客、语言退化)。实践中 β 常取 0.01~0.1,且可动态调整(当 KL 过大时增大 β)。③ <strong>三阶段的必要性</strong>——(a) 无 SFT:PPO 无法启动(采样质量差);(b) 无 RM:无法把人类偏好转为可优化的标量奖励;(c) 无 PPO:只能模仿(无法超越演示质量)。三者缺一不可。④ <strong>成本结构</strong>——三阶段中<strong>阶段二(人工偏好标注)最贵</strong>(需大量人工比较);这也是 DPO/RLAIF 等'减少人工'方法出现的动机。⑤ <strong>与 DPO 的关系</strong>——DPO 把阶段二与三<strong>合并</strong>(直接用偏好对优化策略,无需显式奖励模型与 RL);代价是失去'在线采样'与'迭代改进'的能力(见 DPO 题)。⑥ <strong>面试要点</strong>——被问'RLHF 流程',应给出'<strong>SFT → RM → PPO(带 KL)</strong>'三阶段与<strong>每阶段为什么必要</strong>,并解释'为什么用比较而非打分'与'KL 的双重作用';这是 RLHF 类问题的基本盘。
⚠️ Common Interview Pitfalls
  • ✕
    跳过 SFT 直接做 PPO(采样质量差无法启动)
  • ✕
    去掉 KL 约束(导致奖励黑客与语言退化)
🎯 Interviewer Follow-ups
  • ?
    为什么需要 SFT 作为起点?
  • ?
    RLHF 的三阶段能否合并?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-029: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 数据来源的选择与各自取舍(人工 / 强模型蒸馏 / 开源 / 合成+验证)。📋Back to BankNext →M5-031: Alignment & RLHF: 写出 Bradley-Terry 偏好模型与奖励模型损失。