M5-030M5: NLP & Large Language ModelsAlignment & RLHFEasy
Mastery:
Alignment & RLHF: 描述 RLHF 的三阶段流程。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: ① SFT 得到初始策略;② 用人类偏好比较训练奖励模型;③ 用 PPO 在奖励模型上优化策略(带 KL 约束)。
📌 Key Takeaways
- •阶段一:SFT(监督微调)建立'会说人话'的起点
- •阶段二:奖励建模(用偏好对训练打分器)
- •阶段三:PPO 优化(带 KL 约束防偏离)
📐 Mathematical Derivations
数学机理:<strong>三阶段流程(InstructGPT 范式)</strong>。<strong>阶段一:SFT(Supervised Fine-Tuning)</strong>——用(指令,示范回答)对做监督微调,得到一个'能遵循指令、会说人话'的初始策略 π_SFT。<strong>为什么必要</strong>——(a) 纯预训练模型只会'续写',无法生成有意义的回答,故 PPO 的采样质量太差、无法启动;(b) SFT 提供了'回答的格式与基本行为',为 RL 提供了合理的起点。<strong>阶段二:奖励建模(Reward Modeling)</strong>——让人类对同一 prompt 的<strong>多个回答</strong>做<strong>偏好比较</strong>(哪个更好),得到偏好对 (x, y_w, y_l);用 <strong>Bradley-Terry 模型</strong>假设'更好的回答有更高的潜在分数',训练奖励模型 r_φ 使 L=−log σ(r_φ(x,y_w)−r_φ(x,y_l)) 最小化。<strong>为什么用比较而非打分</strong>——人类做'哪个更好'比'打绝对分数'更一致、更可靠(绝对分数在不同人之间不可比)。<strong>阶段三:PPO 强化学习</strong>——用奖励模型作为环境奖励,用 PPO 优化策略 π_θ:max_θ E_{x,y∼π_θ}[r_φ(x,y)] − β·KL(π_θ‖π_ref),其中 <strong>KL 项</strong>约束策略不偏离参考模型(π_ref,通常是 SFT 模型)太远。<strong>为什么需要 KL 约束</strong>——(a) 防止<strong>奖励黑客</strong>(策略钻奖励模型的空子);(b) 防止<strong>灾难性遗忘</strong>与'语言退化'(过度优化会让输出变得不自然);(c) 保持输出多样性。<strong>结果</strong>——InstructGPT 显示 RLHF 后的模型(1.3B)在人类偏好上优于大 100 倍的 GPT-3(175B),说明对齐的杠杆作用巨大。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'为什么用比较而非打分'是核心设计</strong>——人类的绝对打分受主观尺度影响(不同人、不同时间的'7 分'含义不同);比较是<strong>相对判断</strong>,更一致、更可复现。这使偏好数据的质量显著高于打分数据。② <strong>KL 系数 β 的作用</strong>——β 越大越保守(贴近参考模型,但可能学不到新行为);β 越小越激进(可能奖励黑客、语言退化)。实践中 β 常取 0.01~0.1,且可动态调整(当 KL 过大时增大 β)。③ <strong>三阶段的必要性</strong>——(a) 无 SFT:PPO 无法启动(采样质量差);(b) 无 RM:无法把人类偏好转为可优化的标量奖励;(c) 无 PPO:只能模仿(无法超越演示质量)。三者缺一不可。④ <strong>成本结构</strong>——三阶段中<strong>阶段二(人工偏好标注)最贵</strong>(需大量人工比较);这也是 DPO/RLAIF 等'减少人工'方法出现的动机。⑤ <strong>与 DPO 的关系</strong>——DPO 把阶段二与三<strong>合并</strong>(直接用偏好对优化策略,无需显式奖励模型与 RL);代价是失去'在线采样'与'迭代改进'的能力(见 DPO 题)。⑥ <strong>面试要点</strong>——被问'RLHF 流程',应给出'<strong>SFT → RM → PPO(带 KL)</strong>'三阶段与<strong>每阶段为什么必要</strong>,并解释'为什么用比较而非打分'与'KL 的双重作用';这是 RLHF 类问题的基本盘。
⚠️ Common Interview Pitfalls
- ✕跳过 SFT 直接做 PPO(采样质量差无法启动)
- ✕去掉 KL 约束(导致奖励黑客与语言退化)
🎯 Interviewer Follow-ups
- ?为什么需要 SFT 作为起点?
- ?RLHF 的三阶段能否合并?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.