M5-035M5: NLP & Large Language ModelsAlignment & RLHFHard
Mastery:
Alignment & RLHF: 解释 RLHF 的工程难点与稳定性问题。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 需同时维护 4 个模型(显存大);训练不稳定(奖励崩塌、KL 爆炸、长度漂移);超参敏感且难调。
📌 Key Takeaways
- •四个模型同时驻留(Actor/Critic/RM/Reference)→ 显存大
- •不稳定:奖励崩塌、KL 爆炸、长度漂移、梯度尖峰
- •超参敏感:KL 系数、lr、clip、GAE λ 都需精细调
📐 Mathematical Derivations
数学机理:<strong>工程难点</strong>。<strong>(1) 显存与计算</strong>——PPO 需同时维护<strong>四个模型</strong>:(a) <strong>Actor</strong>(被训练的策略,含优化器状态);(b) <strong>Critic</strong>(价值网络,含优化器状态);(c) <strong>Reward Model</strong>(冻结,用于打分);(d) <strong>Reference Model</strong>(冻结,用于算 KL)。这使显存需求约为 SFT 的 2~3 倍(Actor+Critic 需优化器状态,RM+Ref 只需推理);且每步需 (i) 用 Actor 采样生成、(ii) 用 RM 打分、(iii) 用 Ref 算 KL、(iv) 用 Critic 算优势、(v) 更新 Actor 与 Critic——计算流程复杂、难以并行优化。<strong>(2) 训练不稳定</strong>——(a) <strong>奖励崩塌</strong>:策略找到钻空子的方式,奖励虚高但质量下降;(b) <strong>KL 爆炸</strong>:策略偏离参考模型太远,输出变得不自然(语言退化);(c) <strong>长度漂移</strong>:输出长度单调增长(冗长化);(d) <strong>梯度尖峰与 NaN</strong>:RL 的梯度方差大(尤其用 MC 估计时);(e) <strong>Critic 不收敛</strong>:价值网络难以准确拟合(状态空间巨大)。<strong>(3) 超参敏感</strong>——(a) KL 系数 β(太小则黑客、太大则学不到);(b) Actor/Critic 的学习率(需分别调);(c) clip ε;(d) GAE 的 λ 与 γ;(e) batch 与采样数;(f) 奖励的归一化方式。这些超参相互影响,调参成本高。<strong>(4) 采样效率</strong>——on-policy 采样需实时生成(自回归、慢),且生成的数据只能用一次(PPO 虽可多次更新但受 clip 限制);故 RLHF 的<strong>吞吐远低于 SFT</strong>。<strong>缓解</strong>——(a) 用 <strong>LoRA</strong> 只训 Actor(省显存);(b) 用 <strong>GRPO 去掉 Critic</strong>(省一个模型);(c) 用 <strong>DPO 替代 PPO</strong>(完全不需要 RL 循环);(d) 奖励归一化 + KL 动态调整;(e) 用 vLLM 加速采样(分离推理与训练);(f) 混合精度 + 梯度检查点。<strong>监控指标</strong>——奖励分数、KL 散度、输出长度、熵(多样性)、Critic 的损失与解释方差(explained variance)、clip 比例、梯度范数。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'四个模型'是 PPO 的固有负担</strong>——这也是 GRPO(去 Critic)与 DPO(去 RL 循环)流行的直接原因;工程简化往往比算法优雅更重要。② <strong>'奖励与 KL 的平衡'是训练的核心张力</strong>——奖励驱动'改进'、KL 约束'不离谱';两者失衡就出现两种失败模式(黑客 vs 学不动)。实践中常用<strong>自适应 KL</strong>(KL 超阈值则增大 β)。③ <strong>'长度漂移'的诊断价值</strong>——输出长度是最易监控的指标;若长度持续增长而质量未提升,说明奖励模型学到了'长=好'(数据侧问题)。④ <strong>采样与训练的分离</strong>——现代实现常把'生成(inference engine,如 vLLM)'与'训练(trainer)'<strong>分离部署</strong>(用权重同步),以提升采样吞吐;这是 RLHF 工程的重要演进(也带来权重同步的复杂度)。⑤ <strong>与 DPO 的对比</strong>——DPO 不需要 RL 循环、不需要 Critic 与 RM(只需参考模型),训练稳定如 SFT;代价是失去在线探索能力。故实践中'先试 DPO,不够再上 PPO/GRPO'是常见路径。⑥ <strong>面试要点</strong>——被问'RLHF 难在哪',应给出'<strong>四模型显存 + 训练不稳定(奖励崩塌/KL 爆炸/长度漂移/梯度尖峰)+ 超参敏感 + 采样慢</strong>',并列出'LoRA/GRPO/DPO/自适应 KL/分离采样'等缓解手段与监控指标;这是'有实战经验'的高分回答。
⚠️ Common Interview Pitfalls
- ✕忽略 Critic 与 Reference 的显存开销
- ✕不监控 KL 与长度(无法及早发现退化)
🎯 Interviewer Follow-ups
- ?为什么 RLHF 比 SFT 难训?
- ?如何监控 RLHF 训练健康?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.