返回 大语言模型 思维导图
中文·English
大语言模型ID: rlhf-pipeline

RLHF 三阶段

RLHF 3-Stage Pipeline
🎯核心定义
RLHF (Reinforcement Learning from Human Feedback, 人类反馈强化学习) 是把 LLM 对齐到人类偏好的三阶段流水线:① SFT 指令微调,学响应格式与任务分布;② 奖励模型 (RM) 训练,用人工标注的偏好对比对优化 Bradley-Terry 模型P(ywylx)=σ(r(x,yw)r(x,yl))P(y_w \succ y_l | x) = \sigma(r(x, y_w) - r(x, y_l)),注意 RM 建模的是相对偏好而非绝对分数;③ PPO 强化学习,以带 KL 惩罚的奖励 r=rϕ(x,y)βlog(πθ(yx)/πref(yx))r = r_\phi(x,y) - \beta \log(\pi_\theta(y|x)/\pi_{\text{ref}}(y|x)) 优化策略。
💡使用场景
大模型训练的最后一步,把预训练 + SFT 模型对齐到人类价值观(有帮助性、无害性、诚实性);InstructGPT 开创、ChatGPT 沿用的标准对齐范式,也常用于对齐到企业风格与安全准则。
解决的核心痛点
仅靠 SFT 无法表达偏好方向(两种回答谁更好)且易过拟合;RLHF 用显式的奖励信号驱动策略在线探索与优化,使模型在开放生成任务上稳定贴近人类偏好。
🎯5 个高频面试考点 (Exam Points)
1
RLHF 三阶段的完整流程是什么?每一阶段的输入、输出与训练目标?
2
奖励模型如何训练?Bradley-Terry 模型的损失函数与训练数据格式?
3
PPO 阶段为什么需要 KL 惩罚项 βlog(πθ/πref)?不惩罚会怎样?
4
奖励模型为什么建模偏好而非绝对分数?奖励黑客 (Reward Hacking) 是什么?
5
RLHF 与 DPO 的对比:流程、成本、稳定性各有什么差异?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-12
🎯
检验攻克程度:针对「RLHF 三阶段」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点软提示 P-Tuning/Adapter下一个知识点PPO 截断损失

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA