RLHF (Reinforcement Learning from Human Feedback, 人类反馈强化学习) 是把 LLM 对齐到人类偏好的三阶段流水线:① SFT 指令微调,学响应格式与任务分布;② 奖励模型 (RM) 训练,用人工标注的偏好对比对优化 Bradley-Terry 模型
P(yw≻yl∣x)=σ(r(x,yw)−r(x,yl)),注意 RM 建模的是相对偏好而非绝对分数;③ PPO 强化学习,以带 KL 惩罚的奖励
r=rϕ(x,y)−βlog(πθ(y∣x)/πref(y∣x)) 优化策略。