M5-031M5: NLP & Large Language ModelsAlignment & RLHFEasy
Mastery:

Alignment & RLHF: 写出 Bradley-Terry 偏好模型与奖励模型损失。

📐 Mathematical Definition
P(yw≻yl∣x)=σ ⁣(r(x,yw)−r(x,yl));LRM=−E[log⁡σ ⁣(rϕ(x,yw)−rϕ(x,yl))]P(y_w\succ y_l\mid x)=\sigma\!\left(r(x,y_w)-r(x,y_l)\right);\qquad \mathcal{L}_{\text{RM}}=-\mathbb{E}\left[\log\sigma\!\left(r_\phi(x,y_w)-r_\phi(x,y_l)\right)\right]
⚡ Executive Summary
Core Concept: BT 模型假设 P(y_w≻y_l)=σ(r(y_w)−r(y_l));用该似然训练奖励模型,即 pairwiselogistic 损失。

📌 Key Takeaways

  • •
    BT 模型把'偏好概率'建模为奖励差的 sigmoid
  • •
    只依赖奖励之差,故奖励的绝对尺度不可辨识(需固定基准)
  • •
    等价于 pairwise logistic 损失(与排序损失同源)

📐 Mathematical Derivations

数学机理:<strong>Bradley-Terry(BT)模型</strong>源自成对比较的统计模型,假设'个体 i 胜过 j 的概率'由两者'强度'之差决定。在 RLHF 中,把'回答 y 的强度'设为奖励 r(x,y),则 P(y_w≻y_l|x)=σ(r(x,y_w)−r(x,y_l)),其中 σ 是 sigmoid。<strong>奖励模型损失</strong>——用偏好数据最大化该似然的等价形式(负对数似然):L_RM=−E[log σ(r_φ(x,y_w)−r_φ(x,y_l))]。<strong>关键性质</strong>:(a) <strong>只依赖奖励差</strong>——损失只含 r_w−r_l,故给所有奖励加上常数 c 不改变损失;这意味着奖励的<strong>绝对尺度不可辨识</strong>(只有相对排序有意义)。实践中通过<strong>归一化</strong>(如把奖励零均值化)或<strong>固定参考</strong>来处理。(b) <strong>等价于 pairwise logistic 排序损失</strong>——与学习排序(RankNet)的损失同构(见 M3 的排序损失题),说明'偏好学习'本质是'成对排序'。(c) <strong>传递性假设</strong>——BT 模型假设偏好满足传递性(若 A≻B、B≻C 则 A≻C);但人类偏好可能<strong>非传递</strong>(A≻B、B≻C、C≻A 的循环),这是 BT 的局限(后续有 Plackett-Luce 等多路比较模型、以及允许非传递的方法)。<strong>扩展到多路比较</strong>——若一次比较多于两个回答(如 K 个排序),可用 <strong>Plackett-Luce 模型</strong>(对排序的概率建模),信息效率更高。<strong>实现细节</strong>——(a) 奖励模型通常<strong>复用 SFT 模型 + 换掉输出头</strong>(把词表投影换成标量投影);(b) 输入是整个 (x, y) 序列,输出是最后一个 token 位置(或特殊 token)的标量;(c) 常加<strong>奖励归一化</strong>与<strong>长度偏差校正</strong>(否则模型倾向长回答)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'只依赖奖励差'的实践含义</strong>——因为绝对尺度不可辨识,奖励模型的输出'本身没有绝对意义'('奖励 5 分'不代表'好');故 (a) 常对奖励做<strong>标准化</strong>(减去均值、除以标准差)以便设 KL 系数;(b) 比较不同奖励模型时不能比绝对值。② <strong>长度偏差是经典问题</strong>——人类标注者倾向于认为'更长的回答更好'(即使内容相当),故奖励模型会学到'长 = 好';这导致 RLHF 后输出变长。缓解:(a) <strong>长度控制的偏好数据</strong>(让标注者忽略长度);(b) <strong>长度惩罚</strong>;(c) <strong>长度平衡的数据构造</strong>(同一问题的长短回答配对)。③ <strong>奖励模型的过优化(over-optimization)</strong>——训练越久、策略越能钻奖励模型的空子(因为奖励模型只是人类偏好的<strong>近似</strong>);表现为奖励分数持续上升但真实质量下降。这是 RLHF 的核心难题(见后续题)。④ <strong>多路比较的效率</strong>——K 路排序比 pairwise 提供更多信息(K 个回答可产生 C(K,2) 个偏好对);但标注成本更高、且标注者一致性可能下降。⑤ <strong>与 DPO 的关系</strong>——DPO 的推导<strong>从 BT 模型出发</strong>,把奖励用策略表示后消去,得到直接优化策略的损失;故理解 BT 是理解 DPO 的前提。⑥ <strong>面试要点</strong>——被问'奖励模型怎么训',应写出 <strong>BT 模型 + pairwise logistic 损失</strong>,并指出'<strong>只依赖奖励差 → 绝对尺度不可辨识</strong>'与'<strong>长度偏差</strong>'这两个实践要点;能提到'BT 的传递性假设局限'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为奖励模型的绝对值有意义(只有相对排序可辨识)
  • ✕
    忽略长度偏差导致的'越训越长'
🎯 Interviewer Follow-ups
  • ?
    为什么奖励的绝对值不可辨识?
  • ?
    BT 模型的假设有什么局限?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-030: Alignment & RLHF: 描述 RLHF 的三阶段流程。📋Back to BankNext →M5-032: Alignment & RLHF: 写出 PPO 的裁剪目标,并解释 min 与 clip 的作用。