M5-033M5: NLP & Large Language ModelsAlignment & RLHFMedium
Mastery:

Alignment & RLHF: 解释 GAE 与优势估计在 RLHF 中的作用。

📐 Mathematical Definition
A^tGAE(γ,λ)=∑l=0∞(γλ)lδt+l,δt=rt+γV(st+1)−V(st)\hat A_t^{\text{GAE}(\gamma,\lambda)}=\sum_{l=0}^{\infty}(\gamma\lambda)^l\delta_{t+l},\qquad \delta_t=r_t+\gamma V(s_{t+1})-V(s_t)
⚡ Executive Summary
Core Concept: GAE 用 TD 残差的指数加权和估计优势,平衡偏差与方差;优势函数决定'该动作比平均好多少'。

📌 Key Takeaways

  • •
    优势 A(s,a)=Q(s,a)−V(s):动作比平均好多少
  • •
    GAE 用 λ 在偏差与方差间折中(λ=0 → 纯 TD,λ=1 → 纯 MC)
  • •
    RLHF 中常把序列级奖励广播到 token(或用 token 级 KL)

📐 Mathematical Derivations

数学机理:<strong>优势函数</strong>——A(s,a)=Q(s,a)−V(s) 表示'在状态 s 采取动作 a 比按策略平均表现好多少';它是策略梯度中的关键量(策略梯度 ∝ ∇log π(a|s)·A)。用 A 而非回报 R 的理由:<strong>降低方差</strong>(减去基线 V(s) 不改变期望但减小方差)。<strong>GAE(Generalized Advantage Estimation,Schulman 等 2016)</strong>——用<strong>TD 残差 δ_t=r_t+γV(s_{t+1})−V(s_t) 的指数加权和</strong>估计优势:Â_t^GAE(γ,λ)=Σ_l (γλ)^l δ_{t+l}。<strong>λ 的作用(偏差-方差折中)</strong>:(a) <strong>λ=0</strong> → Â_t=δ_t(单步 TD)——方差小但<strong>偏差大</strong>(依赖 V 的准确性);(b) <strong>λ=1</strong> → Â_t=Σγ^l r − V(s_t)(蒙特卡洛)——无偏但<strong>方差大</strong>;(c) <strong>0<λ<1</strong> → 折中(常用 λ=0.95)。<strong>在 RLHF 中的特殊性</strong>——(a) <strong>奖励稀疏</strong>:通常只有<strong>序列末尾</strong>有一个奖励(奖励模型对整个回答打分),中间步骤没有奖励;故 δ_t 在中间步骤为 γV(s_{t+1})−V(s_t)(无即时奖励);(b) <strong>γ 常设为 1</strong>(因为语言生成的'折扣'语义不明显,且序列长度有限);(c) <strong>Critic(价值网络)</strong> 需额外训练(用回归拟合回报),这是 PPO 的工程负担之一;(d) 实践中也有<strong>简化做法</strong>:直接把<strong>序列级优势广播到所有 token</strong>(或用'奖励 − 基线'的常数优势),省去 Critic(GRPO 正是这么做的)。<strong>GAE 的价值</strong>——它在'用准确但高方差的 MC'与'低方差但高偏差的 TD'之间提供了<strong>可调的连续谱</strong>(通过 λ),是 PPO 稳定训练的关键组件。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'减去基线降方差'是核心</strong>——策略梯度的原始形式用回报 R 加权,方差很大(因为 R 的尺度受环境影响);用优势 A=R−V 后,'比平均好'的动作被强化、'比平均差'的被抑制,信号更清晰、方差更小。② <strong>RLHF 中 Critic 的困境</strong>——LLM 的状态空间巨大(每个 token 位置一个状态),价值网络难以准确估计;且 Critic 本身需要训练(增加不稳定因素与显存)。故<strong>GRPO 直接去掉了 Critic</strong>(用组内平均作为基线),这是它在 LLM 场景流行的原因之一。③ <strong>序列级奖励的处理</strong>——把序列奖励广播到 token 是'近似'(严格来说中间 token 的贡献不明确);也有工作用<strong>token 级奖励</strong>(如过程奖励模型 PRM)提供更细的信用分配。④ <strong>γ 的语义</strong>——在标准 RL 中 γ 是'未来奖励的折扣';在 LLM 生成中,γ=1 意味着'整个回答的奖励同等重要'(常用)。若 γ<1 则倾向于'早结束'(因为后面 token 的奖励被折扣),可能不期望。⑤ <strong>λ 的选择</strong>——λ=0.95 是标准;LLM 中也有用 λ=1(纯 MC,因为序列奖励只在末尾,TD 的意义有限)。⑥ <strong>面试要点</strong>——被问'GAE 是什么',应给出'<strong>TD 残差的指数加权和 + λ 控制偏差-方差折中(λ=0 纯 TD、λ=1 纯 MC)</strong>',并说明'<strong>RLHF 中奖励稀疏(仅序列级)+ γ=1 + 可用组内均值替代 Critic</strong>';能指出'GRPO 去掉 Critic'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为优势与回报等价(优势是减去基线的回报)
  • ✕
    在 RLHF 中忽略奖励稀疏与 γ=1 的特殊性
🎯 Interviewer Follow-ups
  • ?
    为什么用优势而不是回报?
  • ?
    RLHF 中 γ 与 λ 怎么设?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-032: Alignment & RLHF: 写出 PPO 的裁剪目标,并解释 min 与 clip 的作用。📋Back to BankNext →M5-034: Alignment & RLHF: 解释奖励黑客(reward hacking)与缓解手段。