M5-036M5: NLP & Large Language ModelsAlignment & RLHFMedium
Mastery:

Alignment & RLHF: 解释 RLHF 中的 KL 惩罚系数与它的作用。

📐 Mathematical Definition
L=E[rϕ(x,y)]−β KL(πθ(⋅∣x)∥πref(⋅∣x))\mathcal{L}=\mathbb{E}[r_\phi(x,y)]-\beta\,\mathrm{KL}(\pi_\theta(\cdot|x)\|\pi_{\text{ref}}(\cdot|x))
⚡ Executive Summary
Core Concept: KL 约束策略不偏离参考模型;β 太小导致奖励黑客与语言退化,太大导致学不到新行为;常用 0.01~0.1 或自适应。

📌 Key Takeaways

  • •
    KL 是'每 token 的分布差异'之和(序列级 KL)
  • •
    双重作用:防奖励黑客 + 防灾难性遗忘
  • •
    β 需调;实践中常用自适应(KL 超阈值则增大 β)

📐 Mathematical Derivations

数学机理:<strong>KL 惩罚的形式</strong>——在 RLHF 的目标中加入 −β·KL(π_θ‖π_ref),其中 π_ref 通常是 <strong>SFT 模型</strong>(或初始策略)。序列级 KL 定义为<strong>逐 token KL 之和</strong>:KL(π_θ‖π_ref)=Σ_t KL(π_θ(·|x,y_{<t})‖π_ref(·|x,y_{<t}));实现上等价于在<strong>每个 token 的奖励</strong>中减去 β·log(π_θ/π_ref)(即逐 token 的 log-ratio 惩罚)。<strong>双重作用</strong>:(a) <strong>防奖励黑客</strong>——限制策略进入'奖励模型的分布外区域'(那里 RM 的打分不可靠);(b) <strong>防灾难性遗忘与语言退化</strong>——保持输出的流畅性与原能力(不偏离参考模型太远)。<strong>β 的权衡</strong>——(a) <strong>β 太小</strong>:策略自由探索,容易奖励黑客、输出退化(重复、不自然)、遗忘;(b) <strong>β 太大</strong>:策略被'钉'在参考模型附近,几乎学不到新行为(RLHF 无效);(c) <strong>常用范围</strong>:0.01~0.1(InstructGPT 用 0.02 左右)。<strong>自适应 KL(adaptive KL control)</strong>——设定目标 KL(如 6),每步监控实际 KL:若 KL 超过目标的 1.5 倍则把 β 增大 2 倍;若低于目标的 1/1.5 则把 β 减小 2 倍。这使训练自动维持在'合理的偏离程度'(避免手工调 β)。<strong>与 DPO 的对应</strong>——DPO 的损失中<strong>隐式包含</strong>参考模型(通过 log π_ref 项),其'β'参数扮演与 RLHF 中 KL 系数类似的角色(控制'相对参考模型的偏离')。<strong>与'对齐税'的关系</strong>——KL 惩罚本身就是'对齐税'的来源之一:过度约束会损害能力(见后续题)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'逐 token KL'而非'序列级 KL 的一次性计算'</strong>——因为序列 KL 可分解为逐 token 的 KL 之和,故可实现为'每个 token 奖励减 β·log-ratio';这使 KL 成为<strong>每步的代价</strong>(credit assignment 更细),也是实现的标准做法。② <strong>π_ref 的选择</strong>——通常用 SFT 模型;也有用'上一轮迭代的模型'(iterative RLHF)以允许逐步偏离;π_ref 的选择影响'允许的探索范围'。③ <strong>自适应 KL 的实践价值</strong>——手工调 β 很痛苦(不同任务/模型差异大);自适应 KL 让训练'自我调节',是工业界的标准做法。其'目标 KL'本身也是超参(需按任务设)。④ <strong>KL 与'多样性'的关系</strong>——KL 约束越强,输出越接近参考模型(多样性受限);这对'创造性任务'不利,对'安全关键任务'有利。⑤ <strong>DPO 的 β 语义</strong>——DPO 的 β 控制'对偏好信号的信任程度'(β 大则更保守、更接近参考模型);与 RLHF 的 KL 系数作用一致,但实现完全不同(无需采样)。⑥ <strong>面试要点</strong>——被问'KL 惩罚的作用',应给出'<strong>双重作用(防黑客 + 防遗忘)+ β 的权衡 + 自适应控制</strong>',并说明'KL 可分解为逐 token log-ratio 惩罚';能指出'DPO 的 β 与 RLHF 的 KL 系数语义对应'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    β 设得过小导致语言退化
  • ✕
    把 KL 当作'最终约束'而非'逐 token 代价'
🎯 Interviewer Follow-ups
  • ?
    为什么 KL 要逐 token 累加?
  • ?
    自适应 KL 的控制目标是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-035: Alignment & RLHF: 解释 RLHF 的工程难点与稳定性问题。📋Back to BankNext →M5-037: Alignment & RLHF: 解释奖励模型的泛化与过优化(over-optimization)。