M5-040M5: NLP & Large Language ModelsAlignment & RLHFHard
Mastery:

Alignment & RLHF: 解释迭代式 RLHF / online RLHF 的动机与做法。

📐 Mathematical Definition
iter k: πk samples→relabel→RMk+1→PPO→πk+1\text{iter }k:\ \pi_k\ \text{samples}\to\text{relabel}\to\text{RM}_{k+1}\to\text{PPO}\to\pi_{k+1}
⚡ Executive Summary
Core Concept: 单轮 RLHF 会因 RM 过优化而退化;迭代式定期用新策略输出重新标注、更新 RM,缩小分布外区域。

📌 Key Takeaways

  • •
    单轮 RLHF:RM 固定,策略越训越偏(过优化)
  • •
    迭代式:定期用新策略数据更新 RM
  • •
    标注可由人工或 AI(RLAIF)完成

📐 Mathematical Derivations

数学机理:<strong>单轮 RLHF 的局限</strong>——(a) <strong>RM 固定</strong>:训练过程中 RM 不变,而策略持续偏离(进入 RM 的分布外区域)→ 过优化;(b) <strong>偏好数据来自旧模型</strong>:初始偏好数据是用 SFT 模型(或早期模型)的输出收集的,与最终策略的输出分布差异大;(c) <strong>数据利用率低</strong>:一次性收集的偏好数据在训练中很快'饱和'(策略已学会其中的区分)。<strong>迭代式/online RLHF</strong> 的解法——<strong>周期性</strong>地:(1) 用<strong>当前策略</strong>生成多个回答;(2) 收集<strong>新的偏好比较</strong>(人工标注或 AI 标注);(3) <strong>更新奖励模型</strong>(用新数据继续训练,或从头训练);(4) 用<strong>更新后的 RM</strong> 继续 PPO 训练。这使 RM 的<strong>可靠区域跟随策略移动</strong>,从而 (a) 减少过优化、(b) 提供'更难'的偏好信号(因为当前策略的输出质量更高,区分它们需要更细致的偏好)、(c) 持续改进。<strong>与 online DPO 的关系</strong>——同样的思想可用于 DPO:用当前策略生成回答、标注偏好、做 DPO(称为 online/iterative DPO,如 SPIN、Iterative DPO);因为 DPO 假设偏好数据来自参考模型,故 on-policy 数据更符合假设。<strong>成本</strong>——迭代式的主要成本是<strong>反复的偏好标注</strong>(人工贵)与<strong>反复的采样/训练</strong>(算力);故 <strong>RLAIF(用 AI 标注)</strong> 使迭代式变得可行(成本大降)。<strong>实证</strong>——多个工作(如 Anthropic 的 iterative RLHF、Llama-2 的多轮 RLHF)显示迭代式优于单轮(在同等标注预算下)。<strong>迭代次数</strong>——通常 2~5 轮;过多则收益递减且成本上升(且可能'偏好信号同质化')。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'RM 跟随策略'是核心机制</strong>——它把'分布外不可靠'的问题转化为'持续把分布外变成分布内';这与'主动学习'(在模型不确定处采样标注)思想相通。② <strong>RLAIF 的关键作用</strong>——人工标注无法支撑高频迭代(成本与速度);用 AI(强模型)标注使'每次迭代都重新标注'变得可行;虽引入 AI 偏见,但可通过'AI + 人工抽检'平衡。③ <strong>'偏好数据的难度递进'</strong>——早期策略输出差异明显(易标注);后期输出都很不错(难标注,需更细致);故迭代式天然提供了'难度递进'的偏好信号。④ <strong>与'数据效率'的关系</strong>——单轮 RLHF 的数据很快饱和(策略学会了其中的区分);迭代式持续提供新数据,故'每单位标注的价值'更高。⑤ <strong>工程复杂度</strong>——迭代式需管理'多轮的数据、RM 版本、模型 checkpoint',流程复杂;故实践中常'先做单轮(简单),效果不足再迭代'。⑥ <strong>面试要点</strong>——被问'为什么要迭代式 RLHF',应给出'<strong>单轮会因 RM 固定而过优化 → 迭代式让 RM 跟随策略 → 缩小分布外区域</strong>',并说明'<strong>RLAIF 使迭代可行</strong>'与'通常 2~5 轮';能指出'偏好数据难度递进'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    单轮 RLHF 就期望达到最优(RM 会过优化)
  • ✕
    忽略迭代式对标注成本的放大
🎯 Interviewer Follow-ups
  • ?
    迭代式 RLHF 的成本主要在哪?
  • ?
    迭代多少次合适?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-039: Alignment & RLHF: 解释 PPO 在 LLM 中的实现细节(token-level vs sequence-level)。📋Back to BankNext →M5-041: Alignment & RLHF: 解释 Constitutional AI 与 RLAIF。