M5-038M5: NLP & Large Language ModelsAlignment & RLHFHard
Mastery:
Alignment & RLHF: 解释 RLHF 的 on-policy 采样与 off-policy 数据。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: PPO 需 on-policy 采样(当前策略生成)保证重要性采样正确;RM 训练常用 off-policy 数据;迭代式 RLHF 混合两者。
📌 Key Takeaways
- •PPO 的 ratio 需样本来自采样时的策略(on-policy)
- •RM 可用任意策略的数据(off-policy,更省)
- •迭代式 RLHF:用最新策略的数据更新 RM(近似 on-policy)
📐 Mathematical Derivations
数学机理:<strong>on-policy vs off-policy 的含义</strong>——on-policy 指'用<strong>当前策略</strong>生成的数据'更新策略;off-policy 指'用<strong>其他策略</strong>(如旧策略、人类、其他模型)生成的数据'。<strong>为什么 PPO 需 on-policy</strong>——PPO 的目标含重要性采样比 r=π_θ/π_old,其<strong>无偏性</strong>要求样本来自 π_old(采样时的策略);若样本来自很旧的策略,则 r 的方差会爆炸(因为 π_θ 与采样策略差异大)。故 PPO 每轮采样后只能做<strong>有限次</strong>更新(受 clip 限制),然后必须<strong>重新采样</strong>(这就是'on-policy、采样昂贵'的来源)。<strong>RM 训练可用 off-policy</strong>——奖励模型是<strong>监督学习</strong>(拟合偏好标签),不依赖重要性采样,故可用<strong>任意来源</strong>的偏好数据:人类标注的(来自多种模型/人工)、历史策略的、其他模型的;这使 RM 训练更省(可离线、可复用数据)。<strong>但 on-policy 数据对 RM 更有效</strong>——因为 RM 需在'策略会访问的区域'可靠;若 RM 只用'旧策略/人类'的数据训练,而新策略探索到新区域,RM 在那里不可靠(导致过优化)。故 <strong>iterative/online RLHF</strong> 用<strong>最新策略的输出</strong>做偏好标注来更新 RM(近似 on-policy),使 RM 的可靠区域'跟随'策略。<strong>三者的组合</strong>——(a) <strong>PPO</strong>:严格 on-policy 采样(每轮重新生成);(b) <strong>RM 初始训练</strong>:off-policy(用现有偏好数据);(c) <strong>RM 迭代更新</strong>:on-policy(用最新策略输出 + 人工/AI 标注)。<strong>成本权衡</strong>——on-policy 更有效但更贵(需实时采样 + 实时标注);off-policy 便宜但可能失配。实践常'off-policy 冷启动 + on-policy 迭代'。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'on-policy 采样昂贵'是 PPO 的主要成本</strong>——每轮都要用当前策略自回归生成(慢)、且生成的数据用一次就废(受 clip 限制);故 RLHF 的吞吐远低于 SFT。这是 DPO(用固定偏好数据,无采样)更经济的原因。② <strong>'RLAIF 让 on-policy 变便宜'</strong>——用 AI(而非人工)标注新策略的输出,使 on-policy RM 更新的成本大幅下降;这是 iterative RLHF / online DPO 能规模化的关键。③ <strong>与'分布偏移'的关系</strong>——off-policy 数据与当前策略的分布差异越大,RM 的可靠性越差(因为训练分布与使用分布不匹配);这与监督学习的'训练-测试分布一致'原则同理。④ <strong>DPO 的 off-policy 本质</strong>——DPO 用<strong>固定的偏好数据集</strong>训练,且其推导假设'偏好数据来自参考模型';若数据来自其他模型(如人类写的),则 DPO 的假设被违反,效果下降(这是 DPO 的局限之一,催生了 online DPO)。⑤ <strong>'数据效率'的对比</strong>——on-policy 数据的'每样本价值'更高(因为它直接反映当前策略的弱点),但获取成本高;off-policy 数据便宜但可能浪费在'已学会的'区域。⑥ <strong>面试要点</strong>——被问'为什么 PPO 要 on-policy',应给出'<strong>重要性采样比的无偏性要求样本来自采样时的策略</strong>',并说明'<strong>RM 可 off-policy 但 on-policy 数据更有效 → 迭代式 RLHF</strong>';能指出'DPO 用固定数据是其局限、online DPO 修正它'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用很旧的策略数据做 PPO(重要性采样方差爆炸)
- ✕RM 只用 off-policy 数据(分布外不可靠)
🎯 Interviewer Follow-ups
- ?为什么 PPO 必须 on-policy?
- ?on-policy RM 数据为什么更有效?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.