M5-041M5: NLP & Large Language ModelsAlignment & RLHFMedium
Mastery:

Alignment & RLHF: 解释 Constitutional AI 与 RLAIF。

📐 Mathematical Definition
CAI: critique→revise→AI preference labels;RLAIF: rAI replaces rhuman\text{CAI}:\ \text{critique}\to\text{revise}\to\text{AI preference labels};\qquad \text{RLAIF}:\ r_{\text{AI}}\ \text{replaces}\ r_{\text{human}}
⚡ Executive Summary
Core Concept: CAI 用'宪法'(原则清单)让模型自我批评与修订,再由 AI 依宪法标注偏好;RLAIF 用 AI 反馈替代人工。

📌 Key Takeaways

  • •
    CAI:模型按'宪法原则'自我批评并修订回答
  • •
    RLAIF:用 AI 标注偏好(成本低、可扩展)
  • •
    两者都大幅降低对人工标注的依赖

📐 Mathematical Derivations

数学机理:<strong>Constitutional AI(CAI,Anthropic)</strong> 的核心思想是'用一套<strong>明确的原则(宪法)</strong> 指导模型自我改进',分两阶段。<strong>阶段一:监督学习(SL-CAI)</strong>——(1) 让模型对'可能有害/不当'的 prompt 生成初始回答;(2) 让模型<strong>依据宪法原则批评自己的回答</strong>(如'这条原则要求避免…,我的回答违反了…');(3) 让模型<strong>依据批评修订回答</strong>;(4) 用修订后的回答做 SFT。这实现了'<strong>自我批评 + 自我修订</strong>',把'人类写答案'变成'模型按原则改答案'。<strong>阶段二:RLAIF(RL from AI Feedback)</strong>——用模型(而非人类)<strong>依据宪法</strong>对多个回答做<strong>偏好判断</strong>('哪个回答更符合宪法原则?'),生成 AI 偏好标签;再用这些标签训练奖励模型 + 做 RLHF。<strong>RLAIF 的意义</strong>——把'人类偏好标注'替换为'AI 依据明确原则的偏好判断':(a) <strong>成本大幅降低</strong>(AI 标注比人工便宜快得多);(b) <strong>可扩展</strong>(支持高频迭代的 online RLHF);(c) <strong>一致性更高</strong>(同一原则下 AI 的判断比不同人类标注者更一致);(d) <strong>原则可审计</strong>(宪法是明文清单,可审查与修改,比'人类隐含偏好'更透明)。<strong>代价/风险</strong>:(a) <strong>AI 偏见</strong>——AI 标注会继承其自身的偏见(且可能'过度严格'或'误解原则');(b) <strong>原则设计的困难</strong>——宪法需覆盖足够多的场景,且不同原则可能冲突;(c) <strong>'AI 评判 AI'的循环风险</strong>(可能强化某些模式);(d) <strong>与人类偏好的偏差</strong>——AI 偏好未必等于人类偏好(尤其在'价值观'层面)。<strong>实证</strong>——Anthropic 报告 CAI 在'无害性'上优于纯人工 RLHF,且'有用性'相当;RLAIF 的标注成本远低于人工。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'明确原则'是 CAI 的关键创新</strong>——它把'对齐什么'从'隐式的人类偏好'变成'<strong>明文的、可讨论的、可修改的原则清单</strong>';这使对齐过程<strong>透明可审计</strong>(可以争论'宪法该写什么'),而非'依赖标注者的直觉'。② <strong>RLAIF 是'降低标注成本'的关键路径</strong>——人工偏好标注是 RLHF 最贵的部分;RLAIF 使'大规模迭代式对齐'变得可行(成本降 1~2 个数量级)。这是工业界普遍采用的方向。③ <strong>'自我批评'的能力依赖</strong>——CAI 阶段一假设模型能'识别自己回答的问题';对能力弱的模型,自我批评质量差(可能改得更糟)。故 CAI 通常在'已较强'的模型上做。④ <strong>原则冲突的处理</strong>——不同原则可能冲突(如'有用'与'无害');需设计优先级或让模型权衡。这是'对齐规范'(alignment specification)的核心难题。⑤ <strong>与'可验证奖励'的对比</strong>——RLAIF 的奖励来自 AI 判断(主观、可能有偏见);RLVR 的奖励来自程序验证(客观、精确)。故对可验证任务优先用 RLVR,对主观任务用 RLAIF/人工。⑥ <strong>面试要点</strong>——被问'CAI/RLAIF 是什么',应给出'<strong>CAI 两阶段(自我批评修订 + AI 依宪法标注偏好)+ RLAIF(AI 替代人工标注)</strong>'与'<strong>成本降低 + 一致性 + 可审计</strong>'的收益、以及'<strong>AI 偏见 + 原则冲突</strong>'的风险;能指出'原则明文可审计'是 CAI 的核心创新是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为 RLAIF 没有偏见(继承 AI 自身偏见)
  • ✕
    忽略宪法原则之间可能冲突
🎯 Interviewer Follow-ups
  • ?
    CAI 的两个阶段是什么?
  • ?
    AI 标注有什么偏见风险?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-040: Alignment & RLHF: 解释迭代式 RLHF / online RLHF 的动机与做法。📋Back to BankNext →M5-042: DPO Family (DPO / KTO / ORPO): 完整推导 DPO 损失。