返回 大语言模型 思维导图
中文·English
大语言模型ID: alignment-tax

对齐税与偏好数据

Alignment Tax & Preference Data
🎯核心定义
对齐税 (Alignment Tax) 指对齐训练(RLHF/DPO 等)在提升有帮助性、无害性的同时,可能损害模型部分能力(数学、代码、长尾知识、输出多样性、创造力)的现象,可量化为能力基准上的相对回退 Tax(B)=Sbase(B)Saligned(B)Sbase(B)\text{Tax}(B) = \frac{S_{\text{base}}(B) - S_{\text{aligned}}(B)}{S_{\text{base}}(B)};偏好数据 (Preference Data) 是 RLHF/DPO 等方法的核心燃料——由标注者(或 AI 评审)在多个回答间选择更优者构成 chosen/rejected 对比对,其规模、质量与分布决定了对齐效果的上限。典型缓解:控制 KL 惩罚系数与数据配比、多目标加权、在能力基准上做回归检查。
💡使用场景
对齐方法选型与强度权衡(多大 KL 惩罚、多少偏好数据)、偏好数据 pipeline 设计(众包标注、RLAIF 合成、标注一致性评估)、模型发布前的能力回归检查(对齐前后基准分数对比)。
解决的核心痛点
对齐不是免费的——无节制地追求偏好分数会导致能力回退,需要度量与缓解;同时“垃圾进垃圾出”,偏好数据的噪声与偏差会直接传导为对齐后的模型缺陷,决定效果天花板。
🎯5 个高频面试考点 (Exam Points)
1
什么是对齐税?典型表现有哪些?举例哪些能力容易受损?
2
如何度量对齐税?如何在训练中缓解(如 KL 系数、数据配比、多目标)?
3
偏好数据的质量如何影响对齐效果?高质量偏好对的构造要点?
4
标注者一致性 (Agreement) 如何评估?低一致性说明什么?
5
RLAIF (AI 反馈) 与人工偏好数据的优缺点对比?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-12
🎯
检验攻克程度:针对「对齐税与偏好数据」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点GRPO 相对策略优化下一个知识点量化 PTQ/QAT

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用缩放点积注意力注意力变体 MHA/MQA/GQA评测基准 MMLU/GSM8K