对齐税 (Alignment Tax) 指对齐训练(RLHF/DPO 等)在提升有帮助性、无害性的同时,可能损害模型部分能力(数学、代码、长尾知识、输出多样性、创造力)的现象,可量化为能力基准上的相对回退
Tax(B)=Sbase(B)Sbase(B)−Saligned(B);偏好数据 (Preference Data) 是 RLHF/DPO 等方法的核心燃料——由标注者(或 AI 评审)在多个回答间选择更优者构成 chosen/rejected 对比对,其规模、质量与分布决定了对齐效果的上限。典型缓解:控制 KL 惩罚系数与数据配比、多目标加权、在能力基准上做回归检查。