🎯核心定义
成对对比评估范式 (Pairwise Evaluation / Head-to-Head Comparison) 是一种将两个不同候选模型对同一提问的回答(Model A vs Model B)隐去模型身份后并排呈现给裁判模型(或人类评审员),由裁判直接判别哪一个回答更加优秀、更符合事实或判定为平局 (Tie) 的评估范式;系统通过在海量 Prompt 集上统计胜率矩阵 (Win Rate Matrix) 或代入 Bradley-Terry 概率模型计算全局偏好排名。
💡使用场景
模型版本 A/B 测试、大模型天梯排行榜 (LMSYS Chatbot Arena)、RLHF 偏好数据集构建 (DPO/PPO Preference Data)。
⚡解决的核心痛点
Pointwise 绝对打分容易因裁判模型的打分尺度漂移(如今天给 8 分明天给 7 分)产生高方差;人类和裁判模型对两个回答进行相对比较 (Relative Preference) 的敏锐度与一致性远高于给出孤立的绝对分数值,能够更精准捕捉细微的质量差距。