1详细设计一份标准化的 1-5 分 Rubric 评分量规(定义每个分值段的具体合格条件与扣分红线)?
2为什么在打分 Prompt 中强制要求裁判模型“先写评判理由 (CoT Explanation),最后再输出数字分数”能大幅提高打分一致性?
3分析 Pointwise 评估中常见的“分数膨胀与中间聚集 (Score Clustering / Central Tendency Bias)”现象及其校准方案?
4Reference-based (有参考金标准答案) vs Reference-free (无参考答案纯裁判) 在事实准确性评估中的表现与成本差异?
5使用多个独立裁判模型(如 GPT-4o + Claude 3.5 + Gemini 1.5)组成裁判陪审团 (Judge Ensemble) 取中位数的降噪策略?