三类传统自动指标及其局限:(1) BLEU——n-gram 精确率乘长度惩罚
BLEU=BP⋅exp(∑nwnlogpn),面向机器翻译,对同义词与合法改写不敏感;(2) ROUGE——以召回为主的 n-gram/最长公共子序列 F 值,面向摘要,同样忽略语义;(3) 困惑度
PPL(x)=exp(−N1∑ilogP(xi∣x<i))——测拟合度不测质量,偏好短句、测不出事实错误。LLM-as-judge 用大模型当裁判打分或比较,一致性用 Cohen's Kappa 度量:
κ=1−pepo−pe(观察一致率扣随机一致率)。