返回 大语言模型 思维导图
中文·English
大语言模型ID: eval-metrics

自动指标 vs LLM-Judge

Auto Metrics vs LLM-as-Judge
🎯核心定义
三类传统自动指标及其局限:(1) BLEU——n-gram 精确率乘长度惩罚 BLEU=BPexp(nwnlogpn)\text{BLEU} = BP \cdot \exp\big(\sum_n w_n \log p_n\big),面向机器翻译,对同义词与合法改写不敏感;(2) ROUGE——以召回为主的 n-gram/最长公共子序列 F 值,面向摘要,同样忽略语义;(3) 困惑度 PPL(x)=exp(1NilogP(xix<i))\text{PPL}(x) = \exp\big(-\tfrac{1}{N} \sum_i \log P(x_i \mid x_{<i})\big)——测拟合度不测质量,偏好短句、测不出事实错误。LLM-as-judge 用大模型当裁判打分或比较,一致性用 Cohen's Kappa 度量:κ=pope1pe\kappa = \tfrac{p_o - p_e}{1 - p_e}(观察一致率扣随机一致率)。
💡使用场景
摘要/翻译/开放生成的自动回归测试(低成本);LLM-as-judge 用于主观质量、长文本、无金标参考的场景;上线前用 Kappa 校验 judge 与人类或两 judge 间的一致,再决定能否信任自动评判。
解决的核心痛点
传统指标测"词面相似"而非"语义正确",高分可能对应错译/漏要点;困惑度测统计拟合而非质量。LLM-as-judge 提供语义级判断,但引入位置偏差(偏爱后出现的答案)、自偏好、冗长偏好等系统性偏差,必须用 Kappa 与消偏设计(交换顺序)保证可信。
🎯5 个高频面试考点 (Exam Points)
1
BLEU 的三个组成部分是什么(精确率、n-gram、长度惩罚 BP)?它在什么情况下给出误导性高分?
2
困惑度的定义与局限:为什么低困惑度不代表生成质量高?
3
Cohen's Kappa 公式中 p_o 和 p_e 分别是什么?为什么比简单一致率更严格?
4
LLM-as-judge 的三大偏差(位置、自偏好、冗长)怎么设计实验消除?
5
什么场景适合 BLEU/ROUGE,什么场景必须用 LLM-judge 或人工评测?成本权衡如何?
📖 关联深度指南:📄 nlp-tasks-and-ner
更新于 2026-08-12
🎯
检验攻克程度:针对「自动指标 vs LLM-Judge」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点评测基准 MMLU/GSM8K下一个知识点缩放定律

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA