返回 AI 应用工程 思维导图
中文·English
🤖 AI 应用工程ID: cohens-kappa-agreement

Cohen's Kappa 标注一致性统计量

Cohen's Kappa Agreement
🎯核心定义
科恩卡帕系数 (Cohen's Kappa, κ\kappa) 是一种用于统计评估两位评估者(如 LLM 裁判与人类专家标注者,或两个不同大模型裁判)对同一组定性分类/打分项目进行标注时,扣除“由于随机偶然性碰巧产生的一致”之后的净一致性程度的统计学量化指标;其计算公式为 κ=PoPe1Pe\kappa = \frac{P_o - P_e}{1 - P_e},其中 PoP_o 为两位评估者的实际观测一致率 (Observed Agreement),PeP_e 为假设两者完全独立随机标注时的期望偶然一致率 (Expected Chance Agreement);κ[1,1]\kappa \in [-1, 1]κ>0.8\kappa > 0.8 代表极高的一致性。
💡使用场景
验证 LLM-as-a-Judge 能否安全替代人类专家、评估新评测指标与人类真实偏好的对齐度 (Human-LLM Alignment Validation)。
解决的核心痛点
简单的表面重合准确率 (Accuracy) 会受到样本类别极度不平衡(如 90% 样本都是负例)的严重欺骗;Cohen's Kappa 剔除了随机猜中的虚假一致性,为大模型裁判体系提供了统计学上严密的置信度背书。
🎯5 个高频面试考点 (Exam Points)
1
推导混淆矩阵下实际观测一致率 Po=a+dNP_o = \frac{a + d}{N} 与期望偶然一致率 Pe=(a+b)(a+c)+(c+d)(b+d)N2P_e = \frac{(a+b)(a+c) + (c+d)(b+d)}{N^2} 的数学公式?
2
Landis & Koch 标准解释表(κ<0.2\kappa < 0.2 极差,0.41-0.60 中等,0.61-0.80 显著,0.81-1.00 近乎完美)在工业界上线 LLM 裁判的门限?
3
加权卡帕系数 (Weighted Kappa: Quadratic Weighted Kappa) 在处理有序多分类(如 1-5 分连续打分)时的距离惩罚机制?
4
什么是 Kappa 悖论 (Kappa Paradox: 高准确率但低 Kappa 值)?样本类别极度不均衡时如何分析该现象?
5
当评估者数量超过 2 位(如 5 位人类专家 + 1 个大模型)时,如何从 Cohen's Kappa 扩展到 Fleiss' Kappa 综合一致性?
📖 关联深度指南:📄 llm-as-a-judge
更新于 2026-08-14
🎯
检验攻克程度:针对「Cohen's Kappa 标注一致性统计量」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Verbosity 与 Self-Enhancement 偏置下一个知识点Krippendorff's Alpha 多标注者信度

🔗 更多 AI 应用工程 知识点卡片

向量距离度量与 L2 归一化SQ8/SQ4 标量量化PQ 乘积量化与码本聚类ADC 非对称距离计算