返回 大语言模型 思维导图
中文·English
大语言模型ID: benchmarks

评测基准 MMLU/GSM8K

Benchmarks MMLU/GSM8K
🎯核心定义
四大代表性基准覆盖不同能力维度:(1) MMLU——57 个学科多项选择题,5-shot CoT 测世界知识与推理广度;(2) GSM8K——8000 道小学数学应用题,必须逐步推理(CoT 收益最大),测算术与多步推理;(3) HumanEval——164 道手写 Python 函数补全题,用 pass@k 度量代码生成:pass@k=1(nck)/(nk)\text{pass}@k = 1 - \binom{n-c}{k} / \binom{n}{k}(n 个采样中 c 个通过);(4) IFEval——可验证的指令遵循(格式、长度、关键字约束),测指令跟随而不是答对题目。
💡使用场景
模型选型与版本对比(同测 5-shot 设置);论文基线报告;SFT/RL 后的回归测试;面试必问"各基准测什么能力"以及"分数接近饱和怎么判断谁更强"。
解决的核心痛点
单一大盘数据无法覆盖能力空间;四个基准分别锚定知识广度、数学推理、代码生成、指令遵循四个维度。但闭卷选择题已接近饱和(部分榜单 >95%),且存在训练数据污染——公开题面被预训练集吸收后分数失真,需 MMLU-Pro/GSM-Plus 等更难变体与防泄漏评测。
🎯5 个高频面试考点 (Exam Points)
1
MMLU、GSM8K、HumanEval、IFEval 各自测什么能力?为什么用 5-shot 而非 zero-shot?
2
pass@k 公式如何推导?n 个采样中 c 个通过时 pass@k 为什么用组合数表示?
3
基准饱和的表现与成因是什么?有哪些应对(更难变体、动态评测、防泄漏)?
4
数据污染如何检测与规避?去重、公开时间线、held-out 集分别怎么做?
5
GSM8K 上 CoT 收益大但简单换行也有效——说明什么?评测时如何控制提示敏感性?
📖 关联深度指南:📄 llm-foundations-and-sota
更新于 2026-08-12
🎯
检验攻克程度:针对「评测基准 MMLU/GSM8K」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Agent 与工具调用下一个知识点自动指标 vs LLM-Judge

🔗 更多 大语言模型 知识点卡片

对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA分词 BPE/WordPiece