TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
评测基准 MMLU/GSM8K
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
benchmarks
评测基准 MMLU/GSM8K
Benchmarks MMLU/GSM8K
🎯
核心定义
四大代表性基准覆盖不同能力维度:(1) MMLU——57 个学科多项选择题,5-shot CoT 测世界知识与推理广度;(2) GSM8K——8000 道小学数学应用题,必须逐步推理(CoT 收益最大),测算术与多步推理;(3) HumanEval——164 道手写 Python 函数补全题,用 pass@k 度量代码生成:
pass
@
k
=
1
−
(
n
−
c
k
)
/
(
n
k
)
\text{pass}@k = 1 - \binom{n-c}{k} / \binom{n}{k}
pass
@
k
=
1
−
(
k
n
−
c
)
/
(
k
n
)
(n 个采样中 c 个通过);(4) IFEval——可验证的指令遵循(格式、长度、关键字约束),测指令跟随而不是答对题目。
💡
使用场景
模型选型与版本对比(同测 5-shot 设置);论文基线报告;SFT/RL 后的回归测试;面试必问"各基准测什么能力"以及"分数接近饱和怎么判断谁更强"。
⚡
解决的核心痛点
单一大盘数据无法覆盖能力空间;四个基准分别锚定知识广度、数学推理、代码生成、指令遵循四个维度。但闭卷选择题已接近饱和(部分榜单 >95%),且存在训练数据污染——公开题面被预训练集吸收后分数失真,需 MMLU-Pro/GSM-Plus 等更难变体与防泄漏评测。
🎯
5 个高频面试考点 (Exam Points)
1
MMLU、GSM8K、HumanEval、IFEval 各自测什么能力?为什么用 5-shot 而非 zero-shot?
2
pass@k 公式如何推导?n 个采样中 c 个通过时 pass@k 为什么用组合数表示?
3
基准饱和的表现与成因是什么?有哪些应对(更难变体、动态评测、防泄漏)?
4
数据污染如何检测与规避?去重、公开时间线、held-out 集分别怎么做?
5
GSM8K 上 CoT 收益大但简单换行也有效——说明什么?评测时如何控制提示敏感性?
📖 关联深度指南:
📄 llm-foundations-and-sota →
更新于 2026-08-12
🎯
检验攻克程度:针对「评测基准 MMLU/GSM8K」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
Agent 与工具调用
下一个知识点 →
自动指标 vs LLM-Judge
🔗 更多 大语言模型 知识点卡片
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA
分词 BPE/WordPiece