TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
缩放定律
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
scaling-laws
缩放定律
Scaling Laws
🎯
核心定义
缩放定律描述模型交叉熵损失随参数 N、数据量 D、计算量 C 呈幂律下降:
L
(
N
)
∝
N
−
α
L(N) \propto N^{-\alpha}
L
(
N
)
∝
N
−
α
、
L
(
D
)
∝
D
−
β
L(D) \propto D^{-\beta}
L
(
D
)
∝
D
−
β
、
L
(
C
)
∝
C
−
γ
L(C) \propto C^{-\gamma}
L
(
C
)
∝
C
−
γ
, 其中 α≈0.076、β≈0.095。Kaplan 定律主张参数比数据重要; Chinchilla 法则(2022)修正为数据与参数应同步增长: 最优数据量 ≈ 20 × 参数量, 即 70B 模型对应约 1.4T tokens——'数据比参数更重要'。LLaMA 系列即遵循此配比训练。
💡
使用场景
选择模型规模与训练 token 预算、训练成本估算、性能外推与架构选型。
⚡
解决的核心痛点
固定计算预算下'训练多大模型、多少数据'的最优配比。GPT-3 等早期模型严重欠训练(数据不足), Chinchilla 表明同等算力下把预算投给数据收益更大;幂律还可用于外推: 用 1e20 FLOPs 的小规模实验可预测 1e24 FLOPs 训练的损失, 误差约 5% 以内, 支撑了'先用小模型做实验再放大'的工程路线。
🎯
5 个高频面试考点 (Exam Points)
1
幂律公式的形式? Kaplan 与 Chinchilla 两种观点的差异?
2
为什么同等算力下数据比参数更重要?
3
Chinchilla 法则的内容与 20:1 数据参数比如何得出?
4
缩放定律能否无限外推? 饱和与涌现现象?
5
如何用缩放定律选择 N/D 并估算训练成本?
📖 关联深度指南:
📄 llm-foundations-and-sota →
更新于 2026-08-12
🎯
检验攻克程度:针对「缩放定律」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
自动指标 vs LLM-Judge
下一个知识点 →
模型家族与演进
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA