返回 RS 算法研究员 思维导图
中文·English
🎓 RS 算法研究员ID: rs-chinchilla-compute-optimal-scaling

Chinchilla 算力最优定律与比率

Chinchilla Compute-Optimal Scaling Laws
🎯核心定义
DeepMind Chinchilla 算力最优缩放定律与参数-数据比严格数学推导 (Chinchilla Compute-Optimal Scaling Laws & Parameter-to-Data Ratio Derivation) 是现代大语言模型(从 Llama 到 DeepSeek)预训练算力预算与模型/数据规模配比的黄金物理定律;Chinchilla 修正了 Kaplan 早期高估模型参数、低估数据量的错误拟合,建立包含不可约噪声 EE 的幂律损失函数曲面:L(N,D)=E+ANα+BDβL(N, D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta}(其中 NN 为非 Embedding 参数量,DD 为训练 Token 数,α0.34,β0.28\alpha \approx 0.34, \beta \approx 0.28);在固定算力预算 C6NDC \approx 6 N D 约束下,利用拉格朗日乘子法求解 minN,DL(N,D)\min_{N, D} L(N, D),推导出最优参数量与数据量应等比例同倍率增长NoptCa,DoptCbN_{\text{opt}} \propto C^a, D_{\text{opt}} \propto C^b(其中 a=βα+β0.45,b=αα+β0.55a = \frac{\beta}{\alpha + \beta} \approx 0.45, b = \frac{\alpha}{\alpha + \beta} \approx 0.55),推导出最优黄金比例为:每 1 个模型参数必须搭配约 20 个训练 Token ($D/N \approx 20$)
💡使用场景
亿级/万亿级大模型预训练算力预算规划、模型参数与数据集规模选型、Scaling Law 理论研究。
解决的核心痛点
早期 GPT-3 (175B 仅用 300B Tokens 训练) 属于严重的“模型过大但训练欠拟合 (Under-trained)”;Chinchilla 定律指导了 Llama (7B 配 2T Tokens,超饱和训练) 的诞生,大幅降低了推理 Serving 成本。
🎯5 个高频面试考点 (Exam Points)
1
利用拉格朗日乘子法,在约束条件 C=6NDC = 6ND 下对损失函数 L(N,D)=E+ANα+BDβL(N, D) = E + \frac{A}{N^\alpha} + \frac{B}{D^\beta} 完整推导最优解 NCaN^* \propto C^aDCbD^* \propto C^b
2
为什么算力估算公式中每个 Token 的前向 + 反向浮点运算量 (FLOPs) 精确等于 6N6N(前向 2N2N,反向 4N4N)?
3
推断感知缩放 (Inference-Aware Scaling): 为什么在工业落地中,宁愿打破 Chinchilla 最优比进行“超饱和训练 (Over-training: 如 7B 模型训练 15T Tokens)”,以极小化后续万亿次在线推理的显存与延迟?
4
下游下游任务指标(如准确率、BLEU)与预训练交叉熵损失 (Cross-Entropy Loss) 之间的非线性断裂(Emergent Abilities / 涌现能力)的机理解析?
5
数据天花板 (Data Wall) 危机:当互联网高质量公开发表人类文本(约 10~20 万亿 Tokens)即将耗尽时,合成数据 (Synthetic Data) 与自对齐如何维持 Scaling Law 延续?
📖 关联深度指南:📄 rs-core-cheatsheet
更新于 2026-08-14
🎯
检验攻克程度:针对「Chinchilla 算力最优定律与比率」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点顶会 Reviewer 审稿视角与压力答辩下一个知识点Inference-time Compute 缩放定律

🔗 更多 RS 算法研究员 知识点卡片

DPO 闭式最优策略与隐式奖励推导PPO 剪切代理目标函数下界证明RoPE 旋转位置编码复数内积证明扩散模型 SDE 连续随机微分推导