M5-018M5: NLP & Large Language ModelsScaling Laws & Compute AllocationHard
Mastery:

Scaling Laws & Compute Allocation: 解释 scaling law 对超参与架构选择的指导意义。

📐 Mathematical Definition
L(N,D) fit at small scale→predict at large;μP: transfer hyperparams\mathcal{L}(N,D)\ \text{fit at small scale}\to\text{predict at large};\qquad \mu\text{P}:\ \text{transfer hyperparams}
⚡ Executive Summary
Core Concept: 用小型实验拟合幂律预测大规模表现,指导 N/D 配比与超参(μP 使超参可迁移);但不能外推到新机制。

📌 Key Takeaways

  • •
    用途:预测损失、规划预算、选择架构
  • •
    μP/μTransfer 让超参从窄模型迁移到宽模型
  • •
    局限:不能预测'新能力'、不能跨架构外推

📐 Mathematical Derivations

数学机理:<strong>指导意义</strong>有三层。<strong>(1) 预测与规划</strong>——用<strong>小规模实验</strong>(如多个小模型、不同 N/D)拟合幂律 L=L_∞+AN^{−α}+BD^{−β},外推预测大规模模型的损失。用途:(a) 判断'扩大规模是否值得'(预测收益);(b) 给定预算算最优 N/D 配比;(c) 比较架构(在同一实验框架下拟合各自的幂律,比较常数)。<strong>(2) 超参迁移(μP/μTransfer)</strong>——标准参数化下,不同宽度的最优超参(学习率、初始化、warmup)不同,故'扩大规模需重新调参'(昂贵)。<strong>μP(Maximal Update Parameterization)</strong> 给出'随宽度一致'的初始化与 lr 缩放规则,使<strong>窄模型上调出的超参可直接用于宽模型</strong>(μTransfer);这把'大规模调参'变成'小模型调参 + 直接迁移',极大降低成本。<strong>(3) 架构选择</strong>——在同一实验框架下,用幂律的<strong>常数项与指数</strong>比较架构(如'哪个架构在小规模上损失更低、且斜率更优')。<strong>局限</strong>——(a) <strong>不能预测'新能力'</strong>(scaling law 只拟合<strong>损失</strong>,不拟合'某任务的表现';涌现现象说明能力可能与损失脱钩);(b) <strong>不能跨机制外推</strong>(幂律是'经验拟合',引入新机制如 MoE、新的注意力、新数据分布后,常数与指数会变,需重新拟合);(c) <strong>不能预测数据受限的行为</strong>(幂律假设数据无限);(d) <strong>对超参/调度敏感</strong>(Kaplan 的偏差即源于此);(e) <strong>不能保证'损失低 → 任务好'</strong>(对齐、安全性等不由损失决定)。<strong>实践建议</strong>——(a) 用幂律做<strong>趋势判断</strong>而非<strong>精确预测</strong>;(b) 在<strong>多个规模</strong>上验证幂律的稳定性(若拟合不一致,说明机制变了);(c) 结合<strong>任务指标</strong>(而非只看损失);(d) 用 μP 迁移超参。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'预测损失 ≠ 预测能力'是核心局限</strong>——scaling law 拟合的是<strong>交叉熵损失</strong>;但下游任务表现可能与损失脱钩(涌现、以及'损失相近但能力差异大'的情况)。故不能'用损失外推能力'。② <strong>幂律的'验证'方法</strong>——应在<strong>多个规模</strong>上拟合,检查幂律是否成立(若不同规模区间的指数不同,说明中间发生了机制变化);这是'scaling law 可信度'的自检。③ <strong>μP 的实际价值</strong>——对算力有限的团队,μTransfer 是'用 1% 成本获得大模型最优超参'的关键手段;工业界已广泛采用(超参搜索在小模型上做)。④ <strong>架构比较的正确方法</strong>——不能'小规模 A 好就断定大规模 A 好'(斜率可能不同);应在多个规模上比较,看'损失-规模'曲线的<strong>位置与斜率</strong>。⑤ <strong>与 MoE/稀疏架构的关系</strong>——MoE 的 scaling law 需考虑'激活参数 vs 总参数'两个维度(不是单一 N);故标准幂律需扩展。⑥ <strong>面试要点</strong>——被问'scaling law 怎么用',应给出'<strong>预测/规划(小规模拟合外推)+ 超参迁移(μP)+ 架构比较(多规模看斜率)</strong>'三层用途与'<strong>不能预测新能力/不能跨机制外推/损失≠能力</strong>'三条局限;能提到'多规模验证幂律稳定性'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用小规模损失外推'某任务的能力'
  • ✕
    只在单一规模上比较架构优劣
🎯 Interviewer Follow-ups
  • ?
    scaling law 能预测什么、不能预测什么?
  • ?
    μP 如何降低大规模调参成本?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-017: Scaling Laws & Compute Allocation: 解释数据受限下的 scaling 策略。📋Back to BankNext →M5-019: Scaling Laws & Compute Allocation: 解释后训练阶段的 scaling(RL/推理算力)与预训练 scaling 的差异。