M4-022M4: Sequences & TransformersTransformer Architecture AnatomyMedium
Mastery:
Transformer Architecture Anatomy: 解释 Transformer 的深度与宽度权衡(scaling 视角)。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 给定算力,深度与宽度存在最优比;scaling law 显示宽度与深度应大致同比例增长,而非极端偏向一方。
📌 Key Takeaways
- •计算量 C≈6ND(N 参数、D token)
- •深度增加提升'串行计算步数'(推理能力)
- •宽度增加提升'单步表达力'(容量)
📐 Mathematical Derivations
数学机理:<strong>计算量公式</strong>——训练计算量 C≈6ND(N 为参数量、D 为训练 token 数),其中系数 6 = 前向 2 + 反向 4(每次乘加计 2 FLOPs)。对 Transformer,N≈12d²L(d 为宽度、L 为深度),故 <strong>C∝d²L·D</strong>。<strong>给定算力下的最优配比</strong>——scaling law 的研究(Kaplan 等 2020、Chinchilla 等 2022、以及'深度-宽度 scaling'专门研究)显示:(a) <strong>参数量 N 与数据量 D 应大致同比例增长</strong>(Chinchilla 最优约 D≈20N);(b) <strong>在固定 N 下,深度 L 与宽度 d 应大致同比例增长</strong>(d∝L 的近似),极端偏向一方(如极深而窄、或极宽而浅)都不优。<strong>为什么</strong>——<strong>深度</strong>决定'串行计算步数'(每层可做一次非线性变换),与<strong>推理/组合能力</strong>直接相关(见'表达力与理论限制'题:深度 L 可表达 L 步串行计算);<strong>宽度</strong>决定'单步的表达力与信息带宽'(更宽的表示可容纳更多特征、更小的注意力/FFN 瓶颈)。<strong>实证</strong>——GPT-3 系列(d=12288、L=96)与 LLaMA 系列(d=8192、L=80)都遵循 d 与 L 大致同比例;而'极深'(L=1000+、d 很小)与'极宽'(L=12、d 极大)的配置都表现不佳。此外,<strong>深度有额外的工程约束</strong>——深层模型的梯度稳定性更差(需 Pre-LN、DeepNorm、μP 等)、推理时层串行导致延迟更高。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>深度的'推理'价值</strong>——理论表明深度决定串行计算步数,故对<strong>多步推理</strong>任务深度更关键;这解释了'为什么推理模型往往更深'以及'CoT 能部分替代深度'(把串行计算外化到序列)。② <strong>宽度的'知识'价值</strong>——更宽的模型有更大的 FFN(键值记忆)与更多的注意力头,故<strong>知识容量</strong>更大;这解释了'宽模型在知识密集任务上更强'。③ <strong>工程权衡</strong>——(a) <strong>深度 → 延迟</strong>:推理时层是串行的,深模型单 token 延迟高(虽然总 FLOPs 可能相同);(b) <strong>宽度 → 显存</strong>:宽模型的激活与 KV cache 更大;(c) <strong>并行性</strong>:宽度易并行、深度难并行。故实际配置受部署约束影响。④ <strong>与 MoE 的关系</strong>——MoE 通过'增大 N(总参数)但不增大激活量'来提升容量,相当于在'宽度'维度上做了稀疏扩展;这为'容量 vs 计算'提供了新轴。⑤ <strong>Chinchilla 与'过度训练'</strong>——Chinchilla 指出早期大模型'参数大但数据少'(训练不足);后续 LLaMA 系列则故意'用更多数据训练更小模型'(over-training)以降低推理成本——这是'训练算力 vs 推理算力'的权衡,属于工程层面的 scaling 决策。⑥ <strong>面试要点</strong>——被问'怎么分配算力',应给出'<strong>C≈6ND → N≈12d²L → d 与 L 大致同比例</strong>'的推理链,并说明'深度管推理、宽度管知识/容量'的分工与'深度换延迟'的工程代价;能提到 MoE 与 over-training 是明显加分。
⚠️ Common Interview Pitfalls
- ✕极端偏向深度或宽度(应大致同比例)
- ✕忽略深度的推理延迟代价
🎯 Interviewer Follow-ups
- ?为什么极深或极宽的模型都不好?
- ?深度与推理能力的关系?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.