M4-021M4: Sequences & TransformersTransformer Architecture AnatomyHard
Mastery:
Transformer Architecture Anatomy: 解释 Transformer 的残差流(residual stream)视角。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 把主干看成一条'残差流'向量,每个子层从中读取信息、再把结果加回;这是理解信息流、可解释性与激活操纵的框架。
📌 Key Takeaways
- •残差流是贯穿全模型的'共享通信通道'
- •每个子层 = 读取(LN+投影)+ 计算 + 写回(相加)
- •不同子层写入不同的'子空间',可被独立解读与干预
📐 Mathematical Derivations
数学机理:<strong>残差流(residual stream)</strong> 视角把 Transformer 的主干 x_l 看作一条<strong>贯穿所有层的向量通道</strong>,每个子层遵循'读—算—写'三步:(1) <strong>读</strong>——用 LN 归一化后经投影(如 W^Q、W^K、W^V、W₁)从残差流中提取它需要的信息;(2) <strong>算</strong>——在子层内部计算(注意力加权、FFN 变换);(3) <strong>写</strong>——把结果经输出投影(W^O、W₂)<strong>加回</strong>残差流。这个框架的价值在于:<strong>(a) 信息可加性</strong>——由于是相加,不同子层的贡献可以'分解'与'叠加',便于分析每个子层往通道里写了什么;<strong>(b) 子空间分工</strong>——不同子层倾向于写入残差流中<strong>近似正交的子空间</strong>,故可独立解读(如某些维度编码位置、某些编码语法);<strong>(c) 可干预性</strong>——可以在特定层、特定位置对残差流做<strong>激活操纵(activation patching)</strong>:把干净输入的激活替换到污染输入上(或反之),观察输出变化,从而<strong>因果地</strong>定位某行为依赖哪些层与哪些维度。这是机制可解释性(mechanistic interpretability)的核心方法,也是'logit lens'(把中间层残差流直接投影到词表看'当前预测')的基础。<strong>与'网络是黑箱'的对比</strong>——残差流视角提供了'白箱'的分析入口:把模型看作'多个可解释模块往共享通道写信息'的系统。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>与可解释性工具的联系</strong>——(a) <strong>logit lens</strong>:对中间层残差流施加 final LN 与输出投影,看'模型在第 l 层认为下一个词是什么',可观察预测如何逐层收敛;(b) <strong>activation patching / causal tracing</strong>:通过替换激活来定位因果路径(ROME 用它定位事实知识的存储位置);(c) <strong>稀疏自编码器(SAE)</strong>:把残差流分解为稀疏的可解释特征('字典学习'),是目前'特征可解释性'的主流工具。② <strong>子空间正交性的经验证据</strong>——研究发现残差流的'有效维度'远低于名义维度(d=4096 但有效维度可能只有几百),且不同概念占据不同子空间;这支持'叠加(superposition)'假说(模型用高维空间表示远超维度数的概念)。③ <strong>工程应用</strong>——(a) <strong>激活引导(activation steering)</strong>:在残差流上加一个'概念方向'向量即可控制输出风格(如'更正式');(b) <strong>知识编辑</strong>:定位并修改特定层的写入以改变事实;(c) <strong>量化与压缩</strong>:理解残差流的有效维度有助于设计更高效的表示。④ <strong>与'层剪枝'的关系</strong>——若某些层对残差流的写入可忽略(贡献小),则可剪掉;这解释了'部分层可剪而不显著掉点'。⑤ <strong>局限</strong>——残差流视角是'线性可加'的近似,忽略了 LN 的非线性与层间的强耦合;故它是有用的<strong>启发式框架</strong>而非严格理论。⑥ <strong>面试要点</strong>——被问'如何理解 Transformer 内部',应介绍残差流框架与'读-算-写'三步,并举出 logit lens / activation patching / SAE 三个工具;这是'机制可解释性'方向的高分回答。
⚠️ Common Interview Pitfalls
- ✕把残差流视角当作严格理论(是线性可加的启发式近似)
- ✕忽略 LN 的非线性使'读'并非简单线性投影
🎯 Interviewer Follow-ups
- ?为什么残差流视角有助于机制可解释性?
- ?如何用激活操纵(activation patching)验证因果?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.