M3-096M3: Deep Learning FoundationsArchitecture Building BlocksHard
Mastery:

Architecture Building Blocks: 解释参数共享的几种形式与作用。

📐 Mathematical Definition
shared:{within-layer,cross-layer(ALBERT),cross-modal(CLIP),tied-emb}\text{shared}: \{\text{within-layer},\text{cross-layer}(\text{ALBERT}),\text{cross-modal}(\text{CLIP}),\text{tied-emb}\}
⚡ Executive Summary
Core Concept: 权重共享(同层/跨层/跨模态/卷积核滑动)、共享 embedding 与输出层、以及多任务共享骨干;降低参数量并注入先验。

📌 Key Takeaways

  • •
    卷积的滑动共享是最经典的参数共享
  • •
    ALBERT 跨层共享 Transformer 参数(省参数、正则)
  • •
    共享 embedding 与输出层(tied)省参数量并提升小模型

📐 Mathematical Derivations

数学机理:<strong>参数共享</strong>的本质是'用结构先验约束参数空间',同时降低参数量。<strong>形式一:层内共享(空间共享)</strong>——卷积核在所有空间位置滑动使用同一组权重,这是 CNN 的核心(把'平移等变'作为先验,参数量与图像尺寸无关)。<strong>形式二:跨层共享</strong>——ALBERT 让所有 Transformer 层共享同一组参数(相当于把'深度'变成'循环'),参数量降低 L 倍;效果上相当于一种<strong>强正则</strong>(限制了各层能学到的变换必须相同),但可能损失表达力(故 ALBERT 用更宽的层补偿)。<strong>形式三:跨模态共享</strong>——CLIP 的文本/图像编码器各自独立,但<strong>共享对比学习的投影空间</strong>;更激进的方案(如 FLAVA、统一 Transformer)让文本与图像共享部分参数。<strong>形式四:tied embedding</strong>——输入 embedding 矩阵与输出(softmax)投影矩阵共享(W_out=E^T),省 V×d 参数量;理论上'输入 token 的表示'与'输出 token 的表示'应一致(同一语义空间),故共享有合理性。<strong>形式五:多任务共享骨干</strong>——多任务学习中共享底层、任务特定顶层;共享程度决定'迁移 vs 干扰'的权衡。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>共享 vs 独立的取舍</strong>——共享降参数量、强正则、提升小数据表现;独立增表达力、适合大数据。选择取决于'数据量'与'任务相似性'。② <strong>tied embedding 的实践</strong>——小模型(如 <1B)常用 tied(省参数、提升效果);大模型(V 大、d 大)常不 tied(因共享会限制表达,且参数量占比小);GPT-2 用 tied,GPT-3/LLaMA 不用。③ <strong>跨层共享的现代变体</strong>——Universal Transformer、以及某些'递归深度'设计(同一层反复应用)属于此类;还有 <strong>layer tying 的部分共享</strong>(如共享 attention 但 FFN 独立)。④ <strong>与 MoE 的关系</strong>——MoE 是'参数不共享但稀疏激活'的相反思路(总参数大、每 token 只用一部分);两者从不同角度解决'容量 vs 计算'的权衡。⑤ <strong>与 LoRA/适配器的关系</strong>——参数共享与'低秩增量'是互补的:共享降低基础参数量、LoRA 提供任务特定的低秩增量。⑥ <strong>面试要点</strong>——被问'如何减少参数量',应给出'<strong>共享(层内/跨层/tied)+ 分解(低秩/深度可分离)+ 稀疏(MoE/剪枝)+ 量化</strong>'四类手段,并说明各自的正则/表达力代价;这体现系统性的参数效率思维。
⚠️ Common Interview Pitfalls
  • ✕
    认为共享参数总是不如独立(取决于数据量与任务相似性)
  • ✕
    在大模型上无条件 tied embedding(限制表达)
🎯 Interviewer Follow-ups
  • ?
    跨层共享为什么能正则化?
  • ?
    tied embedding 的利弊?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-095: Architecture Building Blocks: 解释注意力的归纳偏置,以及它与卷积的差异。📋Back to BankNext →M3-097: Convolution & Vision Foundations: 计算卷积层的参数量与输出尺寸。