M4-093M4: Sequences & TransformersSequence Modeling Trade-offsEasy
Mastery:

Sequence Modeling Trade-offs: 对比 RNN、CNN、Transformer 在序列建模上的归纳偏置。

📐 Mathematical Definition
RNN: ht=f(ht−1,xt);CNN: yt=∑kwkxt+k;Attn: yt=∑sαtsxs\text{RNN}:\ h_t=f(h_{t-1},x_t);\quad \text{CNN}:\ y_t=\sum_k w_kx_{t+k};\quad \text{Attn}:\ y_t=\sum_s\alpha_{ts}x_s
⚡ Executive Summary
Core Concept: RNN 有序列递归偏置(顺序、可变长);CNN 有局部性/平移等变偏置;Transformer 偏置最弱(需数据学结构)。

📌 Key Takeaways

  • •
    RNN:顺序递归、可变长、O(1) 状态
  • •
    CNN:局部窗口、平移等变、可并行、感受野随层增长
  • •
    Transformer:全局内容依赖、无结构先验、O(L²)

📐 Mathematical Derivations

数学机理:<strong>归纳偏置(inductive bias)</strong> 指模型结构内置的假设。<strong>RNN</strong>——偏置是'<strong>顺序递归</strong>':h_t=f(h_{t−1},x_t),即'信息沿时间逐步累积'。这编码了'序列有顺序、历史影响未来'的假设。<strong>优点</strong>——(a) 天然处理可变长序列、(b) 推理状态 O(1)(流式友好)、(c) 对'顺序依赖强'的任务(如时间序列、状态机)合适。<strong>缺点</strong>——(a) 时间维<strong>不可并行</strong>(训练慢)、(b) 固定状态是<strong>信息瓶颈</strong>、梯度问题。<strong>CNN</strong>——偏置是'<strong>局部性 + 平移等变 + 权重共享</strong>':y_t=Σ_k w_k x_{t+k}。这编码了'邻近元素更相关、模式可在不同位置复用'的假设。<strong>优点</strong>——(a) <strong>时间维可并行</strong>(卷积是并行的)、(b) 局部模式提取高效、(c) 感受野随层数增长(堆叠可覆盖长距离)。<strong>缺点</strong>——局部窗口限制(需堆叠才能覆盖长距离)、对'任意长距离依赖'效率低(对比注意力的 O(1) 路径)。<strong>Transformer</strong>——偏置是'<strong>内容依赖的全局加权</strong>':y_t=Σ_s α_ts x_s,其中 α 依内容计算。<strong>优点</strong>——(a) <strong>任意两位置的路径长度 O(1)</strong>(直接交互,适合长距离依赖)、(b) 完全可并行、(c) 表达力最强(无结构约束)。<strong>缺点</strong>——(a) <strong>偏置最弱</strong>,故需<strong>大量数据</strong>学习结构(这是 ViT 需大数据的原因);(b) O(L²) 复杂度;(c) 需位置编码(无天然顺序)。<strong>总结</strong>——偏置强度:RNN > CNN > Transformer;<strong>偏置越强,样本效率越高但上限受限</strong>;偏置越弱,需要更多数据但上限更高。这一'先验-数据'权衡是架构选择的核心。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'偏置 vs 数据'的量化规律</strong>——强偏置(CNN/GNN)在小数据上表现好;弱偏置(Transformer)在大数据上超越。交叉点取决于任务与数据量(ViT 论文显示 ImageNet-1k 上不如 ResNet、JFT-300M 上超越)。② <strong>'并行性'是架构演进的驱动力</strong>——RNN → CNN → Transformer 的演进主线之一是'<strong>提升并行性</strong>':RNN 时间维串行(最慢)、CNN 局部并行、Transformer 完全并行。这与 GPU 算力的增长方向(并行度提升)一致。③ <strong>长距离依赖的效率</strong>——RNN 需 O(L) 步传递、CNN 需 O(L/w) 层堆叠、Transformer 只需 1 层(O(1) 路径);这解释了 Transformer 在长距离任务上的优势。④ <strong>'混合'是现实选择</strong>——实践中常组合:CNN 做局部特征提取 + Transformer 做全局建模(如 Conformer、部分 VLM);或 SSM + 注意力(见混合架构题)。⑤ <strong>'低资源'场景</strong>——数据少时,强偏置架构(CNN/GNN/RNN)通常更优;这也是'小数据用经典方法'的实践智慧。⑥ <strong>面试要点</strong>——被问'RNN/CNN/Transformer 怎么选',应给出'<strong>偏置强度(样本效率)+ 并行性 + 长距离效率 + 复杂度</strong>'四维对比,并说明'偏置越强样本效率越高但上限受限'这一核心权衡;能指出'并行性是演进主线'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    只看'哪个架构更强'而不看数据量与资源约束
  • ✕
    忽略偏置强度与样本效率的反比关系
🎯 Interviewer Follow-ups
  • ?
    为什么'偏置弱'既是不足也是优势?
  • ?
    哪个架构在低资源场景更优?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM4-092: Graph Neural Networks (GNN / GAT): 解释图神经网络与 Transformer 的关系。📋Back to BankNext →M4-094: Sequence Modeling Trade-offs: 什么场景仍应选择 RNN/LSTM?