M3-097M3: Deep Learning FoundationsConvolution & Vision FoundationsEasy
Mastery:

Convolution & Vision Foundations: 计算卷积层的参数量与输出尺寸。

📐 Mathematical Definition
params=k2CinCout+Cout;Hout=⌊H+2P−kS⌋+1\text{params}=k^2 C_{in}C_{out}+C_{out};\qquad H_{out}=\left\lfloor\frac{H+2P-k}{S}\right\rfloor+1
⚡ Executive Summary
Core Concept: 参数量 = k²·C_in·C_out + C_out(含 bias);输出尺寸 = ⌊(H+2P−k)/S⌋+1。

📌 Key Takeaways

  • •
    参数量与输入空间尺寸无关(权重共享)
  • •
    输出尺寸由 padding P、stride S、核 k 决定
  • •
    感受野随层数增长,'有效感受野'小于理论值

📐 Mathematical Derivations

数学机理:<strong>参数量</strong>——一个卷积层有 C_out 个滤波器,每个滤波器是 k×k×C_in 的权重张量(对每个输入通道有独立的 k×k 核),故参数量 = k²·C_in·C_out,加 C_out 个 bias。<strong>关键性质</strong>:参数量<strong>与输入的空间尺寸(H、W)无关</strong>——因为同一组权重在所有位置滑动使用(权重共享),这是 CNN 参数效率的来源(对比全连接层:参数量 ∝ H·W·C_in·C_out,随图像尺寸爆炸)。<strong>输出尺寸</strong>——卷积在每个位置计算'k×k 窗口与权重的内积',窗口以 stride S 滑动,加 P 圈 padding;输出尺寸 H_out=⌊(H+2P−k)/S⌋+1(向下取整,因为不足一个窗口的部分被丢弃)。<strong>'same' 卷积</strong>(输出尺寸=输入)要求 P=(k−1)/2(k 为奇数)且 S=1。<strong>感受野</strong>——单层的感受野为 k×k;L 层堆叠(每层 k×k、stride 1)的感受野为 1+L·(k−1)(线性增长);含 stride 时按累积 stride 放大。<strong>有效感受野</strong>(实际影响输出的区域)通常小于理论感受野,且近似高斯分布(中心权重大、边缘小)——这是'深层小核优于浅层大核'的原因之一(VGG 用 3×3 堆叠替代大核)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>3×3 堆叠 vs 大核</strong>——两个 3×3 卷积的感受野等于一个 5×5,但参数更少(2·9=18 vs 25)、非线性更多(两次 ReLU)、故表达能力更强;这是 VGG 的核心论证。② <strong>dilation(空洞卷积)</strong>——在不增参数的情况下扩大感受野(核元素间插入空洞),用于分割(DeepLab)与语音;代价是'网格效应'(采样稀疏)。③ <strong>stride 与下采样</strong>——stride>1 同时降分辨率与扩感受野;但会丢失信息,故现代架构常用'stride 1 + pooling'或'可分离下采样'替代。④ <strong>计算量(FLOPs)</strong>——FLOPs = k²·C_in·C_out·H_out·W_out(参数量 × 输出空间尺寸);这是'为什么深而窄优于浅而宽'的量化依据。⑤ <strong>'same' padding 的边界效应</strong>——零填充会在边界引入'虚假的零',故有用 reflect/replicate padding 的变体。⑥ <strong>面试要点</strong>——被问'算一下这个卷积层',应能同时给出<strong>参数量与 FLOPs</strong>(前者与空间尺寸无关、后者有关),并解释'3×3 堆叠为何优于大核';这是 CV 基础题的高分回答。
⚠️ Common Interview Pitfalls
  • ✕
    混淆参数量与 FLOPs(后者含空间尺寸)
  • ✕
    忘记向下取整导致输出尺寸算错
🎯 Interviewer Follow-ups
  • ?
    为什么参数量与输入尺寸无关?
  • ?
    如何用 stride 与 dilation 扩大感受野?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM3-096: Architecture Building Blocks: 解释参数共享的几种形式与作用。📋Back to BankNext →M3-098: Convolution & Vision Foundations: 解释感受野(receptive field)的递归计算。