返回 深度学习 思维导图
中文·English
🧠 深度学习ID: receptive-field-flops

感受野与 FLOPs 计算

Receptive Field & FLOPs
🎯核心定义
感受野(RF)是输出层某像素在原始输入上可见的区域大小, 递推公式 RFl=RFl1+(kl1)i=1l1siRF_l = RF_{l-1} + (k_l - 1)\prod_{i=1}^{l-1} s_i, 其中 klk_l 为第 ll 层核大小、sis_i 为第 ii 层 stride——stride 连乘项说明前置下采样会放大后续层的感受野。stride 全为 1 时简化为 RFl=RFl1+kl1RF_l = RF_{l-1} + k_l - 1; 数值例: 连续 3 层 3×3(stride 1)感受野为 7, 若第一层 stride=2, 第三层感受野 =7+2×2×1=11= 7 + 2 \times 2 \times 1 = 11。卷积 FLOPs: 每个输出像素做 khkwCink_h k_w C_{in} 次乘加(一次乘 + 一次加, 计 2), 共 2HoutWoutkhkwCinCout2 H_{out} W_{out} k_h k_w C_{in} C_{out}; 数值例: 224×224×64 输入上 3×3 卷积输出 128 通道, 2×224×224×9×64×1287.4×1092 \times 224 \times 224 \times 9 \times 64 \times 128 \approx 7.4 \times 10^9, 即约 7.4 GFLOPs。
💡使用场景
“手算 FLOPs/感受野”是 CNN 面试核心硬考点——估算模型算力、对比轻量模型(MobileNet 省多少)、回答“为什么堆叠小核”“为什么用空洞卷积”; 也是 ViT 全局注意力的对比基准。
解决的核心痛点
感受野递推把“网络看到多大区域”量化——堆叠 ll 层 3×3 得到 2l+12l+1, 使小核深层网络以更少参数获得与大核相同的全局视野; FLOPs 给出单位样本的乘加运算总量, 独立于参数量地度量推理算力, 是效率模型设计与硬件部署估算的统一标尺。
🎯5 个高频面试考点 (Exam Points)
1
手算感受野: 连续 3 层 3×3(stride=1)感受野多大? 若第一层 stride=2 呢? 写出递推过程。
2
手算 FLOPs: 224×224×64 输入上 3×3 卷积输出 128 通道, FLOPs 是多少? 为什么乘 2?
3
推导感受野递推公式 RFl=RFl1+(kl1)i=1l1siRF_l = RF_{l-1} + (k_l-1)\prod_{i=1}^{l-1} s_i, 解释 stride 连乘项的物理含义。
4
为什么堆叠两个 3×3 等于一个 5×5 的感受野, 但参数与计算量更少? 请给出数字。
5
标准卷积的 FLOPs 与哪些因子成正比? 如何快速估算一个网络的整体 FLOPs?
📖 关联深度指南:📄 cnn-and-vit-architectures
更新于 2026-08-12
🎯
检验攻克程度:针对「感受野与 FLOPs 计算」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点卷积与感受野下一个知识点经典 CNN 演进

🔗 更多 深度学习 知识点卡片

激活函数演进Adam/AdamWAutograd 动态图BatchNorm 批归一化