GPU 训练/推理的硬件底座是「算力 + 显存带宽 + 显存容量」三个维度的组合。以 H100 SXM 为基准: 80GB HBM3, 带宽 3.35TB/s; FP16/BF16 密集算力 989 TFLOPS(稀疏 1979), FP8 1979 TFLOPS; L2 50MB、132 个 SM(每 SM 228KB 共享内存 SRAM)。显存层级自快到慢: 寄存器(每 SM 256KB)→ 共享内存 SRAM → L2(50MB)→ HBM(80GB)→ 主机内存/NVMe, 带宽逐级下降约一个数量级、容量逐级上升。
内存墙: 70B 模型 FP16 权重 140GB, 以 3.35TB/s 搬运一遍需
3.35TB/s140GB≈42ms; 而单 token 前向计算量约
2×70B=140GFLOP, 在 989 TFLOPS 下仅需
≈0.14ms——搬运与计算比约 300:1, 权重驻留 HBM、每次使用都要全量读出的训练/推理流程被显存带宽锁死(带宽受限)。算术强度(arithmetic intensity)
I=byteFLOP 是判断依据: H100 平衡强度约
3.35TB/s989TFLOP/s≈295FLOP/byte, 低于它为带宽受限(LayerNorm、激活、逐元素算子), 高于它为算力受限(大矩阵乘)。