返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: collective-communication-nvlink

集合通信与 NVLink 拓扑

Collective Comm & NVLink Topology
🎯核心定义
多卡训练的一切同步都可归结为集合通信原语。设每卡持有数据分片 SS 字节、共 N 卡: ① AllGather(各卡把自己的分片广播给其余 N−1 卡, 最终每卡持有全部 NSNS 字节): 每卡需要接收 N−1 个分片, 通信量 (N1)S(N-1)S——每卡数据被其余 N−1 卡各读一遍; ② ReduceScatter(各卡数据归约后只保留自己那份结果): 每卡 N1NS\frac{N-1}{N}S; ③ AllReduce(归约后分发给所有卡)= ReduceScatter + AllGather 两步: 环形实现下每卡 2N1NS2S2\frac{N-1}{N}S \to 2S(N 很大时每卡只传自己数据的两倍, 带宽与 N 无关); ④ AllToAll(每卡把数据发给其余所有卡、也接收来自所有卡)——MoE 专家并行的 token 路由就是 AllToAll: 均匀负载时每卡 N1NS\frac{N-1}{N}S。硬件带宽对比: NVLink 4.0(H100)每卡 900GB/s, NVLink 5.0(B200/GB200)每卡 1.8TB/s; InfiniBand 800Gbps(XDR)= 100GB/s, 400Gbps(NDR)= 50GB/s——NVLink 5.0 是单条 IB 800Gbps 的约 18 倍。轨优化(rail-optimized)拓扑: 每个节点的第 i 张 GPU 的网卡接入同一台叶交换机(第 i 条“轨”), 跨节点通信固定发生在同号 GPU 之间, 避免 AllReduce/AllGather 流量在多条轨之间横跳造成热点与拥塞; 配合节点内 NVSwitch 全互连与节点间叶脊/3D-Torus, 构成 NCCL 的顶层拓扑设计。
💡使用场景
训练 Infra 面试的核心模块(是 distributed-parallel 的前置): “推导 Ring-AllReduce 通信量”“AllGather 和 AllReduce 差多少”“MoE 为什么用 AllToAll”“NVLink 和 IB 差几个数量级”“什么是轨优化”。
解决的核心痛点
让 N 卡同步的开销从朴素的 O(NS)O(NS)(每卡把全量数据发给其余 N−1 卡)降到 O(S)O(S) 量级——带宽不随卡数增长, 并行规模才能扩展到数百上千卡; 同时用 NVLink 的高带宽承载 TP 这类高频小消息通信、用 IB 承载跨节点梯度同步, 并靠拓扑设计让两种流量都不打结。
🎯5 个高频面试考点 (Exam Points)
1
手算 AllGather 通信量: 每卡分片 SS、N 卡, 每卡最终持有 NSNS, 需新接收 (N1)S(N-1)S 字节——推导它为什么随 N 线性增长而 Ring-AllReduce 不随 N 增长。
2
把 AllReduce 拆成 ReduceScatter + AllGather 两阶段: 各阶段数据量(N1NS\frac{N-1}{N}S(N1)S(N-1)S)与步数(N−1)各是多少, 相加验证总量 2N1NS2\frac{N-1}{N}S
3
MoE 专家并行为什么是 AllToAll 而不是 AllGather: token 按专家 ID 路由、每卡发给所有卡也接收所有卡; 均匀负载下通信量 N1NS\frac{N-1}{N}S 与 AllReduce 的对比。
4
背 NVLink/IB 数字: NVLink 4.0 = 900GB/s、NVLink 5.0 = 1.8TB/s、IB 800Gbps = 100GB/s、400Gbps = 50GB/s; 算 NVLink 5.0 是 IB 800Gbps 的多少倍(≈18×), 并说明为什么 TP 必须走 NVLink 而 DP 可以走 IB。
5
描述轨优化(rail-optimized)拓扑: 每节点第 i 张 GPU 接同一台叶交换机构成“轨”; 它解决了什么问题(同号卡之间通信、避免跨轨横跳热点), 与 NVSwitch、叶脊拓扑的关系。
📖 关联深度指南:📄 distributed-parallelism
更新于 2026-08-12
🎯
检验攻克程度:针对「集合通信与 NVLink 拓扑」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点GPU 硬件与 HBM下一个知识点4D 并行 DP/TP/PP/SP

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复