⚡LAYER 02
02. Compute, Network & Cloud Infrastructure
Orchestrating massive GPU clusters with non-blocking RDMA fabrics, high-throughput checkpoint storage, and scalable cloud scheduling.
🔄Sub-Domain Sequential Path (4 stages):
10K+ GPU supercomputing clusters, rack-scale topologies, rail-optimized networks, DCGM telemetry, MIG partitioning, and automated fleet self-healing.
10K+ GPU SuperPOD Clusters & Topologies
Rack-scale GPU systems, non-blocking fat-tree fabrics, rail-optimized network design, fault-domain isolation, and 10K+ GPU scaling efficiency optimization.
🛠️ Tech Stack
GPU ClusterSuperPODFat-TreeRail-OptimizedFault DomainsScaling EfficiencyBespoke AI Cloud
💼 Roles & Salary
GPU Infrastructure Engineer、HPC Engineer、Cluster Engineer
💰 $220K - $460K / year (AI Cloud Infra) | ¥600K - ¥1.5M / year
GPU Fleet Operations & Node Health Automation
NVIDIA DCGM continuous telemetry, Multi-Instance GPU (MIG) slicing, bare-metal provisioning, firmware lifecycle automation, and self-healing node drain pipelines.
🛠️ Tech Stack
DCGMMIG SlicingFleet ReliabilityBare-metal ProvisioningFirmware LifecycleNode RemediationSLO Monitoring
💼 Roles & Salary
GPU Infrastructure Engineer、Fleet Reliability Engineer、DevOps / SRE
💰 $195K - $420K / year (Fleet Reliability) | ¥500K - ¥1.3M / year
⬇
NVLink/NVSwitch fabrics, InfiniBand NDR/XDR, RoCEv2 lossless Ethernet, PFC/ECN congestion control, NCCL collectives tuning, and 800G/1.6T high-speed optics.
NVLink & InfiniBand / RoCE RDMA Fabrics
1.8TB/s inter-GPU NVLink, cross-node zero-copy RDMA, Priority Flow Control (PFC), ECN/DCQCN congestion control, NCCL collective tuning, and DPU/SmartNIC hardware offloading.
🛠️ Tech Stack
NVLinkInfiniBand NDRRoCEv2RDMA VerbsNCCLPFC / ECNDPU OffloadLossless Ethernet
💼 Roles & Salary
RDMA Systems Engineer、Network Engineer、Network Performance Engineer
💰 $210K - $440K / year (RDMA & AI Fabrics) | ¥550K - ¥1.4M / year
800G/1.6T Optics & Network Telemetry
800G/1.6T high-density optical transceivers (OSFP/QSFP-DD), Co-Packaged Optics (CPO), silicon photonics, In-band Network Telemetry (INT), and real-time BER link quality monitoring.
🛠️ Tech Stack
800G/1.6T OpticsSilicon PhotonicsCPOOSFPIn-band TelemetryEye DiagramBER Monitoring
💼 Roles & Salary
Optical Systems Engineer、Network Performance Engineer、Network Engineer
💰 $200K - $420K / year (Optical Networks) | ¥500K - ¥1.3M / year
⬇
Lustre, GPFS, Weka, VAST Data DASE flash architecture, NVMe-oF, GPUDirect Storage (GDS), and sub-minute multi-TB checkpoint persistence.
Parallel File Systems & Distributed Storage
High-concurrency parallel training I/O: Lustre, IBM GPFS (Storage Scale), Weka filesystem, VAST Data DASE architecture, NVMe-oF, and horizontal POSIX metadata scaling.
🛠️ Tech Stack
LustreGPFS / Storage ScaleWekaVAST DataNVMe-oFPOSIX FilesystemMetadata Scaling
💼 Roles & Salary
Storage Engineer、Distributed Systems Engineer、Data Infrastructure Engineer
💰 $195K - $410K / year (AI Storage Systems) | ¥500K - ¥1.25M / year
GPUDirect Storage, Tiering & Checkpoint IO
NVIDIA GPUDirect Storage (GDS direct-to-GPU IO), multi-tier caching (DRAM/NVMe/Object), sub-minute multi-TB checkpointing, and non-blocking asynchronous persistence pipelines.
🛠️ Tech Stack
GPUDirect Storage (GDS)Checkpoint IOMulti-tier CachingZero-Copy IOMinIOData Locality
💼 Roles & Salary
Storage Engineer、I/O Performance Engineer、Distributed Systems Engineer
💰 $190K - $400K / year (I/O & Checkpointing) | ¥480K - ¥1.2M / year
⬇
2.4
2.4 GPU Scheduling, Multi-tenancy & Cloud Control Plane
Open Sub-Page➔Kubernetes (GPU Operator/Kueue/Volcano), Slurm batch queues, Ray distributed execution, Gang scheduling, MIG multi-tenancy, and FinOps GPU cost governance.
Kubernetes & Slurm GPU Scheduling & Orchestration
NVIDIA GPU Operator automated management, Kueue/Volcano batch queues, Slurm HPC workload management, Gang scheduling, and topology-aware GPU placement.
🛠️ Tech Stack
KubernetesSlurmGPU OperatorKueueVolcanoGang SchedulingTopology-Aware Placement
💼 Roles & Salary
Platform Engineer、Scheduler Engineer、Cloud Infrastructure Engineer、DevOps / SRE
💰 $185K - $390K / year (Cloud K8s & Scheduling) | ¥450K - ¥1.15M / year
Ray Distributed Execution, Multi-Tenancy & FinOps
Ray Core / KubeRay elastic execution graphs, Run:ai dynamic pooling, MIG hardware partitioning, Fair-share quotas, and Spot/preemptible FinOps cost optimization.
🛠️ Tech Stack
Ray / KubeRayRun:aiMulti-tenancyFair-share QuotasFinOpsSpot InstancesGPU Pooling
💼 Roles & Salary
Platform Engineer、Scheduler Engineer、FinOps Engineer、DevOps / SRE
💰 $180K - $380K / year (Ray & Cloud FinOps) | ¥420K - ¥1.1M / year