Diffusion Model Pipeline Slicing & Multi-GPU Topology Placement distributes large-scale generative models (SDXL, Flux.1, SD3, DiT video generators) across heterogeneous GPU clusters by decomposing distinct functional sub-networks onto tailored hardware: 1) Text Encoders (CLIP ViT-L + T5-XXL, high VRAM
∼10GB but low compute, single forward pass); 2) Denoising Backbone (UNet / MM-DiT, 3B-12B parameters, executing 20-50 iterative denoising steps consuming
>90% compute); 3) VAE Image/Video Decoder (single pass post-processing, high resolution VRAM spikes); placing shared Text Encoders on host CPU/cost-effective GPUs while sharding the heavy DiT backbone via Tensor/Pipeline Parallelism and utilizing Tiled VAE decoders maximizes multi-GPU utilization.