扩散模型切片与多 GPU 拓扑放置架构 (Diffusion Model Pipeline Slicing & Multi-GPU Topology Placement) 是在部署百亿参数扩散模型(如 SDXL, Flux.1, SD3, DiT-based Sora-scale Video Models)时,根据模型内部异构子组件的计算与显存特性,将网络进行合理切片并放置到不同 GPU 硬件上的分布式服务编排技术;标准扩散系统包含三大性质迥异的子模块:1) 文本编码器 (Text Encoders: 如 CLIP ViT-L + T5-XXL,计算量小但显存占用大
∼10GB,仅前向单次);2) 扩散去噪主干 (Denoising Backbone: UNet 或 MM-DiT,参数量 3B~12B,需自回归迭代 20~50 步,占总计算量的
90%+);3) VAE 图像/视频编解码器 (VAE Decoder: 单次前向,高分辨率下显存激增但无需多步迭代);通过将 Text Encoder 共享放置于 CPU/廉价 GPU,主去噪网络采用张量并行 (Tensor Parallelism) 跨多卡切分,VAE 采用分块切片解码 (Tiled VAE),最大化多卡流水线吞吐。