条件
c (如 CLIP 文本嵌入) 通过
交叉注意力注入 U-Net/DiT 的中间层; 采样完成后的
z0 经
VAEdec 还原高分辨率图像。整体训练损失含三项: 潜空间扩散重建 + 感知损失 (LPIPS) + 对抗/GAN 项, 并施加轻微 KL 正则, 兼顾像素级逼真与感知质量。架构演进: SD1/2 用 U-Net (自注意力 + 交叉注意力 + 时间嵌入), SD3/Flux 用 MMDiT (混合文本-图像 DiT, patchify + AdaLN-zero 注入时间步与文本条件)。