队列深度驱动的 GPU 弹性自动扩缩容体系 (Queue-Depth-Driven GPU Autoscaling Architecture,如 Kubernetes KEDA, Karpenter, AWS Auto Scaling with Custom Prometheus Metrics) 是多模态重算力生成集群在应对剧烈波动的波峰波谷流量时,实现“低延迟排队交付”与“数百万美元云端 GPU 成本极致节约”的核心弹性控制系统;传统基于 CPU/GPU 利用率的 HPA (Horizontal Pod Autoscaler) 在重任务排队时完全失真(由于 GPU 即使在处理单个请求时利用率也是 100%,无法感知队列中堆积的 1000 个待处理请求);该体系采用“消息队列积压深度 (Queue Backlog Length
L)”与“任务目标平均排队延迟
Ttarget”作为核心扩缩容指标,计算所需目标 GPU 副本数
R=⌈C×TtargetL⌉(
C 为单卡每秒处理能力),并结合冷启动预热镜像池与 Spot 竞价实例,在数分钟内实现百卡集群的弹性伸缩。