1详细画出 PagedAttention 中 Logical KV Blocks、Page Table 与 Physical GPU Memory Blocks 之间的虚拟地址映射流转图?
2连续批处理 (Continuous Batching) 相比传统静态批处理 (Static Batching) 为什么能将 GPU 计算单元 (Compute Cores) 的闲置气泡消除至接近 0?
3写时复制 (Copy-on-Write, CoW) 机制在束搜索 (Beam Search) 与多分支 Agent 并行生成(多采样 Sample 共享同一 Prompt)中的显存共享原理?
4Chunked Prefill (分块预填充): 如何通过将长 Prompt 切分并与 Decode 请求共同打包进同一个 Batch,彻底消除长 Prompt 带来的服务卡顿与抖动?
5张量并行 (Tensor Parallelism, TP) 与流水线并行 (Pipeline Parallelism, PP) 在 vLLM 多卡分布式推理中的配置与通信开销分析?