1详细对比 SSE (Server-Sent Events) 与 WebSocket 在连接开销、双向通信、代理网关缓冲 (Nginx Buffering) 与断线重连机制上的差异?
2Nginx 代理层配置:为什么必须显式配置 `proxy_buffering off;` 和 `X-Accel-Buffering: no;` 才能防止网关缓冲大模型流式 Token?
3大模型推理服务(如 vLLM / TensorRT-LLM)中的 Token 生成器与异步协程背压:如何通过 AsyncGenerator 队列防止消费者过慢导致的显存/内存泄漏?
4长连接连接池管理与负载均衡:如何避免数万个长连接导致特定后端网关节点连接数倾斜 (Connection Skew)?
5客户端异常断线检测与推理中断 (Client Disconnect Abort):当用户主动点击“停止生成”或关闭网页时,如何跨服务通知 GPU 即刻终止该 Request 的 KV Cache 计算?