1详细画出用户客户端、Nginx / Envoy 反向代理网关、FastAPI 中间层与 vLLM 推理引擎之间的 SSE 流式长连接与取消信号 (Abort Signal) 流转图?
2Nginx / Load Balancer 缓冲配置避坑:为什么必须显式配置 `proxy_buffering off;` 与 `X-Accel-Buffering: no` 才能保证 Token 实时流式吐出?
3WebSocket vs Server-Sent Events (SSE) vs gRPC 双向流在现代大模型对话系统架构中的全方位对比选型?
4客户端意外断开 (Client Disconnect) 的心跳探测与 GPU 任务主动取消:如何在 FastAPI 中利用 `request.is_disconnected()` 触发异步取消?
5流式输出中的 Markdown 语法闭合与代码高亮:前端如何平滑渲染正在打字机输出中尚未闭合的代码块三反引号?