1基于 Go (Goroutines) / Rust (Tokio) 设计高性能异步检索网关的并发扇出 (Fan-out) 与聚合 (Fan-in) 模式?
2倒数排名融合算法 (RRF:
RRF(d)=∑m=1M60+rm(d)1) 在融合 BM25 得分与 Dense Cosine 得分时的数学无偏性?
3Cross-Encoder 重排序模型(如 BGE-Reranker-Large)的 GPU 显存占用与推理耗时优化(量化 TensorRT-LLM / ONNX Runtime)?
4子查询并行拆解 (Sub-Query Decomposition: 将“对比 iPhone 15 与小米 14 的续航”拆为两个并行 Query) 的聚合与去重设计?
5当某个底层向量库节点发生网络超时(如超过 30ms 阈值)时,网关的自动短路与基于 BM25 结果的降级保底机制?