M7-025M7: Retrieval, Ranking & RecSysHybrid Retrieval & RRF FusionHard
Mastery:

Hybrid Retrieval & RRF Fusion: 解释检索系统的延迟预算与级联设计。

📐 Mathematical Definition
budget: tretrieve+trank≤tSLA;candidates: 106→103→102→10\text{budget}:\ t_{\text{retrieve}}+t_{\text{rank}}\le t_{\text{SLA}};\qquad \text{candidates}:\ 10^6\to10^3\to10^2\to10
⚡ Executive Summary
Core Concept: 多阶段级联(召回→粗排→精排→重排)各阶段有延迟预算;候选数逐级减少、模型逐级变强。

📌 Key Takeaways

  • •
    级联:召回(百万级)→ 粗排(千级)→ 精排(百级)→ 重排(十级)
  • •
    每级的候选数减少、模型复杂度增加(算力预算内)
  • •
    延迟预算:总延迟需满足 SLA;各阶段分配预算

📐 Mathematical Derivations

数学机理:<strong>级联(cascade)的必要性</strong>——(1) <strong>算力约束</strong>——用最强的模型(如 cross-encoder/LLM)对<strong>百万级</strong>文档打分<strong>不可行</strong>(算力 ∝ 候选数 × 单次成本);故需<strong>逐级筛选</strong>:先用<strong>廉价</strong>方法把候选从百万降到千,再用<strong>中等</strong>方法降到百,最后用<strong>昂贵</strong>方法精排几十个。(2) <strong>典型级联</strong>——(a) <strong>召回(retrieval)</strong>——百万~十亿级 → 取 top-1000(用倒排/ANN,毫秒级);(b) <strong>粗排(pre-ranking)</strong>——千级 → 取 top-100~200(用轻量模型/双塔,十毫秒级);(c) <strong>精排(ranking)</strong>——百级 → 取 top-10~20(用较重模型/交叉编码器,几十毫秒);(d) <strong>重排(re-ranking)</strong>——十级 → 最终排序(用最重模型/LLM/多样性/业务规则,可到百毫秒)。(3) <strong>延迟预算(latency budget)</strong>——总延迟需满足 <strong>SLA</strong>(如 P99 < 200ms);各阶段分配预算:召回(20ms)+ 粗排(30ms)+ 精排(80ms)+ 重排(50ms)+ 网络/融合(20ms)。(4) <strong>预算分配原则</strong>——(a) <strong>上游快、下游准</strong>(因为上游候选多);(b) <strong>按'边际收益'分配</strong>(增加某阶段的算力带来多少 NDCG 提升);(c) <strong>并行化</strong>(多路召回并行、多阶段可流水线);(d) <strong>降级策略</strong>(超时则跳过下游阶段或返回上游结果)。<strong>为什么级联有效</strong>——(a) <strong>每级的候选数减少 → 可用更强的模型</strong>;(b) <strong>总算力可控</strong>(因为'昂贵模型只跑少量候选');(c) <strong>每级的'召回率'需保证</strong>(上游漏掉的无法补救——故<strong>召回阶段的目标是'高召回'</strong>,宁滥勿缺)。<strong>关键设计点</strong>——(a) <strong>上游的召回率</strong>(最重要的指标);(b) <strong>各阶段的'漏斗比例'</strong>(如 1000→100→10);(c) <strong>各阶段的'增量收益'</strong>(哪一阶段对最终效果贡献最大);(d) <strong>延迟的瓶颈定位</strong>(哪一阶段最慢)。<strong>与其他技术的关系</strong>——(a) 与 M6 的'VLM 两阶段(粗筛+细看)'同源;(b) 与'多路召回'配合(多路是'召回阶段'的横向扩展,级联是'纵向'的)。<strong>实践建议</strong>——(a) <strong>保证上游召回率</strong>(Recall@1000 要高);(b) <strong>按边际收益分配算力</strong>;(c) <strong>并行 + 流水线</strong>(降延迟);(d) <strong>降级策略</strong>(保可用性);(e) <strong>监控各阶段</strong>(漏斗比例、延迟、贡献)。<strong>度量</strong>——(a) 各阶段的召回率/NDCG;(b) 各阶段延迟(P50/P99);(c) 端到端 NDCG 与 SLA 达标率;(d) 各阶段的'增量收益'。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'上游快、下游准'是级联的核心逻辑</strong>——因为上游候选多(只能用廉价方法);面试中能给出'百万→千→百→十'的漏斗是深度理解的标志。② <strong>'上游召回率最重要'</strong>——上游漏掉的无法补救;故召回阶段的目标是'高召回'(宁滥勿缺)。③ <strong>'按边际收益分配算力'</strong>——不是所有阶段都值得投入;应用实验确定'哪一阶段的算力提升带来最多 NDCG'。④ <strong>'降级策略'保可用性</strong>——超时时应返回部分结果(而非失败);这是生产系统的必需。⑤ <strong>'各阶段的增量收益'</strong>——若某阶段(如重排)贡献很小,可考虑砍掉(省成本);故需量化。⑥ <strong>面试要点</strong>——被问'检索系统的延迟怎么控',应给出'<strong>级联(百万→千→百→十)+ 各阶段延迟预算 + 上游保召回 + 按边际收益分配 + 降级</strong>';能给出具体的漏斗与预算数字是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用最强模型对全部候选打分(算力不可行)
  • ✕
    不保证上游召回率(下游无法补救)
🎯 Interviewer Follow-ups
  • ?
    为什么需要级联(而非一步到位)?
  • ?
    如何给各阶段分配延迟预算?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM7-024: Hybrid Retrieval & RRF Fusion: 解释学习式融合与权重调优。📋Back to BankNext →M7-026: Hybrid Retrieval & RRF Fusion: 解释召回-排序的目标错配与端到端训练。