返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: pre-ranking-architecture

粗排轻量模型与向量相似度剪枝

Pre-Ranking Lightweight Architecture
🎯核心定义
粗排轻量模型架构 (Pre-Ranking / Match-Filtering Layer) 是连接多路召回与重精排之间的承上启下模块;它在 5ms 极严苛延迟预算 内,对多路召回合并后的上万个候选物品 (10410^4) 进行初步打分与快速剪枝,输出最优质的千级候选 (10310^3) 送入精排;主流工业架构包括:1) 向量粗排 (双塔粗排模型直接点积排序);2) 蒸馏轻量 DNN / COLD (基于精排复杂模型蒸馏得到的小型 2-3 层 MLP,与精排共享底层 Embedding 表);3) FSCD (特征选择与可分离特征交叉算子)。
💡使用场景
召回候选路数多(数十路召回合并后达 50,000+ 物品)、精排算力成本高昂的大型推荐与搜索广告系统。
解决的核心痛点
若直接让精排模型对 10,000+ 物品打分,算力与耗时超标 10 倍以上;若不设粗排直接暴力截断,会破坏多路召回的跨通道多样性并遗漏大量潜在高价值爆款;粗排以精排 5% 的算力成本筛选出 90% 的精排 Top 候选。
🎯5 个高频面试考点 (Exam Points)
1
详细对比双塔粗排 (Two-Tower Pre-ranking) 与轻量交互粗排 (COLD / Light DNN) 在特征表达力与算力延迟上的权衡?
2
粗排与精排共享 Embedding 表 (Shared Embedding) 时,如何防止粗排梯度回传破坏精排高精度的 Embedding 表征?
3
知识蒸馏在粗排模型训练中的应用:如何以精排模型的 Soft-Target 预估分为教师信号训练轻量粗排网络?
4
粗排的评估指标:为什么粗排的核心指标不仅看单独的 AUC,更要看与精排 Top-K 结果的命中重合率 (Top-K Overlap / Hit Rate)?
5
在千级候选打分时,如何在 C++ 推理引擎中利用 SIMD 与模型量化 (INT8/FP16) 压榨极致的算力吞吐?
更新于 2026-08-14
🎯
检验攻克程度:针对「粗排轻量模型与向量相似度剪枝」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点YouTube DNN 召回架构下一个知识点DeepFM 因子分解机精排模型

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回DCN-v2 深度特征交叉网络MMoE 多门控专家混合模型