返回 工业系统设计 思维导图
中文·English
🏗️ 工业系统设计ID: query-understanding-pipeline

Query 理解、分词与意图分类

Query Understanding Pipeline
🎯核心定义
Query 理解流水线 (Query Understanding Pipeline, QU) 是现代搜索引擎与电商搜索系统的最前端认知中枢;它在用户提交搜索词后、执行物理检索之前,通过一套极速(<5ms<5\text{ms})级联 NLP 模块对原始 Query 进行深度解析与意图结构化:1) 文本清洗与规范化 (Normalization: 去除无意义标点、繁简转换、全半角归一);2) 错别字智能纠错 (Spelling Correction: 拼音流、编辑距离与语言模型纠偏);3) 命名实体识别与词权重分析 (NER & Term Weighting: 识别品牌、品类、型号、属性,并计算各词的核心度权重);4) 同义词扩展与 Query 改写 (Synonym Expansion: 如“苹果手机”扩展为“iPhone”);5) 意图分类与类目预测 (Intent Classification & Category Prediction: 判断是精准找货、泛搜索、比价还是导航意图,并预测类目概率分布)。
💡使用场景
淘宝/京东电商搜索入口、Google/百度全网通用搜索、站内垂直搜索与企业知识库检索。
解决的核心痛点
原始用户搜索词极度简短(平均 2-3 个词)、口语化、常伴随错别字与多义歧义;Query 理解流水线将模糊文本转化为包含结构化实体标签、类目过滤约束与权重增强的规整查询树,从源头上决定了召回的精准度。
🎯5 个高频面试考点 (Exam Points)
1
详细剖析 Term Weighting (词权重计算) 算法:如何通过结巴/深度模型计算核心实体词与辅助修饰词的权重差异并在检索中加权?
2
基于 Transformer 序列标注的电商多目标 NER (实体识别: 品牌/品类/属性/型号) 在低延迟 C++ 推理引擎中的加速方案?
3
Query 纠错系统中的候选召回(基于 Trie 字典树、编辑距离、拼音索引)与基于统计语言模型打分排序的两阶段架构?
4
同义词扩展 (Synonym Expansion) 如何防止过度泛化(如“苹果”在不同上下文中被误扩展为水果或手机)的上下文消歧机制?
5
电商搜索中的类目预测 (Category Prediction) 如何通过强行注入类目硬过滤或软提权 (Category Boosting) 避免搜索结果风马牛不相及?
📖 关联深度指南:📄 search-and-ad-system-design
更新于 2026-08-14
🎯
检验攻克程度:针对「Query 理解、分词与意图分类」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点推荐在线 A/B 实验与 Interleaving下一个知识点分布式倒排索引与跳表求交

🔗 更多 工业系统设计 知识点卡片

推荐多阶段漏斗与 50ms SLADSSM 双塔向量化召回YouTube DNN 召回架构粗排轻量模型与向量相似度剪枝