返回 大语言模型 思维导图
中文·English
大语言模型ID: embeddings

文本嵌入 Embeddings

Text Embeddings
🎯核心定义
文本嵌入 (Text Embeddings) 将 token 或整句/整段文本映射为稠密低维实数向量,使语义相近的文本在向量空间中距离相近。token 级嵌入来自词表嵌入表 ERV×dE \in \mathbb{R}^{V \times d} (VV 为词表大小、dd 为隐藏维度);句子级嵌入通常取 CLS token 的输出向量或对全部 token 向量做 mean pooling,再用余弦相似度度量语义相似性。
💡使用场景
RAG 检索(文档库离线编码为向量库、查询向量做近邻搜索)、语义搜索与问答召回、文本聚类与去重、领域检索的嵌入模型微调;也是向量数据库 ANN 近邻检索的底层表示,衔接知识库问答链路。
解决的核心痛点
词袋/One-hot 表示维度高达 VV(10 万级)且不含语义,无法表达“国王 − 男 + 女 ≈ 女王”这类语义关系;嵌入把语义压缩进 dVd \ll V 维稠密空间,余弦相似度取值在 [1,1][-1, 1],使语义检索取代关键词匹配。例如 V=10V=10 万、d=4096d=4096 时,仅嵌入表就有约 4 亿参数 (FP32 约 1.6GB),可见高维稀疏表示更不可行。
🎯5 个高频面试考点 (Exam Points)
1
token 级与句子级嵌入的区别?CLS 与 mean pooling 各自适用什么?
2
为什么用余弦相似度而不是内积或 L2 距离?其取值范围是什么?
3
Embedding 在 RAG 中的完整流程:离线建索引、在线 ANN 检索、重排序?
4
词表嵌入表 ERV×dE \in \mathbb{R}^{V \times d} 的参数量与显存如何估算?
5
静态词向量 (Word2Vec) 与上下文相关表示 (Transformer 层输出) 的差异?
📖 关联深度指南:📄 tokenizer-and-sampling
更新于 2026-08-12
🎯
检验攻克程度:针对「文本嵌入 Embeddings」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点分词 BPE/WordPiece下一个知识点填充与打包 Padding/Packing

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA