返回 大语言模型 思维导图
中文·English
大语言模型ID: bpe-tokenization

分词 BPE/WordPiece

Tokenization: BPE / WordPiece
🎯核心定义
BPE (Byte Pair Encoding, 字节对编码) 是一种子词(subword)分词算法:从字节/字符级最小单位出发,统计相邻符号对的共现频率,每次迭代把最高频的字节对合并成一个新符号并加入词表,直到词表达到预定大小 VV;编码时按最长子词贪心匹配。GPT/LLaMA/Qwen 等主流 LLM 采用字节级 BPE,词表通常为 3-15 万。
💡使用场景
大模型预训练与推理前的分词阶段;需要覆盖多语言与代码(字节级可编码任意 UTF-8 文本、无未登录词)、在固定上下文窗口内控制 token 数量,以及处理复合/黏着语言(德语、中文等)的子词切分。
解决的核心痛点
词级分词词表巨大且遇新词即 OOV;字符级分词每个词需 4-6 个 token,白白占用上下文窗口。BPE 以 3-15 万规模的词表即可编码任意文本,平均每个英文单词约 1-2 个 token,在词表规模、序列长度与跨语言覆盖之间取得平衡。
🎯5 个高频面试考点 (Exam Points)
1
BPE 的训练过程:从什么单位开始,每次迭代做什么,何时停止?
2
为什么 LLM 词表普遍在 3-15 万?词表过大/过小的权衡?
3
字节级 BPE 如何保证任意 Unicode 文本没有未登录词 (OOV)?
4
BPE 与 WordPiece、Unigram 的选择准则分别是什么?
5
tokenizer 对模型的影响:平均一个英文单词几个 token?多语言/代码表现?
📖 关联深度指南:📄 tokenizer-and-sampling
更新于 2026-08-12
🎯
检验攻克程度:针对「分词 BPE/WordPiece」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点训练目标与优化器细节下一个知识点文本嵌入 Embeddings

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA