TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
分词 BPE/WordPiece
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
bpe-tokenization
分词 BPE/WordPiece
Tokenization: BPE / WordPiece
🎯
核心定义
BPE (Byte Pair Encoding, 字节对编码) 是一种子词(subword)分词算法:从字节/字符级最小单位出发,统计相邻符号对的共现频率,每次迭代把最高频的字节对合并成一个新符号并加入词表,直到词表达到预定大小
V
V
V
;编码时按最长子词贪心匹配。GPT/LLaMA/Qwen 等主流 LLM 采用字节级 BPE,词表通常为 3-15 万。
💡
使用场景
大模型预训练与推理前的分词阶段;需要覆盖多语言与代码(字节级可编码任意 UTF-8 文本、无未登录词)、在固定上下文窗口内控制 token 数量,以及处理复合/黏着语言(德语、中文等)的子词切分。
⚡
解决的核心痛点
词级分词词表巨大且遇新词即 OOV;字符级分词每个词需 4-6 个 token,白白占用上下文窗口。BPE 以 3-15 万规模的词表即可编码任意文本,平均每个英文单词约 1-2 个 token,在词表规模、序列长度与跨语言覆盖之间取得平衡。
🎯
5 个高频面试考点 (Exam Points)
1
BPE 的训练过程:从什么单位开始,每次迭代做什么,何时停止?
2
为什么 LLM 词表普遍在 3-15 万?词表过大/过小的权衡?
3
字节级 BPE 如何保证任意 Unicode 文本没有未登录词 (OOV)?
4
BPE 与 WordPiece、Unigram 的选择准则分别是什么?
5
tokenizer 对模型的影响:平均一个英文单词几个 token?多语言/代码表现?
📖 关联深度指南:
📄 tokenizer-and-sampling →
更新于 2026-08-12
🎯
检验攻克程度:针对「分词 BPE/WordPiece」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
训练目标与优化器细节
下一个知识点 →
文本嵌入 Embeddings
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA