🎯核心定义
主流开源模型家族在架构细节与训练配方上各有取舍: LLaMA——BPE 分词、词表 32K(LLaMA-3 扩到 128K)、SwiGLU+RMSNorm+RoPE, 70B 起用 GQA, LLaMA-3 训练 15.6T tokens;Qwen——词表 152K(中文 token 效率高, 约 1.2 字/token)、Tie Embedding、GQA 标配, 用 YARN 支持长上下文;DeepSeek-V3——总参 671B / 激活 37B 的 MoE 架构、MLA 低秩 KV 压缩、词表 128K, 训练 14.8T tokens。整体趋势: 训练 token 数激增、词表扩大、MoE 与长上下文成为标配。
⚡解决的核心痛点
把'模型'从黑盒变成可对比的工程决策——中文场景选 Qwen(词表与中文数据占比高, 中文 token 成本低),代码/推理场景选 DeepSeek(MoE 671B 总参每 token 仅激活 37B, 同算力更大容量), 通用英文生态选 LLaMA(生态完善、资料多);同时理解 tokenizer 直接决定成本与速度: 词表越大单 token 信息密度越高, 但嵌入与 softmax 参数开销也越大。