返回 大语言模型 思维导图
中文·English
大语言模型ID: model-families

模型家族与演进

Model Families & Evolution
🎯核心定义
主流开源模型家族在架构细节与训练配方上各有取舍: LLaMA——BPE 分词、词表 32K(LLaMA-3 扩到 128K)、SwiGLU+RMSNorm+RoPE, 70B 起用 GQA, LLaMA-3 训练 15.6T tokens;Qwen——词表 152K(中文 token 效率高, 约 1.2 字/token)、Tie Embedding、GQA 标配, 用 YARN 支持长上下文;DeepSeek-V3——总参 671B / 激活 37B 的 MoE 架构、MLA 低秩 KV 压缩、词表 128K, 训练 14.8T tokens。整体趋势: 训练 token 数激增、词表扩大、MoE 与长上下文成为标配。
💡使用场景
模型选型、面试横向对比、理解大模型技术演进趋势。
解决的核心痛点
把'模型'从黑盒变成可对比的工程决策——中文场景选 Qwen(词表与中文数据占比高, 中文 token 成本低),代码/推理场景选 DeepSeek(MoE 671B 总参每 token 仅激活 37B, 同算力更大容量), 通用英文生态选 LLaMA(生态完善、资料多);同时理解 tokenizer 直接决定成本与速度: 词表越大单 token 信息密度越高, 但嵌入与 softmax 参数开销也越大。
🎯5 个高频面试考点 (Exam Points)
1
LLaMA-3 与 Qwen 在分词、位置编码上的差异?
2
DeepSeek-V3 的 MoE + MLA 配置是什么?
3
词表大小如何影响中文 token 效率与推理成本?
4
训练 token 规模从 1.4T 涨到 15.6T 说明什么趋势?
5
各家族如何支持长上下文(YARN / 位置编码改造)?
📖 关联深度指南:📄 llm-foundations-and-sota
更新于 2026-08-12
🎯
检验攻克程度:针对「模型家族与演进」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点缩放定律下一个知识点长上下文扩展

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA