返回 大语言模型 思维导图
中文·English
大语言模型ID: decoding-strategies

解码策略

Decoding Strategies
🎯核心定义
解码策略决定生成时如何从词表概率分布中选取下一个 token。greedy 取 argmax;beam search 保留前 BB 条路径;temperature 先缩放 logits (T0T \to 0 退化为 greedy,T>1T > 1 分布变平、更随机);top-k 只在概率最高的 kk 个 token 中采样;top-p (nucleus) 在累计概率超过阈值 pp 的最小候选集合中采样。标准组合顺序:先 temperature 缩放 logits,再 top-p 截断,最后采样。
💡使用场景
对话、创作等需要多样性与自然度时用采样组合 (top-p + temperature + top-k);翻译、摘要、代码生成等期望确定性输出时用 greedy 或小 beam;需要抑制低概率 token 又保留随机性时,用 top-p 按分布形状自适应截断。
解决的核心痛点
greedy 只取最大概率项,易陷入重复循环(“复读机”问题)且多样性差;纯随机采样会选中低概率 token,产生语法或事实错误。top-p 随分布形状自适应候选集(分布平坦时集合大、尖锐时集合小),temperature 控制 logits 锐利度,二者配合在质量与多样性之间取得平衡;beam 用 BB 条并行路径缓解贪心解码的局部短视。
🎯5 个高频面试考点 (Exam Points)
1
temperature 的作用与极限:T=0T=0TT \to \infty 分别等价于什么解码?
2
top-p 与 top-k 的区别?为什么说 top-p 更自适应?
3
为什么标准顺序是先 temperature 再 top-p?顺序颠倒会怎样?
4
greedy 与 beam search 的缺点?beam size 太大/太小的影响?
5
采样与确定性解码分别适合什么任务?如何权衡?
📖 关联深度指南:📄 tokenizer-and-sampling
更新于 2026-08-12
🎯
检验攻克程度:针对「解码策略」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点填充与打包 Padding/Packing下一个知识点推测解码(跨模块)

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA