返回 大语言模型 思维导图
中文·English
大语言模型ID: context-extension

长上下文扩展

Long-Context Extension
🎯核心定义
长上下文扩展把模型有效上下文从 4K/8K 扩到 128K/1M, 主要有两条路线。路线一: 位置编码改造——PI(Positional Interpolation)把 RoPE 位置 m 按扩展倍数 s 缩放为 m/sm/s 做线性内插;NTK 感知缩放只压低低频分量、保留高频信息; YaRN(Yet another RoPE extensioN)在 NTK 基础上引入温度系数 t, 用 1/t1/\sqrt{t} 缩放注意力对数, 是目前最常用方案。路线二: 继续训练——用长文档(书籍、代码仓库)按序列打包做小学习率继续预训练。
💡使用场景
长文档问答、代码仓库理解、Agent 长程任务; 推理时需配合 KV Cache 管理(详见 AI_Infra 模块)。
解决的核心痛点
直接外推时 RoPE 位置超出训练范围, 注意力分数失稳、困惑度暴涨。PI/NTK/YaRN 无需或仅需极少量训练即可把上下文从 4K 扩到 128K(如 YaRN-LLaMA-2-128K), 困惑度与短上下文基本持平;代价是 KV Cache 显存随长度线性增长: 128K 上下文的 70B 模型 KV cache 达数百 GB(约 2×2×L×H×d×s×b2 \times 2 \times L \times H \times d \times s \times b), 必须配合 PagedAttention 等显存管理手段。
🎯5 个高频面试考点 (Exam Points)
1
RoPE 直接外推为什么会失效?
2
PI 与 NTK 感知缩放的本质区别?
3
YaRN 的原理与温度系数 t 的作用?
4
上下文扩展的两条路线与各自取舍?
5
长上下文的计算/显存代价与 KV 管理手段?
📖 关联深度指南:📄 llm-foundations-and-sota
更新于 2026-08-12
🎯
检验攻克程度:针对「长上下文扩展」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点模型家族与演进下一个知识点上下文工程

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA