长上下文扩展把模型有效上下文从 4K/8K 扩到 128K/1M, 主要有两条路线。路线一: 位置编码改造——PI(Positional Interpolation)把 RoPE 位置 m 按扩展倍数 s 缩放为
m/s 做线性内插;NTK 感知缩放只压低低频分量、保留高频信息; YaRN(Yet another RoPE extensioN)在 NTK 基础上引入温度系数 t, 用
1/t 缩放注意力对数, 是目前最常用方案。路线二: 继续训练——用长文档(书籍、代码仓库)按序列打包做小学习率继续预训练。