返回 大语言模型 思维导图
中文·English
大语言模型ID: rope-extrapolation

RoPE 外推方案 PI/NTK/YaRN

RoPE Extrapolation PI/NTK/YaRN
🎯核心定义
三类把 RoPE 从训练长度低成本扩展到更长上下文的方案:PI (Position Interpolation) 把位置 mm 线性缩放到 m/sm / s(ss 为扩展倍率);NTK-aware 把旋转基数改为 θ=10000sdd2\theta = 10000 \cdot s^{\frac{d}{d-2}},让高频维度基本不插值、低频维度拉伸;YaRN(NTK-by-parts + 温度)按"波长与上下文窗口的关系"决定哪些维度插值(波长 \gg 窗口的维度插值,高频保留),并对注意力 logits 除以温度 tt(约为 s\sqrt{s})。
💡使用场景
预训练后低成本扩展上下文,典型如把 LLaMA-2 的 4K 扩到 32K/64K/128K;YaRN 是目前最常用、效果最好的方案(长上下文开源模型普遍采用),面试必考三者区别。
解决的核心痛点
直接外推时位置超过训练覆盖,低频维度的旋转周期被"误解",困惑度崩坏;朴素 PI 把所有维度均匀压缩,高频分辨率被破坏、短距离依赖退化;NTK-by-parts 只插值波长大于窗口的维度,保留局部分辨率,YaRN 再配温度修正注意力锐度,16 倍扩展下仍保持接近原始困惑度,是三种方案中质量与稳定性最好的。
🎯5 个高频面试考点 (Exam Points)
1
为什么 RoPE 直接外推会失效?(周期混淆、频率超出训练覆盖)
2
PI 的原理与主要缺陷?(均匀缩放损失高频分辨率)
3
NTK-aware 与 NTK-by-parts 的区别?波长判据是什么?
4
YaRN 由哪两部分组成?温度 tst \approx \sqrt{s} 的作用?
5
如何评估外推方案的效果?(长文档困惑度 + Needle 精确召回)
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「RoPE 外推方案 PI/NTK/YaRN」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点位置编码 RoPE/ALiBi下一个知识点前馈层与激活

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA