TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
大语言模型 思维导图
›
RoPE 外推方案 PI/NTK/YaRN
← 返回 大语言模型 思维导图
中文
·
English
⚡ 大语言模型
ID:
rope-extrapolation
RoPE 外推方案 PI/NTK/YaRN
RoPE Extrapolation PI/NTK/YaRN
🎯
核心定义
三类把 RoPE 从训练长度低成本扩展到更长上下文的方案:PI (Position Interpolation) 把位置
m
m
m
线性缩放到
m
/
s
m / s
m
/
s
(
s
s
s
为扩展倍率);NTK-aware 把旋转基数改为
θ
=
10000
⋅
s
d
d
−
2
\theta = 10000 \cdot s^{\frac{d}{d-2}}
θ
=
10000
⋅
s
d
−
2
d
,让高频维度基本不插值、低频维度拉伸;YaRN(NTK-by-parts + 温度)按"波长与上下文窗口的关系"决定哪些维度插值(波长
≫
\gg
≫
窗口的维度插值,高频保留),并对注意力 logits 除以温度
t
t
t
(约为
s
\sqrt{s}
s
)。
💡
使用场景
预训练后低成本扩展上下文,典型如把 LLaMA-2 的 4K 扩到 32K/64K/128K;YaRN 是目前最常用、效果最好的方案(长上下文开源模型普遍采用),面试必考三者区别。
⚡
解决的核心痛点
直接外推时位置超过训练覆盖,低频维度的旋转周期被"误解",困惑度崩坏;朴素 PI 把所有维度均匀压缩,高频分辨率被破坏、短距离依赖退化;NTK-by-parts 只插值波长大于窗口的维度,保留局部分辨率,YaRN 再配温度修正注意力锐度,16 倍扩展下仍保持接近原始困惑度,是三种方案中质量与稳定性最好的。
🎯
5 个高频面试考点 (Exam Points)
1
为什么 RoPE 直接外推会失效?(周期混淆、频率超出训练覆盖)
2
PI 的原理与主要缺陷?(均匀缩放损失高频分辨率)
3
NTK-aware 与 NTK-by-parts 的区别?波长判据是什么?
4
YaRN 由哪两部分组成?温度
t
≈
s
t \approx \sqrt{s}
t
≈
s
的作用?
5
如何评估外推方案的效果?(长文档困惑度 + Needle 精确召回)
📖 关联深度指南:
📄 transformer-architecture →
更新于 2026-08-12
🎯
检验攻克程度:针对「RoPE 外推方案 PI/NTK/YaRN」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
位置编码 RoPE/ALiBi
下一个知识点 →
前馈层与激活
🔗 更多 大语言模型 知识点卡片
Agent 与工具调用
对齐税与偏好数据
缩放点积注意力
注意力变体 MHA/MQA/GQA