返回 大语言模型 思维导图
中文·English
大语言模型ID: positional-encoding

位置编码 RoPE/ALiBi

Positional Encoding RoPE/ALiBi
🎯核心定义
RoPE (Rotary Position Embedding, 旋转位置编码) 对 Q/K 的第 2j2j2j+12j+1 维做角度为 mθjm \theta_j 的旋转,其中 θj=100002j/d\theta_j = 10000^{-2j/d},使得任意位置 mmnn 的内积只依赖相对距离 mnm - n;ALiBi 不旋转向量,直接给注意力分数加线性偏置 mij-m \cdot |i - j|,零参数。
💡使用场景
LLaMA/Qwen/Mistral/Gemma 等主流模型全部使用 RoPE(LLaMA-3 把旋转基数调到 500000);ALiBi 用于 BLOOM、MPT 等强调外推与低成本的模型;面试必考 RoPE 公式、波长性质与外推问题。
解决的核心痛点
可学习/绝对位置编码需要为固定长度学习参数,外推到更长序列即失效;RoPE 把位置写进旋转矩阵,与点积天然结合实现相对位置,且低频率维度旋转慢(波长 λj=2π100002j/d\lambda_j = 2\pi \cdot 10000^{2j/d},最低频约 62832 个 token),天然给"近期 token"更高权重;ALiBi 零参数、原生可外推,但远距离相对位置的区分度弱,长程建模能力受限。
🎯5 个高频面试考点 (Exam Points)
1
RoPE 的旋转公式?为什么内积只依赖相对位置 mnm - n?
2
RoPE 的波长公式:最低频维度周期约多少?base=10000 的周期混淆出现在多长序列?(约 6 万 token,LLaMA-3 改用 500000)
3
RoPE 与绝对位置编码、可学习位置编码的对比?
4
ALiBi 的原理与优缺点?
5
RoPE 为什么不能直接外推到长序列?(引出 PI/NTK/YaRN)
📖 关联深度指南:📄 transformer-architecture
更新于 2026-08-12
🎯
检验攻克程度:针对「位置编码 RoPE/ALiBi」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点SSM/线性注意力混合下一个知识点RoPE 外推方案 PI/NTK/YaRN

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA