M5-130M5: NLP & Large Language ModelsPEFT (LoRA / QLoRA / Prefix Tuning)Easy
Mastery:
PEFT (LoRA / QLoRA / Prefix Tuning): 解释 LoRA 的原理与超参作用。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用低秩增量 ΔW=BA 参数化微调,冻结基座;关键超参是秩 r、缩放 α/r、应用位置与 dropout。
📌 Key Takeaways
- •冻结 W,只训低秩 A、B(参数量降 10⁴ 倍)
- •秩 r:表达力(r 大则强);α/r:缩放(控制增量幅度)
- •应用位置:通常在 Q/K/V/O 投影;也有全线性层
📐 Mathematical Derivations
数学机理:<strong>LoRA(Low-Rank Adaptation,Hu 等 2021)</strong>——观察到'微调时的权重变化 ΔW 具有低秩性'(微调主要在权重空间的少数方向上移动);故用<strong>低秩分解</strong>参数化增量:W' = W + (α/r)·BA,其中 B∈ℝ^{d×r}、A∈ℝ^{r×k}(r≪min(d,k)),<strong>冻结 W</strong>、只训练 A 与 B。<strong>参数量</strong>——从 d×k 降到 r×(d+k);以 d=k=4096、r=8 为例,从 16.7M 降到 65K(降 256 倍);对整个模型可降 10⁴ 倍。<strong>初始化</strong>——A 用随机高斯初始化、<strong>B 初始化为 0</strong>(使训练开始时 ΔW=0,模型行为与基座一致);这是保证'从基座出发'的关键。<strong>超参</strong>:(1) <strong>秩 r</strong>——控制表达力;r 大则增量空间更大(更接近全参微调)但参数更多;常用 8~64(简单任务 8、复杂/领域远任务 64~256)。(2) <strong>缩放 α/r</strong>——α 是缩放因子;<strong>固定 α/r 的比例</strong>可让'改变 r 时不必重调学习率'(α 通常设为 r 的 1~2 倍,如 α=16、r=8 得 α/r=2);若把 α/r 视为'有效学习率'的一部分,则固定它使超参可迁移。(3) <strong>应用位置</strong>——(a) 只在 Q/K/V/O 投影(省参数);(b) 在所有线性层(覆盖更广、效果更好,QLoRA 论文建议);(c) 可对不同层用不同 r。(4) <strong>LoRA dropout</strong>——对 LoRA 输入施加 dropout(防过拟合,小数据时有用)。(5) <strong>学习率</strong>——LoRA 因参数少,可用<strong>更大的学习率</strong>(1e-4~2e-4,比全参高一个量级)。<strong>优点</strong>——(a) <strong>显存</strong>(优化器状态只针对少量参数);(b) <strong>存储</strong>(适配器几十 MB,可多任务共存);(c) <strong>无推理延迟</strong>(可合并回 W);(d) <strong>缓解灾难性遗忘</strong>(基座冻结)。<strong>局限</strong>——(a) 表达力受秩限制(极难任务可能不足);(b) 不改变基座知识(只能'引导');(c) 合并多适配器时有干扰。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'B 初始化为 0'是重要细节</strong>——它保证训练从'基座行为'开始(ΔW=0),避免随机初始化破坏预训练知识;漏掉这一点会显著损害效果。② <strong>'低秩性'的理论依据</strong>——Aghajanyan 等发现'微调的 intrinsic dimension 远小于参数量';但注意:<strong>预训练</strong>不能低秩(需充分探索),低秩性是<strong>微调</strong>的特性。③ <strong>'α/r 固定比例'的实用价值</strong>——它使'调 r 不必重调 lr';这是实践中的便利约定(虽然严格来说 α/r 与 lr 的乘积才决定有效更新幅度)。④ <strong>'应用位置'的影响</strong>——研究表明 (a) 只加在注意力层已能获得大部分收益;(b) 加在 FFN 也能提升(覆盖更多);(c) QLoRA 建议'所有线性层'。故需按资源与效果权衡。⑤ <strong>'LoRA lr 更大'的原因</strong>——参数量少 → 单步更新的'有效影响'小 → 需更大 lr 补偿;但过大则发散(需调)。⑥ <strong>面试要点</strong>——被问'LoRA 的原理与超参',应给出'<strong>低秩增量 W+BA + 冻结基座 + B 初始化为 0 + 秩 r 与缩放 α/r</strong>'与'<strong>应用位置、lr 更大、可合并</strong>';能指出'低秩性是微调特性、预训练不能低秩'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕B 用随机初始化(破坏基座行为)
- ✕改变 r 时不调整 α(α/r 比例失衡)
🎯 Interviewer Follow-ups
- ?为什么低秩增量足够?
- ?α/r 的缩放为什么要固定比例?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.