M5-136M5: NLP & Large Language ModelsPEFT (LoRA / QLoRA / Prefix Tuning)Hard
Mastery:
PEFT (LoRA / QLoRA / Prefix Tuning): 解释 LoRA 的变体(DoRA / LoRA+ / rsLoRA)与秩的选择。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: DoRA 分解为幅度与方向(更接近全参);LoRA+ 给 B 更大 lr;rsLoRA 修正缩放;秩按任务距离选。
📌 Key Takeaways
- •DoRA:把权重分解为'幅度'与'方向',只对方向用 LoRA
- •LoRA+:给 B 与 A 不同的学习率(B 更大)
- •rsLoRA:把缩放从 α/r 改为 α/√r(大秩时更稳)
- •秩 r:任务近用小(8),远用大(64~256)
📐 Mathematical Derivations
数学机理:<strong>三个主要变体</strong>。<strong>(1) DoRA(Weight-Decomposed Low-Rank Adaptation,Liu 等 2024)</strong>——把权重分解为<strong>幅度(magnitude)</strong> 与<strong>方向(direction)</strong> 两部分:W = m · (V/‖V‖_c)(m 是每列的幅度标量、V/‖V‖ 是归一化方向)。DoRA 的做法是:<strong>幅度单独训练</strong>(可学习)、<strong>方向用 LoRA 更新</strong>(W + BA 后归一化)。<strong>为什么更接近全参</strong>——研究表明全参微调与 LoRA 的<strong>学习模式不同</strong>:全参微调会同时改变'幅度'与'方向'(且幅度变化较大),而 LoRA 主要改变方向(幅度变化小);DoRA 显式分离两者,使学习模式更接近全参,从而<strong>缩小与全参的效果差距</strong>(论文报告在多个任务上优于 LoRA)。<strong>代价</strong>——额外的归一化计算(稍慢)、多一组参数。<strong>(2) LoRA+(Hayou 等 2024)</strong>——理论分析发现 LoRA 中 A 与 B 的<strong>最优学习率不应相同</strong>(因为 B 的梯度尺度与 A 不同);建议给 <strong>B 更大的学习率</strong>(如 η_B = λ·η_A,λ 常取 2~16)。<strong>收益</strong>——加速收敛、提升效果(几乎零成本)。<strong>(3) rsLoRA(Rank-Stabilized LoRA)</strong>——标准 LoRA 的缩放是 α/r;研究发现当<strong>秩 r 较大</strong>时,α/r 的缩放会导致'更新过小'(因为 1/r 衰减太快);rsLoRA 把缩放改为 <strong>α/√r</strong>,使大秩时的更新幅度合理。<strong>收益</strong>——在大秩(r≥64)时更稳定、效果更好。<strong>秩 r 的选择</strong>——(a) <strong>任务近/数据少</strong> → r=8~16;(b) <strong>中等</strong> → r=32~64;(c) <strong>领域远/复杂任务</strong> → r=64~256;(d) <strong>经验</strong>:从 r=8 开始,若欠拟合则增大;(e) <strong>注意</strong>——r 增大需配合 α 的调整(保持 α/r 或 α/√r 的比例)。<strong>其他变体</strong>——(a) <strong>LoRA-FA</strong>(冻结 A,只训 B);(b) <strong>VeRA</strong>(共享随机矩阵 + 可学习缩放,参数极少);(c) <strong>LoHa/LoKr</strong>(用 Hadamard/Kronecker 积替代矩阵乘,参数更少);(d) <strong>AdaLoRA</strong>(自适应分配不同层的秩)。<strong>共同方向</strong>——在'参数量/效果'的帕累托前沿上改进(更少参数达到同等效果,或同等参数达到更好效果)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'全参与 LoRA 的学习模式不同'是关键洞察</strong>——DoRA 基于'幅度 vs 方向'的分解来缩小差距;面试中能指出这一点是深度理解的标志。② <strong>'LoRA+ 的零成本改进'</strong>——只改学习率(B 更大)就能加速收敛与提升效果;这是'几乎免费'的优化,应默认使用。③ <strong>'rsLoRA 针对大秩'</strong>——当 r 较大时(≥64),标准缩放会让更新过小;用 α/√r 更稳。故'大秩时应考虑 rsLoRA'。④ <strong>'秩的选择需实验'</strong>——没有通用最优;常用'从小开始、按欠拟合情况增大'的策略。⑤ <strong>'变体的收益有限'</strong>——DoRA/LoRA+ 等的提升通常为 1~3 分;若'任务距离远',仍应转向全参或更大基座(变体无法弥补容量不足)。⑥ <strong>面试要点</strong>——被问'LoRA 有哪些改进',应给出'<strong>DoRA(幅度/方向分解)+ LoRA+(B 更大 lr)+ rsLoRA(α/√r 用于大秩)</strong>'与'<strong>秩的选择(任务距离决定,需实验)</strong>',并指出'<strong>变体收益有限、远域任务仍需全参</strong>';这是 PEFT 类问题的深度回答。
⚠️ Common Interview Pitfalls
- ✕用大秩但不调整缩放(更新过小)
- ✕期望变体能弥补任务距离过远
🎯 Interviewer Follow-ups
- ?DoRA 为什么更接近全参微调?
- ?rsLoRA 解决什么问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.