M5-132M5: NLP & Large Language ModelsPEFT (LoRA / QLoRA / Prefix Tuning)Medium
Mastery:
PEFT (LoRA / QLoRA / Prefix Tuning): 解释 LoRA 与全参微调的效果差异及原因。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 数据少/任务近时 LoRA 接近甚至优于全参;数据多/领域远时全参上限更高;LoRA 有正则效果。
📌 Key Takeaways
- •数据少/任务近:LoRA ≈ 全参(甚至更好,因正则)
- •数据多/领域远:全参上限更高(容量充足)
- •LoRA 优势:显存省、无遗忘、多任务共存、易部署
📐 Mathematical Derivations
数学机理:<strong>效果差异的规律</strong>——(a) <strong>数据少 + 任务近</strong>(如风格适配、指令微调)——LoRA <strong>接近甚至优于</strong>全参微调;原因:LoRA 的<strong>低秩约束本身就是正则</strong>(限制参数空间),在小数据上不易过拟合。(b) <strong>数据多 + 领域远</strong>(如新语言、新模态、大幅改变行为)——全参微调的<strong>上限更高</strong>(容量充足,能充分适配);LoRA 受秩限制可能'学不够'。(c) <strong>中等情形</strong>——差距很小(几个百分点内),故 LoRA 因<strong>工程优势</strong>成为默认选择。<strong>原因分析</strong>——(1) <strong>容量</strong>——LoRA 的增量秩为 r,表达力受限于'低秩子空间';若目标适配需要的'变化方向'超出该子空间,则 LoRA 不足。(2) <strong>正则</strong>——低秩约束限制过拟合,故小数据上 LoRA 更稳。(3) <strong>优化</strong>——全参微调需更小心地调 lr(易破坏预训练知识);LoRA 因基座冻结而更'安全'。(4) <strong>遗忘</strong>——全参微调易灾难性遗忘;LoRA 天然缓解。<strong>LoRA 的工程优势(常比效果差异更重要)</strong>——(a) <strong>显存</strong>(优化器状态只针对少量参数,可单卡微调大模型);(b) <strong>存储</strong>(适配器几十 MB,多任务共存);(c) <strong>无推理延迟</strong>(可合并);(d) <strong>快速迭代</strong>(训练快、易切换);(e) <strong>多任务/多租户</strong>(一套基座 + N 个适配器)。<strong>实证</strong>——(a) 在指令微调上,LoRA(r=8~64)与全参微调的差距通常很小(<1~2 分);(b) 在'新语言适配'上,全参微调明显更好(LoRA 需更大 r 或配合词表扩展);(c) 有研究显示'LoRA 的秩增加到足够大时可接近全参',但参数量也随之增加(失去优势)。<strong>实践建议</strong>——(a) <strong>默认用 LoRA</strong>(工程优势大、效果差距小);(b) <strong>若效果不足</strong>,依次尝试:增大 r → 增加应用位置(所有线性层)→ 用全参微调;(c) <strong>领域远/数据多</strong>时直接考虑全参或'继续预训练 + LoRA'。<strong>与'DoRA/LoRA+'的关系</strong>——这些变体通过改进参数化(分解为幅度与方向、改进初始化与缩放)来缩小与全参的差距。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'LoRA 在小数据上有正则效果'是反直觉但重要的</strong>——它解释了为何 LoRA 有时<strong>优于</strong>全参;面试中能指出这一点是深度理解的标志。② <strong>'工程优势常比效果差异更重要'</strong>——LoRA 的显存/存储/部署优势在工业场景中价值巨大(效果差距只有 1~2 分时,工程优势压倒);故'默认 LoRA'是合理选择。③ <strong>'秩的上限'</strong>——LoRA 的表达力受 r 限制;若任务需要'大幅改变模型行为'(如新语言),则需更大 r 或全参。④ <strong>'全参微调的风险'</strong>——易灾难性遗忘(需混合通用数据、小 lr);LoRA 天然规避。⑤ <strong>'组合策略'</strong>——'继续预训练(全参,学习新语言/领域)+ LoRA(任务适配)'是兼顾两者优势的常见流程。⑥ <strong>面试要点</strong>——被问'LoRA vs 全参微调',应给出'<strong>数据少/任务近 → LoRA 接近甚至更好(正则);数据多/领域远 → 全参上限更高</strong>'与'<strong>工程优势(显存/存储/部署)常更重要</strong>';能指出'LoRA 的正则效果'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕认为全参微调总是更好(小数据上 LoRA 可能更优)
- ✕领域很远时只用小秩 LoRA(容量不足)
🎯 Interviewer Follow-ups
- ?为什么 LoRA 在小数据上有正则效果?
- ?什么任务必须全参微调?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.