M5-134M5: NLP & Large Language ModelsPEFT (LoRA / QLoRA / Prefix Tuning)Hard
Mastery:

PEFT (LoRA / QLoRA / Prefix Tuning): 解释 PEFT 方法的选择依据。

📐 Mathematical Definition
choose: f(memory,task distance,data,deploy)\text{choose}:\ f(\text{memory},\text{task distance},\text{data},\text{deploy})
⚡ Executive Summary
Core Concept: 按'显存约束、任务距离、数据量、部署要求(延迟/多任务)'四维选择:LoRA 为默认,QLoRA 省显存,全参用于远域。

📌 Key Takeaways

  • •
    显存受限 → QLoRA;充足 → LoRA / 全参
  • •
    任务近/数据少 → LoRA;任务远/数据多 → 全参或继续预训练
  • •
    部署要求:多任务 → LoRA(可切换);极致延迟 → 合并
  • •
    其他:参数极致受限 → Prompt/IA³;需要最强 → 全参

📐 Mathematical Derivations

数学机理:<strong>决策框架(四维)</strong>。<strong>(1) 显存约束</strong>——(a) <strong>单卡、模型大</strong> → <strong>QLoRA</strong>(4-bit 基座 + LoRA);(b) <strong>显存充足</strong> → <strong>LoRA(BF16)</strong> 或全参;(c) <strong>多卡、资源充裕</strong> → 全参可行。<strong>(2) 任务距离(task distance)</strong>——目标能力与基座能力的'距离':(a) <strong>近</strong>(风格、格式、特定任务微调)→ LoRA 足够;(b) <strong>中等</strong>(领域适配,如医疗/法律)→ LoRA(较大 r + 所有线性层)或'继续预训练 + LoRA';(c) <strong>远</strong>(新语言、新模态、大幅改变行为)→ <strong>全参微调</strong>或<strong>继续预训练</strong>(LoRA 容量不足)。<strong>如何判断距离</strong>——(a) 领域语料的词汇/风格差异;(b) 小规模实验(LoRA 能否达标);(c) 直观判断(同语言同领域=近)。<strong>(3) 数据量</strong>——(a) <strong>少</strong>(<10k)→ LoRA(正则效果好、不易过拟合);(b) <strong>多</strong>(>100k)→ 全参可行(容量利用充分);(c) 极多 → 全参或继续预训练。<strong>(4) 部署要求</strong>——(a) <strong>多任务/多租户</strong> → LoRA(适配器切换/合并);(b) <strong>极致推理延迟</strong> → LoRA + 合并(无额外开销);(c) <strong>需保留原模型能力</strong> → LoRA(基座冻结,无遗忘)。<strong>(5) 其他</strong>——(a) <strong>参数极致受限</strong>(如端侧)→ Prompt Tuning / IA³;(b) <strong>需要最强效果且不计成本</strong> → 全参 + 多轮迭代;(c) <strong>需要快速实验</strong> → LoRA(训练快、易切换)。<strong>实践默认流程</strong>——(1) 先用 <strong>LoRA</strong>(r=8~64,所有线性层)建立基线;(2) 若效果不足 → 增大 r、增加应用位置;(3) 仍不足 → 试 <strong>QLoRA 更大模型</strong>(用小模型全参 vs 大模型 LoRA,后者常更优);(4) 仍不足 → 全参微调或继续预训练。<strong>关键洞察</strong>——<strong>'用大模型 + LoRA'常优于'用小模型 + 全参'</strong>(因为大模型的基座能力更强,LoRA 足以适配);故'先考虑换更大模型 + LoRA'是常见的更优路径。<strong>与'对齐/RLHF'的关系</strong>——PEFT 也用于 RLHF(如 LoRA 作为 Actor,省显存);故选择依据同样适用。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'用大模型 + LoRA 优于小模型 + 全参'是重要实践洞察</strong>——因为基座能力是上限;故应<strong>优先扩大基座</strong>而非'把全参微调用在弱模型上'。② <strong>'任务距离'是最难判断的维度</strong>——常用'小规模实验'(用 LoRA 试一下能否达标)来判断;若 LoRA 明显不足,说明距离远。③ <strong>'LoRA 的默认地位'</strong>——综合工程优势与效果,LoRA 是<strong>默认选择</strong>;只有明确不足时才升级到全参。④ <strong>'数据量与方法的交互'</strong>——数据少时 LoRA 的正则优势明显(可能优于全参);数据多时全参的容量优势显现。⑤ <strong>'多任务场景 LoRA 独有优势'</strong>——一套基座 + N 个适配器(可切换、可合并)是 LoRA 的独特能力;全参微调做不到。⑥ <strong>面试要点</strong>——被问'PEFT 怎么选',应给出'<strong>四维框架(显存/任务距离/数据量/部署)+ 默认 LoRA + 不足时升级 + 大模型 LoRA 优于小模型全参</strong>';能指出'任务距离用实验判断'与'优先扩大基座'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    在弱模型上做全参微调(不如大模型 + LoRA)
  • ✕
    不先试 LoRA 就直接全参(错失工程优势)
🎯 Interviewer Follow-ups
  • ?
    什么情况下 LoRA 不够、必须全参?
  • ?
    如何判断'任务距离'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-133: PEFT (LoRA / QLoRA / Prefix Tuning): 解释 Prefix/Prompt Tuning 与 LoRA 的差异。📋Back to BankNext →M5-135: PEFT (LoRA / QLoRA / Prefix Tuning): 解释 PEFT 与灾难性遗忘、模型合并的交互。