M5-124M5: NLP & Large Language ModelsModel Merging & DistillationEasy
Mastery:
Model Merging & Distillation: 解释任务算术(task arithmetic)与模型合并。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 微调得到的'任务向量'(微调权重 − 基座权重)可加减组合,实现多任务能力的合并或去除。
📌 Key Takeaways
- •任务向量 τ = 微调权重 − 基座权重(表示'这个任务学了什么')
- •合并:基座 + Σ λ·τ(多个任务向量相加)
- •负任务向量可'遗忘'某能力(θ − λτ)
📐 Mathematical Derivations
数学机理:<strong>任务算术(Ilharco 等 2022)</strong>——(1) <strong>任务向量(task vector)</strong> 定义为微调权重与基座权重之差:τ_i = θ_ft,i − θ_base;它表示'为任务 i 学到的权重变化'(可视为参数空间中的一个'方向')。(2) <strong>多任务合并</strong>——把多个任务向量相加(可加权):θ_merged = θ_base + Σ_i λ_i·τ_i;这样合并后的模型<strong>同时具备多个任务的能力</strong>(无需联合训练)。(3) <strong>能力去除(forgetting)</strong>——用<strong>负</strong>的任务向量:θ' = θ_base − λ·τ_i 可'遗忘'任务 i 的能力(如去掉有害行为、去掉某风格)。(4) <strong>类比(analogy)</strong>——τ_A + τ_B − τ_C 可做'任务类比'(如 'A 的能力 + B 的风格 − C 的风格')。<strong>为什么可以相加</strong>——(a) <strong>线性化假设</strong>——微调在参数空间中移动的'方向'近似正交(不同任务学到的变化方向不太冲突),故相加不太互相干扰;(b) <strong>损失面的平坦性</strong>——微调的损失面较平坦,故'中间的插值点'仍性能良好(类似'模式连通性'现象);(c) <strong>LoRA 的天然契合</strong>——LoRA 的增量本身是低秩矩阵,多个 LoRA 可直接相加(<code>W + Σ B_iA_i</code>),这是'任务算术'在 PEFT 上的自然实现。<strong>局限</strong>——(a) <strong>干扰(interference)</strong>——若任务向量<strong>冲突</strong>(方向相反或高度相关),相加会损害性能(这就是 TIES/DARE 等方法要解决的);(b) <strong>缩放敏感</strong>——λ 需调(λ 太大则过拟合某任务、太小则学不到);(c) <strong>不是所有能力都能合并</strong>(容量有限、任务冲突);(d) <strong>不增加容量</strong>(合并的模型参数与基座相同,故容量受限于基座)。<strong>与'集成'的区别</strong>——合并是'单模型'(参数层面),集成是'多模型'(预测层面);前者推理成本不变,后者 ∝ 模型数。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'参数空间的方向可以加减'是核心洞察</strong>——它把'能力'视为参数空间中的'向量',从而支持'合并'与'去除';这是'模型可编辑性'的重要进展。② <strong>'LoRA + 任务算术'是天然组合</strong>——多个 LoRA 可 (a) 直接相加(合并多任务)、(b) 相减(去除某能力)、(c) 用不同的 λ 调权重;这使'适配器管理'非常灵活(无需重训)。③ <strong>'干扰'是主要障碍</strong>——任务向量冲突时合并会掉点;TIES(修剪小值 + 符号一致时合并)与 DARE(随机丢弃 + 重缩放)正是为解决干扰而设计。④ <strong>'能力去除'的安全价值</strong>——可用于'去毒'(去掉有害输出)、'去偏见';但需注意(a)可能损害相关能力、(b) 效果有限(能力分布式存储)。⑤ <strong>'与联邦学习/多任务的关系'</strong>——任务算术提供了'先分任务训、再合并'的流程(避免多任务联合训练的复杂度);这对'多团队协作'有工程价值。⑥ <strong>面试要点</strong>——被问'模型合并是什么',应给出'<strong>任务向量(τ = θ_ft − θ_base)+ 相加(多任务)/ 相减(去除)+ 与 LoRA 的天然契合</strong>'与'<strong>干扰是主要障碍(TIES/DARE 解决)</strong>';能指出'合并 vs 集成的成本差异'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕认为合并总是不掉点(任务冲突时会掉)
- ✕把模型合并与集成混为一谈
🎯 Interviewer Follow-ups
- ?为什么任务向量可以相加?
- ?合并时为什么需要缩放 λ?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.