M5-125M5: NLP & Large Language ModelsModel Merging & DistillationEasy
Mastery:

Model Merging & Distillation: 解释 TIES 与 DARE 的核心思想。

📐 Mathematical Definition
TIES: trim+elect sign+disjoint merge;DARE: drop δ, rescale 1/(1−p)\text{TIES}:\ \text{trim}+\text{elect sign}+\text{disjoint merge};\qquad \text{DARE}:\ \text{drop }\delta,\ \text{rescale }1/(1-p)
⚡ Executive Summary
Core Concept: TIES:修剪小值 + 符号一致时合并 + 按符号选多数,缓解干扰;DARE:随机丢弃增量并重缩放,减少冗余与冲突。

📌 Key Takeaways

  • •
    TIES:修剪(去掉小幅度值)→ 选符号(多数投票)→ 只合并同号项
  • •
    DARE:随机把增量置零并重缩放(数学上近似原增量)
  • •
    目标:缓解多个任务向量相加时的'干扰'

📐 Mathematical Derivations

数学机理:<strong>问题:任务向量相加的干扰</strong>——直接相加 Στ_i 时,若不同任务向量在<strong>同一参数</strong>上有<strong>相反的符号</strong>(一个想增大、一个想减小),则相加后相互抵消,导致<strong>两个任务都学不好</strong>。<strong>TIES(Trim, Elect Sign & Merge,Yadav 等 2023)</strong> 的三步:(1) <strong>Trim(修剪)</strong>——对每个任务向量,把<strong>幅度很小</strong>的值置零(只保留 top-k% 的重要参数);理由:小值多为噪声、且易造成冲突。(2) <strong>Elect Sign(选符号)</strong>——对每个参数位置,统计各任务向量的<strong>符号</strong>,取<strong>多数符号</strong>作为'合并方向'(sign voting)。(3) <strong>Disjoint Merge(不相交合并)</strong>——只把<strong>符号与多数符号一致</strong>的那些值相加(忽略符号冲突的项)。<strong>效果</strong>——缓解干扰(避免相互抵消),使多任务合并更稳定。<strong>DARE(Drop And REscale,Yu 等 2023)</strong> 的思想——观察到微调的增量(Δθ=θ_ft−θ_base)具有<strong>大量冗余</strong>(很多参数变化很小或可省略);故 (1) <strong>Drop</strong>——<strong>随机</strong>把增量中的一部分(比例 p)置零;(2) <strong>Rescale</strong>——把剩余的非零值<strong>放大 1/(1−p)</strong>(补偿丢弃的部分,使期望不变)。<strong>数学依据</strong>——若丢弃是随机的,则'丢弃 + 重缩放'后的增量在<strong>期望上</strong>等于原增量(无偏估计);这使'随机稀疏化'不损失信息(期望意义上)。<strong>效果</strong>——(a) 减少冗余(更稀疏的增量);(b) <strong>减少冲突</strong>(随机丢弃使不同任务向量的冲突参数更可能被'错开');(c) 可与 TIES 组合(DARE + TIES 是常用组合)。<strong>其他方法</strong>——(a) <strong>Model Soup</strong>(简单平均多个微调模型);(b) <strong>SLERP</strong>(球面插值,保持范数);(c) <strong>Fisher Merging</strong>(用 Fisher 信息加权);(d) <strong>RegMean</strong>(最小二乘解)。<strong>共同目标</strong>——在'合并多个模型/任务向量'时<strong>最大化保留各任务能力、最小化干扰</strong>。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'符号冲突导致抵消'是干扰的核心机制</strong>——TIES 的'符号投票 + 只合并同号'直接针对这一点;面试中能解释这一点是深度理解的标志。② <strong>'DARE 的数学依据(无偏估计)'很优雅</strong>——随机丢弃 + 重缩放使期望不变,故'稀疏化不损失信息';这与 dropout 的思想相通(随机置零 + 重缩放)。③ <strong>'修剪小值'的双重作用</strong>——(a) 去噪(小值多为噪声)、(b) 减少冲突(小值易与别的任务冲突);故 Trim 是有效的前置步骤。④ <strong>'DARE + TIES 组合'是实践常用</strong>——先用 DARE 随机稀疏化(减少冗余),再用 TIES 处理符号冲突;两者互补。⑤ <strong>'合并的前提是同一基座'</strong>——所有任务向量必须基于<strong>同一个</strong> θ_base(否则'方向'无意义);这是使用前提。⑥ <strong>面试要点</strong>——被问'TIES 与 DARE',应给出'<strong>TIES 三步(修剪/选符号/只合并同号)针对符号冲突;DARE(随机丢弃 + 重缩放)基于无偏估计减少冗余</strong>'与'<strong>组合使用</strong>';能解释'符号冲突为何导致抵消'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    直接相加任务向量而不处理符号冲突
  • ✕
    用不同基座模型的任务向量做合并
🎯 Interviewer Follow-ups
  • ?
    为什么'符号冲突'会导致干扰?
  • ?
    DARE 的数学依据是什么?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-124: Model Merging & Distillation: 解释任务算术(task arithmetic)与模型合并。📋Back to BankNext →M5-126: Model Merging & Distillation: 解释多 LoRA 服务与适配器合并的差异。