M5-024M5: NLP & Large Language ModelsInstruction Tuning & Supervised Fine-TuningHard
Mastery:

Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 数据配比与多任务平衡。

📐 Mathematical Definition
p(task i)∝niα (α<1 rebalances);or explicit weights wip(\text{task }i)\propto n_i^{\alpha}\ (\alpha<1\ \text{rebalances});\qquad \text{or explicit weights }w_i
⚡ Executive Summary
Core Concept: 多任务混合需平衡各任务的样本量与难度,避免'强任务主导'或'弱任务被淹没';用温度采样/权重调整。

📌 Key Takeaways

  • •
    问题:任务样本量差异大 → 大任务主导梯度
  • •
    对策:温度采样(n^α)、显式权重、按任务均衡
  • •
    同时需平衡难度与长度(避免长样本主导 token 预算)

📐 Mathematical Derivations

数学机理:<strong>多任务 SFT 的不平衡问题</strong>——真实数据集中各任务的样本量差异极大(如通用问答 10 万条、某专业任务 500 条)。若按<strong>样本数</strong>自然采样,大任务会<strong>主导梯度</strong>(每个 batch 中大任务样本占多数),导致 (a) 小任务学不好(欠训练);(b) 模型偏向大任务的风格;(c) 小任务的能力被'淹没'。<strong>对策一:温度采样(temperature sampling)</strong>——把采样概率从 p_i∝n_i 改为 <strong>p_i∝n_i^α</strong>(α∈(0,1),常取 0.5~0.7);这<strong>压低大任务的权重、抬高小任务的权重</strong>,使各任务的'被训练程度'更均衡。α=1 是自然比例、α=0 是完全等权。<strong>对策二:显式权重</strong>——直接为各任务设权重 w_i(按业务重要性或'能力缺口');更可控但需调参。<strong>对策三:按'有效 token 数'均衡</strong>——因为不同任务的回答长度差异大(长推理 vs 短分类),按'样本数'均衡仍可能让长样本主导 token 预算;故应按<strong>token 数</strong>均衡。<strong>其他维度</strong>:(a) <strong>难度平衡</strong>——混合简单与困难样本(全简单学不到能力、全难学不稳);(b) <strong>能力覆盖</strong>——确保关键能力(指令遵循、推理、代码、安全)都有足够样本;(c) <strong>冲突处理</strong>——某些任务的风格冲突(如'简洁'与'详尽'),需权衡或加任务标识。<strong>评估</strong>——需<strong>逐任务</strong>评估(而非只看总体平均);并检查是否出现'某任务提升但另一任务下降'(跷跷板)。<strong>实践</strong>——工业界常用'温度采样 + 显式权重微调',并通过消融实验确定配比。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'按 token 数均衡'比'按样本数均衡'更合理</strong>——因为梯度贡献与 token 数相关(每个 token 一个损失项);长回答的任务在 token 预算中占比更高。这是易被忽视的细节。② <strong>温度采样的 α 选择</strong>——α 越小则越均衡(小任务权重越高);但 α 过小会让大任务(通常是通用能力)训练不足。故需在'均衡'与'不损害主力任务'间权衡(常取 0.5~0.7)。③ <strong>'跷跷板'现象</strong>——多任务学习中常见'此消彼长'(某任务提升伴随另一任务下降);成因是任务间的<strong>梯度冲突</strong>(见 M3 的梯度冲突题)或<strong>容量竞争</strong>。缓解:(a) 调整配比;(b) 梯度投影(PCGrad);(c) 用 MoE/适配器分离任务。④ <strong>与'数据质量'的交互</strong>——低质量任务的样本即使量少也会损害(因为模型会学到其错误);故<strong>先保证每个任务的数据质量</strong>,再谈配比。⑤ <strong>与 RLHF 的衔接</strong>——SFT 的配比决定'基础行为';RLHF 阶段可进一步用偏好数据调整(如对某任务给更高奖励权重)。故 SFT 配比不必完美,RLHF 可补偿。⑥ <strong>面试要点</strong>——被问'多任务 SFT 怎么配比',应给出'<strong>温度采样(n^α)+ 显式权重 + 按 token 而非样本数均衡 + 难度/能力覆盖</strong>',并强调'<strong>逐任务评估、警惕跷跷板</strong>';能指出'按 token 均衡更合理'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    按样本数等权采样(忽略 token 数差异)
  • ✕
    只看总体平均指标(掩盖任务间失衡)
🎯 Interviewer Follow-ups
  • ?
    为什么按样本数等权采样不够?
  • ?
    如何评估多任务平衡效果?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-023: Instruction Tuning & Supervised Fine-Tuning: 解释 CoT 蒸馏的作用与风险。📋Back to BankNext →M5-025: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 与 RLHF/DPO 的分工。