M6-022M6: Multimodal & Generative ModelsVLM Connectors & ProjectionsHard
Mastery:

VLM Connectors & Projections: 解释连接器的训练策略(冻结 vs 联合训练)。

📐 Mathematical Definition
stage1: train Wc only;stage2: unfreeze LLM (or top of ViT)\text{stage1}:\ \text{train }W_c\ \text{only};\qquad \text{stage2}:\ \text{unfreeze LLM (or top of ViT)}
⚡ Executive Summary
Core Concept: 阶段一冻结视觉塔与 LLM 只训连接器(对齐);阶段二解冻 LLM(或部分解冻视觉塔)联合微调。

📌 Key Takeaways

  • •
    阶段一:冻结视觉塔 + LLM,只训连接器(特征对齐)
  • •
    阶段二:解冻 LLM 做指令微调(学会使用视觉信息)
  • •
    可选阶段三:部分解冻视觉塔(适配高分辨率/领域)

📐 Mathematical Derivations

数学机理:<strong>三阶段训练策略</strong>(以 LLaVA 为代表)。(1) <strong>阶段一:特征对齐(只训连接器)</strong>——<strong>冻结视觉塔与 LLM</strong>,只训练连接器(MLP/Q-Former);数据是'图文对'(图像 + 描述),损失是'生成描述'的交叉熵。<strong>为什么必须冻结 LLM</strong>——(a) 随机初始化的连接器产生的视觉 token 是'无意义的'(与 LLM 的表示空间不匹配);若此时联合训练,LLM 会试图'解读无意义的输入',导致<strong>语言能力被破坏</strong>(灾难性遗忘);(b) 冻结 LLM 使连接器'被迫学会输出 LLM 能理解的表示'(这是对齐的本质);(c) 成本低(只训少量参数)。(2) <strong>阶段二:指令微调(解冻 LLM)</strong>——<strong>解冻 LLM</strong>(视觉塔通常仍冻结),用'多模态指令数据'(问答、对话、推理)联合训练连接器与 LLM。<strong>目的</strong>——(a) 让 LLM 学会'按指令使用视觉信息'(不仅是描述,还有问答、推理、多轮);(b) 让连接器与 LLM 协同优化(端到端)。<strong>为什么视觉塔仍冻结</strong>——(a) 省算力(视觉塔参数多);(b) 避免破坏视觉塔的通用能力(灾难性遗忘);(c) CLIP/SigLIP 已提供语言对齐特征,无需再训。(3) <strong>可选阶段三:部分解冻视觉塔</strong>——当需要 (a) <strong>适配高分辨率</strong>(原生分辨率的视觉塔与预训练的固定分辨率不同)、(b) <strong>适配新领域</strong>(医疗、遥感)、(c) <strong>提升细粒度能力</strong>(OCR)时,解冻视觉塔的<strong>顶层</strong>(或全部)做继续训练。<strong>为什么只解冻顶层</strong>——底层特征(边缘、纹理)通用性强,不需改;顶层(语义)需适配。<strong>其他策略</strong>——(a) <strong>LoRA 微调视觉塔</strong>(参数高效);(b) <strong>只训视觉塔的最后几层</strong>;(c) <strong>完全联合训练</strong>(资源充足时上限最高)。<strong>实证</strong>——(a) LLaVA 的两阶段(冻结 LLM → 解冻 LLM)效果好且成本可控;(b) 完全联合训练(从头)成本极高且易不稳;(c) 高分辨率/专业领域需阶段三。<strong>关键原则</strong>——'<strong>先对齐、再联合</strong>';'<strong>先冻 LLM、后解冻</strong>';'<strong>视觉塔最后解冻</strong>'。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'先对齐再联合'是关键原则</strong>——若一开始就联合训练,无意义的视觉 token 会破坏 LLM;故必须先让连接器'学会说 LLM 的语言'。② <strong>'视觉塔最后解冻'的优先级</strong>——因为视觉塔已有通用能力(且参数多、训练贵),故只在必要时解冻。③ <strong>'高分辨率需解冻视觉塔'的原因</strong>——预训练的 CLIP 是固定低分辨率(224/336);用原生高分辨率时,位置编码与特征分布不同,需继续训练以适配。④ <strong>'灾难性遗忘'的风险</strong>——解冻 LLM 做多模态微调可能损害纯文本能力;故常 (a) 混合纯文本数据、(b) 用小学习率、(c) 用 LoRA。⑤ <strong>'数据质量决定上限'</strong>——阶段二的指令数据质量(是否覆盖多样任务、答案是否准确)直接决定 VLM 能力;LLaVA 用 GPT-4 生成指令数据是关键(见 VLM 训练与评估题)。⑥ <strong>面试要点</strong>——被问'VLM 怎么训练',应给出'<strong>三阶段(只训连接器 → 解冻 LLM → 可选解冻视觉塔)+ 为什么先冻结 LLM(避免破坏语言能力)+ 为什么视觉塔最后解冻(通用能力 + 参数多)</strong>';能指出'高分辨率需解冻视觉塔'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    阶段一就联合训练(破坏 LLM 语言能力)
  • ✕
    无条件完全解冻视觉塔(成本高且可能遗忘)
🎯 Interviewer Follow-ups
  • ?
    为什么阶段一必须冻结 LLM?
  • ?
    什么时候需要解冻视觉塔?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-021: VLM Connectors & Projections: 解释原生多模态(early fusion)架构与后期融合的差异。📋Back to BankNext →M6-023: VLM Connectors & Projections: 解释多图与交错输入(interleaved)的处理。