M6-018M6: Multimodal & Generative ModelsVLM Connectors & ProjectionsEasy
Mastery:
VLM Connectors & Projections: 解释 LLaVA 的 MLP 投影器设计。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用两层 MLP 把 ViT 的 patch token 投影到 LLM 词嵌入空间;简单有效,保留所有视觉 token。
📌 Key Takeaways
- •两层 MLP(线性 + GELU + 线性)投影维度
- •不改变 token 数(保留所有 patch)
- •简单有效:训练成本低、效果接近复杂连接器
📐 Mathematical Derivations
数学机理:<strong>LLaVA 的 MLP 投影器</strong>——(1) <strong>结构</strong>——一个<strong>两层 MLP</strong>(线性 W₁ → GELU → 线性 W₂),把 ViT 输出的 d_v 维 patch token 投到 LLM 的 d_llm 维:h_v=W₂·GELU(W₁·z_v)。(2) <strong>特点</strong>——(a) <strong>不改变 token 数</strong>(N 个 patch token → N 个视觉 token);(b) <strong>逐 token 独立</strong>(不跨 token 交互);(c) <strong>参数量小</strong>(d_v×d_h + d_h×d_llm,通常几百万到几千万);(d) <strong>简单</strong>(无复杂结构)。<strong>为什么有效</strong>——(a) 视觉塔(CLIP-ViT)已提供了<strong>语言对齐的视觉特征</strong>(因为 CLIP 用图文对比训练),故只需'线性/浅层映射'即可对齐到 LLM 空间;(b) 简单的 MLP 训练<strong>稳定、成本低</strong>(相比 Q-Former 的复杂结构);(c) LLaVA 的实验显示'MLP 投影器与更复杂的 Q-Former 效果相当(甚至更好)'——这被称为'<strong>用简单连接器 + 高质量数据</strong>'的胜利。<strong>LLaVA 的两阶段训练</strong>——(1) <strong>阶段一:特征对齐预训练</strong>——冻结视觉塔与 LLM,<strong>只训 MLP 投影器</strong>;用'图文对'数据(如 CC3M 的 595k 子集),任务是'根据图像生成描述';目的是让投影器把视觉特征'翻译'到 LLM 能理解的空间。(2) <strong>阶段二:端到端指令微调</strong>——<strong>解冻 LLM</strong>(视觉塔通常仍冻结),用'多模态指令数据'(LLaVA-Instruct-150k,用 GPT-4 生成)联合训练投影器与 LLM;目的是让模型学会'按指令使用视觉信息'(问答、推理、对话)。<strong>为什么阶段一冻结 LLM</strong>——若一开始就联合训练,随机初始化的投影器会产生'无意义的视觉 token',破坏 LLM 的语言能力(灾难性遗忘);故先对齐、再联合。<strong>局限</strong>——(a) <strong>token 数不压缩</strong>(高分辨率时 token 太多,成本高);(b) 逐 token 独立(无跨 token 交互,可能损失全局信息);(c) 依赖视觉塔的'语言对齐质量'(若视觉塔未与语言对齐,MLP 难以弥补)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'简单连接器 + 高质量数据'是重要经验</strong>——LLaVA 证明'不必用复杂的 Q-Former',MLP 已足够;关键是<strong>数据质量与训练策略</strong>。这降低了 VLM 的实现门槛(LLaVA 因此被广泛复现)。② <strong>'两阶段训练'是标准范式</strong>——先'只训连接器'(对齐),再'联合微调'(学指令);这个顺序很重要(避免破坏 LLM)。③ <strong>'token 数不压缩'是 MLP 的主要缺点</strong>——高分辨率场景下视觉 token 爆炸(成本高);故后续工作引入'token 压缩'(如 LLaVA-NeXT 的 AnyRes + 池化、LLaVA-OneVision 的 token 压缩)。④ <strong>'逐 token 独立'的局限</strong>——MLP 不做跨 token 交互,故无法'聚合全局信息';对'需要全局理解'的任务(如整图摘要)可能不如 Q-Former。⑤ <strong>'视觉塔冻结'的取舍</strong>——冻结省算力、避免遗忘,但限制了'适配高分辨率/新领域'的能力;故有工作'部分解冻'(顶层)或'用更高分辨率的视觉塔'。⑥ <strong>面试要点</strong>——被问'LLaVA 的投影器',应给出'<strong>两层 MLP(不压缩 token、逐 token 独立)+ 两阶段训练(先只训连接器、再联合微调)</strong>'与'<strong>简单连接器 + 高质量数据 > 复杂结构</strong>'的经验;能指出'不压缩 token 导致高分辨率成本高'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为连接器越复杂越好(MLP 已足够)
- ✕阶段一就联合训练(破坏 LLM 语言能力)
🎯 Interviewer Follow-ups
- ?MLP 为什么不压缩 token 数?
- ?LLaVA 的两阶段训练怎么做的?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.