M6-020M6: Multimodal & Generative ModelsVLM Connectors & ProjectionsMedium
Mastery:

VLM Connectors & Projections: 比较 MLP、Q-Former、Perceiver Resampler 三类连接器。

📐 Mathematical Definition
MLP: RN×dv→RN×dllm;Q-Former/Resampler: RN×dv→RK×d\text{MLP}:\ \mathbb{R}^{N\times d_v}\to\mathbb{R}^{N\times d_{\text{llm}}};\qquad \text{Q-Former/Resampler}:\ \mathbb{R}^{N\times d_v}\to\mathbb{R}^{K\times d}
⚡ Executive Summary
Core Concept: MLP 不压缩、逐 token、最简单;Q-Former 用查询压缩为固定 K;Perceiver Resampler 类似但更轻量、可处理变长输入。

📌 Key Takeaways

  • •
    MLP:不压缩、逐 token 独立、最简、token 数随分辨率增长
  • •
    Q-Former:查询式压缩为 K 个、结构复杂、多目标训练
  • •
    Perceiver Resampler:查询式压缩、更轻量、原生支持变长(多图/视频)

📐 Mathematical Derivations

数学机理:<strong>三类连接器的机制对比</strong>。(1) <strong>MLP(如 LLaVA)</strong>——逐 token 的两层 MLP 投影:h_v=MLP(z_v);<strong>不改变 token 数</strong>(N→N)。<strong>优点</strong>——简单、训练稳定、保留全部空间细节。<strong>缺点</strong>——token 数随分辨率平方增长(成本高)、无跨 token 交互。(2) <strong>Q-Former(如 BLIP-2)</strong>——K 个可学习查询 + 交叉注意力 → 输出固定 K 个 token(N→K)。<strong>优点</strong>——压缩(成本可控、与分辨率解耦)、跨 token 聚合(可学习地选择信息)。<strong>缺点</strong>——信息瓶颈(K 小则细节丢失)、结构复杂(多目标训练)。(3) <strong>Perceiver Resampler(如 Flamingo)</strong>——机制与 Q-Former 类似(可学习查询 + 交叉注意力),但<strong>更轻量</strong>(层数少、无文本侧交互);<strong>关键特性</strong>——<strong>原生支持变长输入</strong>(因为查询数固定,无论输入多少 patch/frame,输出都是 K 个 token)。<strong>优点</strong>——(a) 压缩;(b) <strong>天然处理多图/视频</strong>(把多图/多帧的 token 拼起来,用同一组查询抽取);(c) 结构简单(纯视觉侧)。<strong>缺点</strong>——信息瓶颈(同 Q-Former)。<strong>选择依据</strong>——(a) <strong>单图、分辨率不高、追求简单</strong> → <strong>MLP</strong>;(b) <strong>需要压缩(高分辨率/多图/视频)</strong> → <strong>Q-Former / Perceiver Resampler</strong>;(c) <strong>多图/视频</strong> → <strong>Perceiver Resampler</strong>(变长友好);(d) <strong>追求最强效果且资源充足</strong> → 'MLP + 高分辨率 + 数据'(现代趋势)。<strong>现代实践(融合)</strong>——(a) <strong>LLaVA-NeXT / OneVision</strong>——用 MLP + <strong>token 压缩</strong>(如把 2×2 相邻 patch 池化为 1 个 token)兼顾细节与成本;(b) <strong>Qwen-VL</strong>——用<strong>交叉注意力压缩器</strong>(把视觉 token 压到固定数量)+ 动态分辨率;(c) <strong>Flamingo</strong>——Perceiver Resampler 处理多图/视频。<strong>共同趋势</strong>——'<strong>动态分辨率(保细节)+ token 压缩(控成本)</strong>'的组合成为主流;纯 MLP(不压缩)与纯 Q-Former(固定 K)都在向'中间路线'靠拢。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'压缩 vs 细节'是连接器选择的核心权衡</strong>——压缩省成本但丢细节(对 OCR/定位不利);不压缩保细节但成本高。故需按任务选。② <strong>'Perceiver Resampler 的变长优势'</strong>——查询数固定使输出长度与输入长度解耦,这是'多图/视频'的关键(不同数量的输入帧 → 相同的 K 个 token);故 Flamingo 用它处理交错图文与视频。③ <strong>'Q-Former 的复杂性代价'</strong>——多目标训练(ITC/ITM/ITG)需精心设计;而 MLP 只需'投影 + 微调'。故'简单方案'在工程上更受欢迎。④ <strong>'现代融合路线'的合理性</strong>——'动态分辨率'保留细节(按原生分辨率切分),'token 压缩'控制成本(池化/查询压缩);两者结合兼顾'细节'与'效率'。⑤ <strong>'与视觉塔的配合'</strong>——若视觉塔已提供语言对齐特征(CLIP/SigLIP),则 MLP 足够;若视觉塔是'纯视觉'(DINOv2),则需更强的连接器(Q-Former)来建立语言对齐。⑥ <strong>面试要点</strong>——被问'三类连接器的差异',应给出'<strong>MLP(不压缩、逐 token、简单)vs Q-Former(查询压缩为 K、复杂、多目标)vs Perceiver Resampler(查询压缩、轻量、支持变长)</strong>'与'<strong>压缩 vs 细节的权衡</strong>';能指出'动态分辨率 + token 压缩的融合趋势'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    在高分辨率场景用纯 MLP(token 爆炸)
  • ✕
    忽略 Perceiver Resampler 的变长优势
🎯 Interviewer Follow-ups
  • ?
    为什么 Perceiver Resampler 天然支持变长输入?
  • ?
    什么场景应该用压缩型连接器?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-019: VLM Connectors & Projections: 解释 BLIP-2 的 Q-Former 与它的作用。📋Back to BankNext →M6-021: VLM Connectors & Projections: 解释原生多模态(early fusion)架构与后期融合的差异。