返回 多模态 思维导图
中文·English
👁️ 多模态ID: vlm-projector

VLM 投影器 MLP/Q-Former

VLM Projector MLP/Q-Former
🎯核心定义
投影器把视觉特征对齐到 LLM 的文本嵌入空间, 三条主流路线: ① LLaVA 的线性/两层 MLP——h=MLP(zvis)h = \text{MLP}(z_{vis}), 每个 visual token 独立映射 (常 1024→4096 维), 保持 token 数与空间结构不变 (576→576); ② BLIP-2 的 Q-Former——一组可学习 query qR32×d\mathbf{q} \in \mathbb{R}^{32 \times d} 通过 cross-attention 从视觉特征里「检索式」提取信息, 把 576 个视觉 token 压缩成 32 个 query token; ③ C-Abstractor——用 2×22 \times 2 stride 卷积降采样, token 数直接除以 4。
💡使用场景
所有模块化 VLM 的第二段; 面试常考「LLaVA 为什么用 MLP 而 BLIP-2 用 Q-Former」与「压缩率怎么选」。
解决的核心痛点
视觉特征 (1024 维 CLIP 空间) 与文本嵌入 (4096 维 LLM 空间) 不在同一空间, 直接拼接无法对齐; MLP 路线零压缩、保留空间对应关系, 适合需要细节定位的任务 (OCR/grounding), 但 576 个视觉 token 进 LLM 会抬高每层 attention 成本; Q-Former 用 cross-attention 可学习 query 做信息压缩, token 数降 18 倍 (576→32), 推理更快, 但会丢空间细节——因此 BLIP-2 之后的 Qwen-VL 又走回「MLP + 更大视觉塔」路线, 说明投影器是「信息保真度 vs 压缩率」的权衡点。
🎯5 个高频面试考点 (Exam Points)
1
写出 MLP 投影公式 h=MLP(zvis)h = \text{MLP}(z_{vis}); LLaVA 投影前后 token 数与维度怎么变?
2
Q-Former 怎么把 576 个视觉 token 压缩成 32 个?可学习 query 的作用?
3
MLP 投影与 Q-Former 压缩的取舍?什么任务适合哪种?
4
投影器在预对齐阶段怎么训练?与 LLM 是否同步更新?
5
C-Abstractor 降采样的原理?token 数减少多少?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「VLM 投影器 MLP/Q-Former」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点多模态评测基准下一个知识点AnyRes 切块 / 动态 Token

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用