返回 多模态 思维导图
中文·English
👁️ 多模态ID: vlm-architecture

VLM 架构

VLM Architecture
🎯核心定义
视觉语言模型 (VLM) 的标准范式是「视觉编码器 + 投影器 + LLM」三段式: 视觉编码器 (CLIP ViT) 把图像切成 patch 编码成视觉特征 zvisz_{vis}, 投影器 (MLP/Q-Former) 把它对齐到 LLM 的文本嵌入空间, LLM 自回归生成文本, 训练目标是对 Assistant 文本 token 的交叉熵 L=tlogp(yty<t,v)\mathcal{L} = -\sum_t \log p(y_t \mid y_{<t}, \mathbf{v})。融合位置决定流派: LLaVA/Qwen-VL 在 LLM 输入层融合 (投影后视觉 token 拼进输入序列); BLIP-2 用 Q-Former 跨注意力先压缩再注入; Flamingo 把 cross-attention 层插进 LLM 各层 (interleaved fusion)。
💡使用场景
视觉问答 (VQA)、图像描述、OCR/文档理解、图表推理、视频理解, 以及多模态 Agent 的感知层; 面试常考「三种融合方式的差异」与「为什么选这个架构」。
解决的核心痛点
从零训练原生多模态 Transformer 的数据与算力代价过高; 三段式复用现成 LLM 的语言能力 + CLIP 的视觉能力, 只需训练轻量投影器 (百万级参数) 就能把视觉接入语言——三阶段训练 (预对齐 → 图文交错预训练 → 视觉 SFT) 把成本从「训练一个 LLM」降到「微调一个 LLM」, 且视觉/语言能力各自继承开源模型积累。
🎯5 个高频面试考点 (Exam Points)
1
VLM 三段式架构 (编码器/投影器/LLM) 各自的职责是什么?
2
LLaVA (输入层融合) 与 Flamingo (层内 cross-attention) 的区别?
3
为什么视觉特征要投影到文本嵌入空间?维度不匹配怎么处理?
4
VLM 训练目标为什么只算文本 token 的交叉熵?图像部分没有 loss 吗?
5
原生多模态 (GPT-4o/Chameleon) 与模块化 VLM (LLaVA) 的架构取舍?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「VLM 架构」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点CLIP 应用下一个知识点视觉编码器

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 双塔架构