返回 多模态 思维导图
中文·English
👁️ 多模态ID: vlm-three-stage

VLM 三阶段训练

VLM 3-Stage Pipeline
🎯核心定义
VLM 三阶段训练 (LLaVA/Qwen2-VL 范式) 按 预对齐 → 图文交错预训练 → 视觉指令 SFT 推进, 各阶段冻结策略如下:
📌核心概述
| 阶段 | 视觉编码器 | 投影器 | LLM | 数据 | 目的 | |:--|:--|:--|:--|:--|:--| | Stage 1 预对齐 | 冻结 | 训练 | 冻结 | 图文对 (如 CC3M ~558K) | 视觉特征 → 文本 embedding 空间 | | Stage 2 图文交错预训练 | 冻结 | 训练 | 解冻 (全参) | 图文交错文档 + 高质量图文对 | 世界知识 / 多图与长上下文 | | Stage 3 视觉指令 SFT | 冻结 | 训练 | 解冻 (全量或 LoRA) | 视觉指令数据 (VQA/对话) | 指令对齐与对话能力 |
📌核心概述
投影器 (LLaVA 用两层 MLP, BLIP-2/Qwen-VL 用 Q-Former) 把视觉特征映射进 LLM embedding: hv=MLPϕ(ViTψ(x))h_v = \text{MLP}_\phi(\text{ViT}_{\psi^*}(x)), ψ\psi^* 表示编码器参数冻结 (不更新); 每阶段目标都是对 assistant 文本 token 的 Masked CE (见 masked-cross-entropy 卡)。 视觉编码器全程冻结的原因: CLIP/SigLIP 预训练特征质量高且稳定, 解冻会漂移特征空间、需要海量数据重新学, 且冻结 ViT 省掉整个编码器反向传播的显存与算力。
💡使用场景
面试高频考“三阶段流程/每阶段冻结什么、为什么”; 训练预算受限时决定在哪一阶段用 LoRA (通常 Stage 3), 或判断开源模型 (LLaVA-1.5 两阶段 vs Qwen2-VL 三阶段) 的配方差异。
解决的核心痛点
端到端全参从头训 VLM 数据需求大、容易破坏视觉特征; 三阶段把 特征对齐 (小数据可收敛)、知识注入 (大算力放预训练)、指令对齐 (数据少但关键) 解耦——Stage 1 冻结双塔只用 ~558K 图文对即完成维度/语义对齐 (投影器参数量两个数量级小于 LLM), Stage 2 在联合上下文里获得推理, Stage 3 用指令数据对齐格式与偏好, 训练效率与稳定性显著优于一次性全量训练。
🎯5 个高频面试考点 (Exam Points)
1
画出 VLM 三阶段训练流程表: 每阶段冻结什么、训练什么、用什么数据?
2
为什么视觉编码器全程冻结?解冻会有什么后果?
3
Stage 1 只训投影器的目的?投影器的输入输出维度?
4
Stage 3 何时用全参微调、何时用 LoRA?选择依据?
5
三阶段配方与 LLaVA 两阶段 / Qwen2-VL 三阶段的对应关系?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「VLM 三阶段训练」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Native 同构多模态下一个知识点Masked Cross-Entropy

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用