🎯核心定义
VLM 三阶段训练 (LLaVA/Qwen2-VL 范式) 按 预对齐 → 图文交错预训练 → 视觉指令 SFT 推进, 各阶段冻结策略如下:
📌核心概述
| 阶段 | 视觉编码器 | 投影器 | LLM | 数据 | 目的 |
|:--|:--|:--|:--|:--|:--|
| Stage 1 预对齐 | 冻结 | 训练 | 冻结 | 图文对 (如 CC3M ~558K) | 视觉特征 → 文本 embedding 空间 |
| Stage 2 图文交错预训练 | 冻结 | 训练 | 解冻 (全参) | 图文交错文档 + 高质量图文对 | 世界知识 / 多图与长上下文 |
| Stage 3 视觉指令 SFT | 冻结 | 训练 | 解冻 (全量或 LoRA) | 视觉指令数据 (VQA/对话) | 指令对齐与对话能力 |
📌核心概述
投影器 (LLaVA 用两层 MLP, BLIP-2/Qwen-VL 用 Q-Former) 把视觉特征映射进 LLM embedding:
hv=MLPϕ(ViTψ∗(x)),
ψ∗ 表示编码器参数冻结 (不更新); 每阶段目标都是对 assistant 文本 token 的 Masked CE (见 masked-cross-entropy 卡)。
视觉编码器全程冻结的原因: CLIP/SigLIP 预训练特征质量高且稳定, 解冻会漂移特征空间、需要海量数据重新学, 且冻结 ViT 省掉整个编码器反向传播的显存与算力。
💡使用场景
面试高频考“三阶段流程/每阶段冻结什么、为什么”; 训练预算受限时决定在哪一阶段用 LoRA (通常 Stage 3), 或判断开源模型 (LLaVA-1.5 两阶段 vs Qwen2-VL 三阶段) 的配方差异。
⚡解决的核心痛点
端到端全参从头训 VLM 数据需求大、容易破坏视觉特征; 三阶段把 特征对齐 (小数据可收敛)、知识注入 (大算力放预训练)、指令对齐 (数据少但关键) 解耦——Stage 1 冻结双塔只用 ~558K 图文对即完成维度/语义对齐 (投影器参数量两个数量级小于 LLM), Stage 2 在联合上下文里获得推理, Stage 3 用指令数据对齐格式与偏好, 训练效率与稳定性显著优于一次性全量训练。