M6-032M6: Multimodal & Generative ModelsVLM Training & EvaluationEasy
Mastery:
VLM Training & Evaluation: 描述 VLM 的典型三阶段训练流程。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: ① 对齐(只训连接器)→ ② 指令微调(解冻 LLM)→ ③ 可选的对齐/偏好优化(DPO)。
📌 Key Takeaways
- •阶段一:冻结视觉塔与 LLM,只训连接器(图文对齐)
- •阶段二:解冻 LLM,用多模态指令数据微调
- •阶段三:偏好优化(DPO/RLHF)提升有用性与减少幻觉
📐 Mathematical Derivations
数学机理:<strong>三阶段流程</strong>(以 LLaVA 系列为代表)。(1) <strong>阶段一:特征对齐预训练</strong>——<strong>冻结视觉塔与 LLM</strong>,只训练连接器;数据是<strong>图文对</strong>(图像 + 描述,如 CC3M 的子集),损失是'根据图像生成描述'的交叉熵。<strong>目的</strong>——让连接器学会把视觉特征'翻译'到 LLM 能理解的空间(对齐)。<strong>数据量</strong>——通常较小(数十万到数百万图文对,LLaVA 用 595k);<strong>训练步数</strong>少(1 epoch 左右)。(2) <strong>阶段二:多模态指令微调</strong>——<strong>解冻 LLM</strong>(视觉塔通常仍冻结),用<strong>多模态指令数据</strong>(问答、对话、推理、OCR 等)联合训练连接器与 LLM。<strong>目的</strong>——(a) 让 LLM 学会'按指令使用视觉信息';(b) 提升多样任务能力。<strong>数据</strong>——质量比数量关键(LLaVA 用 GPT-4 生成的 158k 指令数据;后续工作用更大规模);<strong>格式</strong>——<code>(图像, 指令, 回答)</code> 三元组。(3) <strong>阶段三:偏好优化(可选但重要)</strong>——用<strong>偏好数据</strong>(对同一图文输入的两个回答做人类/AI 偏好标注)做 DPO/RLHF。<strong>目的</strong>——(a) 减少<strong>幻觉</strong>(VLM 的主要问题);(b) 提升有用性与格式遵循;(c) 对齐人类偏好。<strong>代表</strong>——LLaVA-RLHF、RLHF-V(用细粒度偏好数据减少幻觉)。<strong>其他阶段/变体</strong>——(a) <strong>视觉塔的继续训练</strong>(阶段 2.5)——高分辨率/新领域适配时解冻视觉塔;(b) <strong>多阶段混合</strong>(如 Qwen2-VL 的多阶段:先对齐、再多任务预训练、再指令微调);(c) <strong>持续预训练</strong>(用大规模交错图文数据)。<strong>关键原则</strong>——'<strong>先对齐、再联合、最后偏好</strong>';且<strong>每阶段的数据质量与任务覆盖</strong>决定上限。<strong>训练细节</strong>——(a) <strong>损失掩码</strong>(只对回答算损失,与文本 SFT 一致);(b) <strong>学习率</strong>(连接器阶段较大、LLM 阶段较小);(c) <strong>序列打包</strong>(多模态数据长度差异大,需注意 padding 效率)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'先对齐再联合'是关键顺序</strong>——若一开始联合训练,随机初始化的连接器会产生'无意义视觉 token',破坏 LLM 的语言能力。② <strong>'阶段一数据量不必大'</strong>——它的目的是'对齐'而非'学知识';故数十万图文对足够(LLaVA 用 595k)。③ <strong>'阶段二数据质量决定上限'</strong>——LLaVA 用 GPT-4 生成指令数据是关键创新(覆盖多样任务、答案质量高);后续工作(如 ShareGPT4V、Allava)进一步扩大与改进。④ <strong>'阶段三对 VLM 尤其重要'</strong>——因为 <strong>VLM 幻觉</strong>(描述图中不存在的内容)是主要问题;偏好优化(尤其'细粒度偏好',如 RLHF-V 用'逐句标注')能显著减少幻觉。⑤ <strong>'视觉塔冻结的取舍'</strong>——冻结省算力但限制'高分辨率/新领域适配';故需按需解冻(见连接器训练策略题)。⑥ <strong>面试要点</strong>——被问'VLM 怎么训练',应给出'<strong>三阶段(对齐连接器 → 指令微调 → 偏好优化)+ 每阶段的目的与数据 + 为什么顺序重要</strong>',并强调'<strong>阶段三对减少 VLM 幻觉重要</strong>';这是 VLM 类问题的基本盘。
⚠️ Common Interview Pitfalls
- ✕跳过阶段一直接联合训练(破坏语言能力)
- ✕忽略阶段三(VLM 幻觉严重)
🎯 Interviewer Follow-ups
- ?阶段一的数据量需要多少?
- ?为什么阶段三(偏好优化)对 VLM 重要?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.