M6-021M6: Multimodal & Generative ModelsVLM Connectors & ProjectionsMedium
Mastery:
VLM Connectors & Projections: 解释原生多模态(early fusion)架构与后期融合的差异。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 后期融合:各模态独立编码后拼接;早期融合:用统一 tokenizer 把所有模态转为 token,从底层就混合。
📌 Key Takeaways
- •后期融合:模态各自编码(视觉塔 + 文本塔)再拼接
- •早期融合:统一 tokenizer,从第一层就混合模态
- •早期融合更统一但需从头训练;后期融合更模块化、易复用
📐 Mathematical Derivations
数学机理:<strong>两种融合范式</strong>。(1) <strong>后期融合(late fusion,模块化)</strong>——各模态<strong>独立编码</strong>:(a) 视觉塔(CLIP/SigLIP)编码图像 → 视觉 token;(b) 文本塔(LLM 的 embedding)编码文本 → 文本 token;(c) <strong>连接器</strong>投影视觉 token;(d) 拼接后送入 LLM(视觉与文本 token 从<strong>LLM 的第一层</strong>开始交互)。<strong>注意</strong>——虽然交互从 LLM 第一层开始,但<strong>模态各自的编码是分离的</strong>(视觉塔与文本塔独立)。<strong>优点</strong>——(a) <strong>模块化</strong>(视觉塔可复用现成的 CLIP/SigLIP);(b) <strong>训练成本低</strong>(可冻结视觉塔,只训连接器与 LLM);(c) <strong>生态成熟</strong>(大多数 VLM 如此,如 LLaVA、Qwen-VL)。(2) <strong>早期融合(early fusion,原生多模态)</strong>——用<strong>统一的 tokenizer</strong> 把<strong>所有模态</strong>(文本、图像、音频、视频)转为<strong>同一套 token</strong>(离散 token 或连续嵌入),然后用<strong>一个统一的 Transformer</strong> 从底层处理。<strong>代表</strong>——(a) <strong>Chameleon</strong>(Meta,用 VQ-VAE 把图像转为离散 token,与文本 token 一起用自回归建模);(b) <strong>Gemini</strong>(原生多模态);(c) <strong>GPT-4o</strong>(原生多模态,端到端);(d) <strong>Emu3</strong>(全 token 化)。<strong>优点</strong>——(a) <strong>统一</strong>(一个模型处理所有模态,无需连接器);(b) <strong>深度交互</strong>(模态从底层混合,可能学到更深的跨模态表示);(c) <strong>支持任意模态组合</strong>(包括生成)。<strong>缺点</strong>——(a) <strong>需从头训练</strong>(不能用现成的视觉塔);(b) <strong>成本极高</strong>(大规模多模态数据 + 大模型);(c) <strong>离散化的信息损失</strong>(VQ-VAE 把连续图像压成离散 token,有损);(d) <strong>训练不稳定</strong>(多模态数据的分布差异大)。<strong>权衡</strong>——(a) <strong>资源有限/快速迭代</strong> → 后期融合;(b) <strong>追求极致统一与生成能力、资源充足</strong> → 早期融合。<strong>实践现状</strong>——后期融合仍是主流(成本与灵活性优势);早期融合是前沿方向(大厂在探索)。<strong>中间形态</strong>——(a) <strong>部分早期融合</strong>(视觉 token 与文本 token 共享部分层);(b) <strong>共享注意力的双塔</strong>;(c) <strong>混合</strong>(视觉用连续嵌入、生成用离散 token)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'后期融合更流行'的现实原因</strong>——(a) 可复用现成视觉塔(CLIP/SigLIP 是免费的高质量资产);(b) 训练成本低(可冻结视觉塔);(c) 迭代快。故'资源有限时选后期融合'。② <strong>'早期融合的统一性优势'</strong>——它能 (a) 处理任意模态组合、(b) 统一生成与理解(同一个自回归框架);但代价是'从头训练 + 离散化损失 + 不稳定'。③ <strong>'离散化的信息损失'是早期融合的核心难题</strong>——VQ-VAE 把连续图像压成有限码本(如 8192 个 token),信息有损;这限制了'高保真生成'(对比扩散模型的连续潜空间)。④ <strong>'训练不稳定'的具体表现</strong>——不同模态的 token 分布差异大(文本 token 稀疏、图像 token 密集),混合训练易导致 (a) 损失尖峰、(b) 模态失衡(某模态主导)。故需 (a) 模态平衡的采样、(b) 专门的归一化/损失权重。⑤ <strong>'与生成的关系'</strong>——早期融合天然支持'图像生成'(因为图像也是 token,可用自回归生成);后期融合的 VLM 通常只做'理解'(生成需额外的扩散模型)。故'统一理解与生成'是早期融合的独特能力(如 Chameleon、Emu3)。⑥ <strong>面试要点</strong>——被问'early vs late fusion',应给出'<strong>后期融合(模块化、可复用、训练省)vs 早期融合(统一 tokenizer、深度交互、支持生成,但需从头训练 + 离散化损失)</strong>'与'<strong>资源有限选后期融合</strong>'的判断;能指出'离散化信息损失'与'模态失衡'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕认为早期融合总是更好(成本与离散化损失大)
- ✕忽略后期融合的'视觉塔可复用'优势
🎯 Interviewer Follow-ups
- ?原生多模态的优势与代价?
- ?为什么后期融合更流行?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.