M6-005M6: Multimodal & Generative ModelsVision Encoders (ViT / ConvNeXt)Hard
Mastery:
Vision Encoders (ViT / ConvNeXt): 解释视觉编码器的输出如何与语言模型对齐。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 视觉塔输出 patch token,经连接器投影到 LLM 的词嵌入空间,作为'视觉 token'与文本拼接送入 LLM。
📌 Key Takeaways
- •视觉塔输出 N 个 d_v 维 patch token
- •连接器投影到 LLM 的 d_llm 维(对齐空间)
- •与文本 embedding 拼接送入 LLM(视觉 token 参与自注意力)
📐 Mathematical Derivations
数学机理:<strong>对齐的三步</strong>。(1) <strong>视觉编码</strong>——视觉塔(ViT/SigLIP)把图像编码为 <strong>N 个 d_v 维</strong>的 patch token:z_v = f_v(image) ∈ ℝ^{N×d_v}。(2) <strong>投影(连接器)</strong>——用一个映射 W_c 把视觉 token 投到 LLM 的<strong>词嵌入空间</strong>(d_llm 维):h_v = W_c·z_v ∈ ℝ^{N×d_llm}。<strong>为什么需要</strong>——(a) <strong>维度不同</strong>(d_v 可能 ≠ d_llm);(b) <strong>空间不同</strong>(视觉特征与词嵌入是<strong>不同的表示空间</strong>,直接拼接会让 LLM '看不懂');(c) <strong>token 数太多</strong>(N 可能远大于文本长度,需压缩)。(3) <strong>拼接与自注意力</strong>——把 h_v 与文本 token 的 embedding <strong>拼接</strong>([h_v; e_text])送入 LLM;LLM 的自注意力让视觉与文本 token <strong>互相交互</strong>(视觉 token 可被文本查询、反之亦然),从而实现'多模态理解'。<strong>对齐的两个层次</strong>——(a) <strong>空间对齐(spatial alignment)</strong>——视觉 patch 与图像区域对应(保持空间结构,利于 grounding);(b) <strong>语义对齐(semantic alignment)</strong>——视觉表示与语言语义对应(CLIP 预训练已提供部分语义对齐)。<strong>关键设计选择</strong>——(a) <strong>连接器类型</strong>(MLP / Q-Former / Perceiver Resampler,见下一主题);(b) <strong>视觉塔是否冻结</strong>(冻结则只训连接器,省算力但上限低;联合训练上限高但成本高);(c) <strong>token 数</strong>(是否压缩、压缩多少);(d) <strong>视觉 token 的位置</strong>(前置/后置/交错)。<strong>为什么'拼接 + 自注意力'有效</strong>——因为 LLM 的注意力机制不区分 token 来源;只要视觉 token 的表示'落在 LLM 能理解的空间'(通过连接器与训练对齐),LLM 就能像处理文本一样处理视觉信息。这是'<strong>用统一的自回归框架处理多模态</strong>'的核心思想。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'连接器是桥梁'</strong>——它是 VLM 中最小的模块(参数量少)但<strong>关键</strong>(决定视觉信息能否被 LLM 利用);故 VLM 训练的第一阶段常是'只训连接器'(冻结视觉塔与 LLM)。② <strong>'视觉 token 数远多于文本'是核心工程约束</strong>——一张 448² 图 = 784 token,而一个句子可能只有 20 token;故<strong>token 压缩</strong>(连接器压缩、池化、或原生低分辨率)是 VLM 效率的关键(见视觉 token 压缩题)。③ <strong>'对齐的质量决定 VLM 上限'</strong>——若连接器/训练不足,LLM 会'看不到'视觉细节(表现为'答非所问'或'幻觉');故需 (a) 足够的多模态训练数据、(b) 合理的训练阶段(先对齐、再指令微调)。④ <strong>'空间对齐 vs 语义对齐'的取舍</strong>——CLIP 提供语义对齐(但可能丢失空间细节);某些任务(OCR、定位)需<strong>空间对齐</strong>(保留 patch 的位置信息),故有'高分辨率 + 位置编码'的设计(见动态分辨率题)。⑤ <strong>'与原生多模态的区别'</strong>——'视觉塔 + 连接器 + LLM'是<strong>后期融合</strong>(模态各自编码后融合);'原生多模态'(early fusion)用统一 tokenizer 处理所有模态(见连接器架构题)。⑥ <strong>面试要点</strong>——被问'视觉如何与 LLM 对齐',应给出'<strong>视觉编码 → 连接器投影到词嵌入空间 → 与文本拼接 → 自注意力交互</strong>'三步,并强调'<strong>连接器虽小但关键</strong>'与'<strong>视觉 token 数远多于文本(需压缩)</strong>';这是 VLM 类问题的基本盘。
⚠️ Common Interview Pitfalls
- ✕直接拼接未投影的视觉特征(空间不匹配)
- ✕忽略视觉 token 数对 LLM 上下文的占用
🎯 Interviewer Follow-ups
- ?为什么需要连接器(不能直接用)?
- ?对齐的两种层次:空间对齐 vs 语义对齐?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.