M6-024M6: Multimodal & Generative ModelsVLM Connectors & ProjectionsHard
Mastery:

VLM Connectors & Projections: 解释 VLM 中视觉 token 的放置位置(前置 / 后置 / 交错)与影响。

📐 Mathematical Definition
prepend: [v;t];interleave: t1vt2;causal⇒position decides visibility\text{prepend}:\ [v;t];\qquad \text{interleave}:\ t_1v t_2;\qquad \text{causal}\Rightarrow\text{position decides visibility}
⚡ Executive Summary
Core Concept: 视觉 token 通常放在文本前(前置)或按需插入(交错);位置影响注意力可见性与衰减,且训练推理必须一致。

📌 Key Takeaways

  • •
    前置:视觉 token 在文本前(最常见,简单、注意力对称)
  • •
    交错:图放在被引用的位置(多图/文档场景更自然)
  • •
    后置不推荐(因果注意力下文本看不到后面的视觉 token)

📐 Mathematical Derivations

数学机理:<strong>三种放置方式</strong>。(1) <strong>前置(prepend)</strong>——视觉 token 放在<strong>文本之前</strong>:<code>[v_1...v_N][t_1...t_L]</code>。<strong>为什么最常见</strong>——(a) <strong>实现简单</strong>(拼接即可);(b) <strong>注意力对称</strong>(文本 token 可自由关注前面的视觉 token);(c) <strong>与训练一致</strong>。(2) <strong>后置(append)</strong>——视觉 token 放在<strong>文本之后</strong>。<strong>问题</strong>——由于<strong>因果注意力</strong>,视觉 token <strong>无法被前面的文本 token 关注</strong>(文本在视觉之前,看不到后面);故对'根据文本查询图像'的任务不利。故后置较少用。(3) <strong>交错(interleave)</strong>——视觉 token 插入到<strong>被引用的位置</strong>:<code>t_1 [v] t_2</code>(如'如图所示 [v],图中有一只猫')。<strong>优点</strong>——(a) <strong>语义自然</strong>(图在其被讨论的位置);(b) 对<strong>多图</strong>场景可明确'哪张图对应哪段文字';<strong>缺点</strong>——(a) 需构造交错数据;(b) 位置编码更复杂。<strong>位置的影响机制</strong>——(a) <strong>因果注意力</strong>——前面的 token 无法看后面的(位置决定'谁能看谁');(b) <strong>位置编码衰减</strong>——RoPE 的远距离衰减使'距离远的 token 交互弱';(c) <strong>lost in the middle</strong>——中间位置的信息易被忽略。<strong>实践建议</strong>——(a) <strong>默认前置</strong>(简单、有效);(b) <strong>多图/引用密集场景用交错</strong>(更精确);(c) <strong>训练与推理必须一致</strong>(不一致会显著掉点);(d) 避免把视觉 token 放在'中间被忽略'的位置。<strong>实证</strong>——(a) 前置与交错在单图任务上差异不大;(b) 多图/引用任务上交错更好;(c) 位置不一致会导致性能显著下降(常见部署错误)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'前置最常用'的工程原因</strong>——简单、无需特殊数据、注意力对称;故是默认选择。② <strong>'后置为何不好'</strong>——因果注意力使文本无法关注后面的视觉 token;这是'位置决定注意力可见性'的直接后果。③ <strong>'交错更自然但需数据'</strong>——交错数据的构造更复杂(需标注'哪段文字对应哪张图');故主要用于多图/文档场景。④ <strong>'训练-推理位置必须一致'是硬约束</strong>——这是常见的部署错误(训练前置、推理交错 → 性能崩塌);应把位置策略固化为配置。⑤ <strong>'与位置编码的配合'</strong>——视觉 token 的'位置'需正确编码(如 2D RoPE 表示图内位置、全局顺序表示图在序列中的位置);否则模型无法区分。⑥ <strong>面试要点</strong>——被问'视觉 token 放在哪',应给出'<strong>前置(默认)+ 交错(多图/引用场景)+ 后置不推荐(因果注意力看不到)</strong>'与'<strong>位置影响注意力可见性、训练推理必须一致</strong>';能指出'后置的问题源于因果注意力'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    把视觉 token 后置(文本无法关注到)
  • ✕
    训练与推理用不同的位置策略
🎯 Interviewer Follow-ups
  • ?
    为什么后置不好?
  • ?
    位置不一致会有什么后果?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-023: VLM Connectors & Projections: 解释多图与交错输入(interleaved)的处理。📋Back to BankNext →M6-025: Dynamic Resolution & Visual Tokens: 解释动态分辨率(native resolution)的原理与动机。