M6-023M6: Multimodal & Generative ModelsVLM Connectors & ProjectionsHard
Mastery:
VLM Connectors & Projections: 解释多图与交错输入(interleaved)的处理。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 多图:把多张图的视觉 token 拼接(用分隔符标记);交错:按原文顺序插入图文 token,需位置编码与注意力设计支持。
📌 Key Takeaways
- •多图:拼接多组视觉 token,用特殊 token 分隔
- •交错:图文按原文顺序交织(如网页、漫画、对话)
- •挑战:位置编码、注意力范围、token 预算、图像数量泛化
📐 Mathematical Derivations
数学机理:<strong>两种输入形态</strong>。(1) <strong>多图输入(multi-image)</strong>——输入包含 M 张图 + 一个(或多个)问题;处理方式:把每张图的视觉 token 分别编码(ViT + 连接器),然后用<strong>特殊分隔 token</strong>(如 <code><image></code>、<code></image></code>)标记边界,拼成 <code>[img1 tokens][img2 tokens]...[question]</code>。<strong>挑战</strong>——(a) <strong>token 预算</strong>(M 张图 × N token,很快占满上下文);(b) <strong>图像数量泛化</strong>(训练时 2 张图、推理时 8 张,性能可能下降);(c) <strong>图像间关系</strong>(需模型理解'比较图 1 与图 2');(d) <strong>位置编码</strong>(不同图的 token 位置如何区分)。(2) <strong>交错输入(interleaved)</strong>——图文<strong>按原文顺序交织</strong>(如网页:文字-图-文字-图;漫画;多轮对话中的图片);处理方式:把文本 token 与图像 token 按<strong>出现顺序</strong>拼接:<code>t_1 v_1 t_2 v_2 ...</code>。<strong>额外挑战</strong>——(a) <strong>顺序敏感</strong>(图在文本中的位置有语义,如'如下所示'后接图);(b) <strong>可变结构</strong>(每段的图文数量不定);(c) <strong>长上下文</strong>(网页/文档可能很长);(d) <strong>训练数据稀缺</strong>(交错数据(如网页、图文书籍)比'图文对'难获取)。<strong>解决方案</strong>——(a) <strong>Perceiver Resampler / 固定 K 个 token</strong>——使每张图的 token 数固定(便于处理任意数量的图);(b) <strong>特殊 token 标记</strong>——用 <code><image></code>、<code><|image_i|></code> 等标记图像边界与索引;(c) <strong>图像索引嵌入</strong>——为每张图加一个可学习的'图像 id'嵌入(区分不同图);(d) <strong>位置编码设计</strong>——用 2D/3D RoPE(见动态分辨率题)或'图像内位置 + 全局顺序'的组合;(e) <strong>训练数据构造</strong>——用交错文档(网页、书籍、多图 QA)训练;(f) <strong>课程学习</strong>——从单图 → 多图 → 交错逐步训练。<strong>代表模型</strong>——(a) <strong>Flamingo</strong>(用 Perceiver Resampler 处理交错图文,支持任意数量);(b) <strong>Qwen-VL</strong>(支持多图与交错);(c) <strong>GPT-4V/Gemini</strong>(原生支持交错)。<strong>评估</strong>——(a) <strong>多图基准</strong>(如 NLVR2 的变体、多图 QA);(b) <strong>交错基准</strong>(如 MMMU 中的多图题、WikiHow 类);(c) <strong>图像数量泛化</strong>(训练 2 图、测 8 图)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'固定 K 个 token'是处理任意图像数量的关键</strong>——若每图 token 数固定(如 64),则 8 张图 = 512 token(可控);若用不压缩的 MLP(每图 576),则 8 张图 = 4608 token(昂贵)。故<strong>多图/交错场景倾向压缩型连接器</strong>。② <strong>'图像数量泛化'是常见失败模式</strong>——训练时图像数少,推理时多则性能下降;解法:(a) 训练时<strong>随机化图像数量</strong>、(b) 用'固定 K'避免长度变化、(c) 专门的泛化训练。③ <strong>'顺序敏感'需位置编码支持</strong>——交错输入中'图在文本中的位置'有语义;故需 (a) 全局顺序编码、(b) 图像内 2D 位置编码(区分图内 patch)。④ <strong>'交错数据稀缺'是训练瓶颈</strong>——高质量交错数据(网页、图文书籍、多图教程)远少于'图文对';故常 (a) 从网页爬取(噪声大)、(b) 合成(用模型生成)、(c) 混合使用。⑤ <strong>'token 预算的分配'</strong>——多图场景下每张图的 token 数需权衡(图多则每图少给 token);这是'分辨率/数量 vs 成本'的联合优化。⑥ <strong>面试要点</strong>——被问'多图与交错输入怎么处理',应给出'<strong>多图(拼接 + 分隔 token)vs 交错(按顺序交织)</strong>'与'<strong>四类挑战(token 预算/数量泛化/顺序敏感/数据稀缺)与对策(固定 K、特殊 token、图像 id、位置编码、随机化数量)</strong>';能指出'固定 K 个 token 是处理任意图像数的关键'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用不压缩的连接器处理多图(token 爆炸)
- ✕训练时固定图像数量(数量泛化差)
🎯 Interviewer Follow-ups
- ?交错输入为什么比多图更难?
- ?如何处理'图像数量不定'的问题?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.