M6-006M6: Multimodal & Generative ModelsVision Encoders (ViT / ConvNeXt)Hard
Mastery:
Vision Encoders (ViT / ConvNeXt): 解释视觉 token 数量对成本的影响。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 视觉 token 数 ∝ 分辨率²/patch²;它同时占用 LLM 的注意力成本(O(L²))与上下文预算,是 VLM 成本主因。
📌 Key Takeaways
- •token 数随分辨率平方增长(HW/P²)
- •占用 LLM 注意力成本(O((N_v+N_t)²))与 KV cache
- •挤占上下文预算(视觉 token 多则文本能放得少)
📐 Mathematical Derivations
数学机理:<strong>成本的三重影响</strong>。(1) <strong>注意力成本</strong>——LLM 的注意力复杂度 O(L²),其中 L=N_v+N_t(视觉 + 文本 token);故视觉 token 增加会<strong>平方级</strong>地增加注意力成本。(2) <strong>KV cache 显存</strong>——∝L(每层每 token 一组 K/V);长视觉序列使 KV cache 显著增长(影响并发数与吞吐)。(3) <strong>上下文预算挤占</strong>——总长度受 L_max 限制;若一张高分辨率图占 4000 token,则留给文本/多图的空间大幅减少(多图场景更严重)。<strong>定量</strong>——(a) 224²、P=14 → N_v=256(约 1/4 个 1k 上下文);(b) 448² → 1024;(c) 1024² → 5329(约 5k token,占满小模型的上下文);(d) 若用 AnyRes 切 4 块 448² + 全局图 → 约 5×1024=5120 token。故'高分辨率 VLM 的推理成本可能远高于同参数量的纯文本模型'。<strong>缓解手段</strong>——(a) <strong>提高 patch 大小</strong>(P 大则 token 少,但细节损失);(b) <strong>token 压缩</strong>(连接器压缩、池化、注意力池化、Perceiver 式查询);(c) <strong>动态分辨率</strong>(按需分配:简单图低分辨率、文档图高分辨率);(d) <strong>视觉 token 剪枝</strong>(推理时丢弃冗余 token);(e) <strong>分块 + 局部注意力</strong>(不让所有视觉 token 全局交互);(f) <strong>两阶段</strong>(先用视觉塔做检索/筛选,只把相关区域送 LLM)。<strong>与'分辨率需求'的矛盾</strong>——很多任务(OCR、文档理解、细粒度识别)<strong>需要高分辨率</strong>;故'分辨率 vs 成本'是 VLM 的核心权衡。<strong>实践</strong>——(a) 通用 VLM 常用 336~448 的固定分辨率(约 576~1024 token);(b) 文档/OCR 场景需 1k+ 分辨率 + token 压缩;(c) 有工作用'动态分辨率 + 压缩'在保持细节的同时控制成本。<strong>度量</strong>——报告'每张图的 token 数'与'端到端延迟/成本';并做'分辨率 vs 任务指标'的曲线(找最优点)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'视觉 token 是 VLM 成本的主因'是重要认知</strong>——因为它的数量级远大于文本(一张图几百到几千 token vs 一句话几十 token)。故 VLM 的效率优化<strong>首先看视觉 token</strong>。② <strong>'分辨率 vs 成本的平方关系'</strong>——分辨率翻倍 → token 数 ×4 → 注意力成本 ×16;故'无脑提高分辨率'的成本代价极高。③ <strong>'token 压缩是必修课'</strong>——在保持信息的前提下减少 token 数(如把 4 个相邻 patch 池化为 1 个 token);代价是空间细节损失(对 OCR/定位不利)。④ <strong>'动态分辨率的价值'</strong>——按需分配(简单图少 token、复杂图多 token)是'性价比最优'的方向;这也是用户项目(Qwen2.5-VL 的动态分辨率)的核心能力。⑤ <strong>'与上下文预算的冲突'</strong>——多图/视频场景下视觉 token 会迅速占满上下文;故需 (a) 压缩、(b) 分层处理(先粗后细)、(c) 检索式(只送相关帧)。⑥ <strong>面试要点</strong>——被问'视觉 token 的成本',应给出'<strong>N=HW/P²(平方增长)+ 三重影响(注意力 O(L²)、KV cache、上下文挤占)</strong>'与'<strong>六类缓解手段</strong>';能给出'448² 图约 1024 token、1024² 约 5329 token'的量化直觉是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕忽略视觉 token 挤占上下文预算
- ✕只提高分辨率不做 token 压缩
🎯 Interviewer Follow-ups
- ?为什么高分辨率 VLM 很贵?
- ?如何量化'视觉 token 的边际成本'?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.