M6-030M6: Multimodal & Generative ModelsDynamic Resolution & Visual TokensHard
Mastery:

Dynamic Resolution & Visual Tokens: 解释视觉 token 与文本 token 的预算分配问题。

📐 Mathematical Definition
Nv+Nt≤Lmax⁡;cost∝(Nv+Nt)2;allocation is a design choiceN_v+N_t\le L_{\max};\qquad \text{cost}\propto(N_v+N_t)^2;\qquad \text{allocation}\ \text{is a design choice}
⚡ Executive Summary
Core Concept: 总长度受上下文限制;视觉 token 多则文本少;需按任务分配(文档多给视觉、对话多给文本)并压缩。

📌 Key Takeaways

  • •
    总长度受限:视觉 token 挤占文本预算
  • •
    成本 ∝ 总长度平方(注意力)+ KV cache
  • •
    分配策略:按任务类型(文档 vs 对话)与信息密度

📐 Mathematical Derivations

数学机理:<strong>预算分配的约束</strong>——(1) <strong>硬约束</strong>——总长度 N_v+N_t ≤ L_max(模型的上下文窗口);故视觉 token 越多,文本能放越少(多轮对话、长文档场景尤其严重)。(2) <strong>成本约束</strong>——注意力成本 ∝(N_v+N_t)²、KV cache ∝(N_v+N_t);故总长度直接决定成本与延迟。(3) <strong>信息约束</strong>——视觉 token 太少则细节丢失(OCR 失败)、文本 token 太少则指令/上下文不足。<strong>分配策略</strong>——(a) <strong>按任务类型</strong>——(i) <strong>文档/OCR/图表</strong> → 视觉为主(多给视觉 token,文本仅指令);(ii) <strong>对话/推理</strong> → 文本为主(视觉适度);(iii) <strong>多图比较</strong> → 每图适度(避免总量爆炸)。(b) <strong>按信息密度</strong>——(i) 信息密集的图(文档、复杂场景)→ 多给 token;(ii) 简单图(单个物体)→ 少给(可压缩)。(c) <strong>动态调整</strong>——根据输入内容<strong>自适应</strong>分配(如先粗看判断复杂度、再决定分辨率/压缩率)。(d) <strong>压缩优先</strong>——在'需要细节'时用'高分辨率 + 压缩'(而非'低分辨率不压缩'),因为前者保留了更多原始信息。<strong>具体手段</strong>——(1) <strong>token 压缩</strong>(池化/查询压缩)——把 N_v 压到可控;(2) <strong>动态分辨率</strong>——按需给高分辨率(而非固定高);(3) <strong>分层处理</strong>——先低分辨率'粗看'、需要时再'细看'(两阶段);(4) <strong>检索式</strong>——多图/视频场景只送相关帧/区域(用检索筛选);(5) <strong>上下文管理</strong>——多轮对话中压缩历史(见 Agent 上下文管理);(6) <strong>KV cache 压缩</strong>(量化/淘汰)——降低显存(不改变 token 数)。<strong>定量直觉</strong>——(a) 一张 448² 图(1024 token)≈ 一段 800 词的文本;(b) 8 张图(8192 token)会占满 8k 上下文;(c) 一段 100 页文档(高分辨率)可能产生数十万 token(远超上下文)→ 必须分块处理或检索。<strong>评估</strong>——报告'每任务的视觉/文本 token 分配'与'总成本',并做'压缩率 vs 任务指标'的曲线。<strong>实践原则</strong>——(a) <strong>先保证'信息足够',再优化成本</strong>(压缩过度导致的错误比成本更糟);(b) <strong>按任务定制分配</strong>(不要一套参数走天下);(c) <strong>监控'因预算不足导致的失败'</strong>(如'图中信息未被提及')。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'预算分配是设计决策而非固定参数'</strong>——不同任务的最优分配不同;故应 (a) 按任务定制、(b) 动态调整。② <strong>'压缩优先于降分辨率'</strong>——高分辨率 + 压缩保留了更多原始信息(压缩是'选择性的'),而低分辨率是'一刀切的丢失';故前者更优。③ <strong>'多图/视频的预算爆炸'</strong>——M 张图 × N token 很容易超出上下文;故需 (a) 固定 K 压缩、(b) 检索筛选、(c) 分层处理。④ <strong>'两阶段(先粗后细)'的实用价值</strong>——先用低分辨率/摘要'粗看'(便宜),只在需要时对相关区域'细看'(高分辨率);这是'视觉的 RAG'思想。⑤ <strong>'监控因预算不足的失败'</strong>——这类失败很隐蔽(模型'没看到'信息就回答'不知道'或幻觉);故应 (a) 记录 token 使用、(b) 测试'高信息密度'的输入。⑥ <strong>面试要点</strong>——被问'视觉与文本 token 如何分配',应给出'<strong>总长度与成本的硬约束 + 按任务/信息密度分配 + 压缩优先于降分辨率 + 两阶段/检索式</strong>';能指出'压缩优先于降分辨率'与'监控预算不足导致的失败'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    固定一套视觉 token 数(不按任务调整)
  • ✕
    为省成本过度压缩(信息不足导致错误)
🎯 Interviewer Follow-ups
  • ?
    多图场景如何分配?
  • ?
    如何判断'该给多少视觉 token'?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-029: Dynamic Resolution & Visual Tokens: 解释视觉 token 压缩的常见方法。📋Back to BankNext →M6-031: Dynamic Resolution & Visual Tokens: 解释动态分辨率对 OCR 与文档理解的影响。