M6-031M6: Multimodal & Generative ModelsDynamic Resolution & Visual TokensHard
Mastery:
Dynamic Resolution & Visual Tokens: 解释动态分辨率对 OCR 与文档理解的影响。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: OCR 需要高分辨率(小字),动态分辨率使小字可辨;但 token 成本高,需配合压缩与分块。
📌 Key Takeaways
- •OCR 要求'每字符足够的像素'(否则不可辨)
- •固定缩放把文档压到 336² → 小字模糊 → OCR 失败
- •动态分辨率保住像素 → OCR 可行;但需 token 压缩与分块
📐 Mathematical Derivations
数学机理:<strong>OCR 的分辨率需求</strong>——文字识别的关键是'每个字符有足够的像素'(经验上需要约 10~20 px 的字高);若把 A4 文档(约 2480×3508 px)缩放到 336×336,则每个字符只剩 1~2 px——<strong>完全不可辨</strong>。故<strong>固定分辨率的 VLM 天然做不好 OCR</strong>(这是早期 VLM 在文档任务上表现差的根本原因)。<strong>动态分辨率的作用</strong>——按原生分辨率切 patch(或 tiling),使字符保留足够像素;这是现代 VLM(Qwen2-VL、GPT-4V、Gemini)在 OCR 上大幅提升的关键。<strong>但仍需解决</strong>——(a) <strong>token 成本</strong>——A4 文档在原生分辨率下可能产生数万 token(远超上下文);故需 (i) <strong>token 压缩</strong>(但要谨慎,压缩会毁掉小字)、(ii) <strong>分块处理</strong>(把文档切成页/区域,逐块处理)、(iii) <strong>检索式</strong>(先定位相关区域再高分辨率读取)。(b) <strong>长文档的全局理解</strong>——逐块处理会丢失跨块信息(如'第 3 页提到的表格在第 7 页');故需 (i) 全局缩略图、(ii) 分层摘要、(iii) 跨块检索。<strong>OCR 之外,文档理解还需</strong>——(a) <strong>版面分析</strong>(识别标题/正文/表格/图注的层次);(b) <strong>表格解析</strong>(行列对齐、合并单元格);(c) <strong>公式识别</strong>(LaTeX 化);(d) <strong>图表理解</strong>(读柱状图/折线图的数值);(e) <strong>跨页推理</strong>(多页文档的连贯理解);(f) <strong>结构化输出</strong>(输出 JSON/Markdown 而非纯文本)。<strong>与专用 OCR 的对比</strong>——(a) <strong>专用 OCR</strong>(如 PaddleOCR、Tesseract)——在'纯文字提取'上更准、更快、更便宜;(b) <strong>VLM</strong>——能理解版面与语义(如'这个数字是总计')、能做结构化输出、能回答基于文档的问题。<strong>实践建议</strong>——(a) <strong>纯文字提取</strong> → 用专用 OCR(便宜、准);(b) <strong>需要理解/问答/结构化</strong> → 用 VLM(高分辨率 + 分块 + 检索);(c) <strong>组合</strong>——OCR 提取文本 + VLM 理解版面(或 VLM 直接处理,若成本可接受)。<strong>评估</strong>——(a) <strong>OCR 基准</strong>(如 OCRBench、DocVQA、ChartQA、InfoVQA);(b) <strong>结构化抽取</strong>(如表格还原的准确率);(c) <strong>端到端文档问答</strong>。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'每字符像素数'是 OCR 的硬约束</strong>——它解释了'为什么固定分辨率的 VLM 做不好 OCR';面试中能给出这个量化直觉很有说服力。② <strong>'动态分辨率是 OCR 的必要条件'</strong>——但<strong>不充分</strong>(还需分块、检索、版面理解)。③ <strong>'压缩对 OCR 的风险'</strong>——池化/压缩会把小字'抹平';故文档场景应 (a) 用更保守的压缩、(b) 只压缩背景区域、(c) 或完全不用压缩(靠分块控制总量)。④ <strong>'分块与全局的张力'</strong>——分块解决成本但丢全局;故需 (a) 全局缩略图、(b) 分层摘要、(c) 跨块检索(类似 RAG)。⑤ <strong>'VLM vs 专用 OCR 的分工'</strong>——纯提取用专用(便宜准),需理解用 VLM;实践中常'OCR 打底 + VLM 理解'。⑥ <strong>面试要点</strong>——被问'VLM 怎么做 OCR',应给出'<strong>每字符像素数的硬约束 → 固定缩放失败 → 动态分辨率保住像素 → 但需分块/检索/压缩</strong>'与'<strong>文档理解还需版面/表格/公式/跨页能力</strong>';能指出'纯提取用专用 OCR 更划算'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用低分辨率处理文档(OCR 失败)
- ✕文档场景激进压缩 token(小字被抹平)
🎯 Interviewer Follow-ups
- ?为什么 VLM 的 OCR 比专用 OCR 弱?
- ?文档理解还需哪些能力(除识别)?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.