返回 多模态 思维导图
中文·English
👁️ 多模态ID: high-res-dynamic-token

AnyRes 切块 / 动态 Token

High-Res & Dynamic Tokens
🎯核心定义
高分辨率输入是 VLM 精读 OCR/文档/小物体的关键, 两种主流方案: ① LLaVA-1.5/1.6 的 AnyRes——把高分辨率图像按 336×336 切成 nh×nwn_h \times n_w 个网格, 每个网格独立走视觉编码器各产出 576 个 token (ViT-14), 再拼接一个全局缩略图 (thumbnail) 保留整体语义, 总 token 数 Ntokens(nh×nw+1)×576N_{\text{tokens}} \approx (n_h \times n_w + 1) \times 576; ② Qwen2-VL 的动态分辨率——按原始宽高比在像素数区间 [256×28×28, 1280×28×28][256 \times 28 \times 28,\ 1280 \times 28 \times 28] 内动态生成视觉 token (每 28×2828 \times 28 像素 ≈ 1 个 token), 最少 256 / 最多 1280 个, token 数与图像面积成正比, 不再固定切块。
💡使用场景
文档理解、OCR、截图问答、细粒度视觉定位; 面试常考「AnyRes 与动态 token 的区别」与「高分辨率为什么提升 OCR」。
解决的核心痛点
直接 resize 到 336×336 会丢失小字/小目标细节, 而固定超高分辨率又让 token 爆炸 (4K 图像全像素切块 token 上万, 远超 LLM 上下文); 切块方案在不损失分辨率的前提下控制成本——LLaVA-1.6 提供 1/2/4 网格档位 (约 672/1296/2304 token), Qwen2-VL 让 token 数随面积连续变化, 在细节保真与上下文长度之间做可配置权衡, 高分辨率带来 OCR/文档能力 10 个百分点级提升 (LLaVA-1.6 在 TextVQA 等基准上显著优于 1.5)。
🎯5 个高频面试考点 (Exam Points)
1
AnyRes 的原理?高分辨率图怎么切块、全局缩略图干什么用?
2
LLaVA-1.6 各档位 (1/2/4 网格) 各产生多少 visual token?
3
Qwen2-VL 动态分辨率与 AnyRes 固定切块的区别?
4
为什么高分辨率能显著提升 OCR/文档能力?代价是什么?
5
视觉 token 数如何影响 LLM 的 attention 成本 (随长度平方增长)?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「AnyRes 切块 / 动态 Token」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点VLM 投影器 MLP/Q-Former下一个知识点Native 同构多模态

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用