高分辨率输入是 VLM 精读 OCR/文档/小物体的关键, 两种主流方案: ① LLaVA-1.5/1.6 的 AnyRes——把高分辨率图像按 336×336 切成
nh×nw 个网格, 每个网格独立走视觉编码器各产出 576 个 token (ViT-14), 再拼接一个全局缩略图 (thumbnail) 保留整体语义, 总 token 数
Ntokens≈(nh×nw+1)×576; ② Qwen2-VL 的动态分辨率——按原始宽高比在像素数区间
[256×28×28, 1280×28×28] 内动态生成视觉 token (每
28×28 像素 ≈ 1 个 token), 最少 256 / 最多 1280 个, token 数与图像面积成正比, 不再固定切块。