VLM 的视觉编码器通常复用 CLIP 的 ViT (CLIP-ViT-L/14 是 LLaVA-1.5 标配) 或 SigLIP (LLaVA-1.6 升级): 把图像切为
p×p 的 patch 加位置编码后过 Transformer, token 数
T=(H/p)×(W/p)——例如 336×336 输入 + 14×14 patch 得到
24×24=576 个 visual token。SigLIP 用 sigmoid loss 替代 softmax 对比, 不依赖 batch 内负样本与温度, 训练更省显存、batch 可更小。