视觉语言模型 (VLM) 的标准范式是「视觉编码器 + 投影器 + LLM」三段式: 视觉编码器 (CLIP ViT) 把图像切成 patch 编码成视觉特征
zvis, 投影器 (MLP/Q-Former) 把它对齐到 LLM 的文本嵌入空间, LLM 自回归生成文本, 训练目标是对 Assistant 文本 token 的交叉熵
L=−∑tlogp(yt∣y<t,v)。融合位置决定流派: LLaVA/Qwen-VL 在 LLM 输入层融合 (投影后视觉 token 拼进输入序列); BLIP-2 用 Q-Former 跨注意力先压缩再注入; Flamingo 把 cross-attention 层插进 LLM 各层 (interleaved fusion)。