投影器把视觉特征对齐到 LLM 的文本嵌入空间, 三条主流路线: ① LLaVA 的线性/两层 MLP——
h=MLP(zvis), 每个 visual token 独立映射 (常 1024→4096 维), 保持 token 数与空间结构不变 (576→576); ② BLIP-2 的 Q-Former——一组可学习 query
q∈R32×d 通过 cross-attention 从视觉特征里「检索式」提取信息, 把 576 个视觉 token 压缩成 32 个 query token; ③ C-Abstractor——用
2×2 stride 卷积降采样, token 数直接除以 4。