返回 多模态 思维导图
中文·English
👁️ 多模态ID: vision-encoder

视觉编码器

Vision Encoder
🎯核心定义
VLM 的视觉编码器通常复用 CLIP 的 ViT (CLIP-ViT-L/14 是 LLaVA-1.5 标配) 或 SigLIP (LLaVA-1.6 升级): 把图像切为 p×pp \times p 的 patch 加位置编码后过 Transformer, token 数 T=(H/p)×(W/p)T = (H/p) \times (W/p)——例如 336×336 输入 + 14×14 patch 得到 24×24=57624 \times 24 = 576 个 visual token。SigLIP 用 sigmoid loss 替代 softmax 对比, 不依赖 batch 内负样本与温度, 训练更省显存、batch 可更小。
💡使用场景
任何模块化 VLM 的第一段 (LLaVA/Qwen-VL/InternVL); 面试常考「为什么冻结视觉塔」「patch 大小与分辨率怎么权衡」; 高分辨率需求下配合 AnyRes/动态 token 方案。
解决的核心痛点
复用现成 CLIP 视觉塔能白拿零样本对齐能力, 训练前期冻结它 (只训投影器) 可防止视觉梯度回传破坏文本嵌入、并省约一半视觉塔的显存与算力; 但固定 patch 导致低分辨率细节丢失——336×336 输入下 ViT-14 只给 576 个 token, 小字/小物体编码不充分, 所以才有 LLaVA-1.6 的 AnyRes 网格切块 (每格再出 576 token) 与 Qwen2-VL 的动态分辨率: 用更多 token 换高分辨率细节。
🎯5 个高频面试考点 (Exam Points)
1
336×336 输入 + ViT-14 patch 会产生多少个 visual token?写出公式?
2
为什么 VLM 前几阶段要冻结视觉编码器?什么时候解冻?
3
CLIP ViT 与 SigLIP 的区别?sigmoid loss 解决了什么问题?
4
视觉塔选更大的 ViT 一定更好吗?训练成本与收益怎么权衡?
5
冻结视觉塔时为什么仍能学到高分辨率能力 (AnyRes 切块原理)?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「视觉编码器」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点VLM 架构下一个知识点图文交错训练数据

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用