返回 多模态 思维导图
中文·English
👁️ 多模态ID: clip-architecture

CLIP 双塔架构

CLIP Two-Tower Architecture
🎯核心定义
CLIP (Contrastive Language-Image Pretraining) 是 OpenAI 的多模态对比预训练模型, 采用「图像塔 + 文本塔」双塔结构: 图像塔用 ViT (如 ViT-B/32) 或 ResNet, 文本塔用 Transformer, 在 4 亿图文对 (WIT) 上联合训练, 把图像与文本编码进同一个对比空间——训练时拉近同对图文 (正对) 的余弦相似度、推远 batch 内其他样本 (负对), 对称地计算图像→文本与文本→图像两个方向的 InfoNCE 损失。
💡使用场景
零样本图像分类 (ImageNet 76.2% top-1, 无需微调)、图文检索、文生图的条件编码器 (Stable Diffusion 复用 CLIP 文本塔)、以及各种 VLM 的视觉塔底座。
解决的核心痛点
传统分类器需要固定的标注类别集合, 新类别必须重训模型; CLIP 把类别从「有限集合」变成「无限语言空间」——推理时把候选类别填入 prompt 模板 (“a photo of a {label}”) 编码成文本特征, 与图像特征算相似度取最高者, 从而零样本迁移到任意新数据集, 一次预训练覆盖检索/分类/排序多个下游。
🎯5 个高频面试考点 (Exam Points)
1
CLIP 双塔分别用什么编码器?两个 tower 如何共享同一个对比空间?
2
CLIP 和 VLM 的区别?CLIP 只会做嵌入对齐, 为什么不能直接对话?
3
CLIP 零样本分类的完整流程?prompt 模板 (“a photo of a {label}”) 的作用?
4
为什么 CLIP 用对称损失 (图→文 + 文→图双向)?只算单向会怎样?
5
CLIP 在 Stable Diffusion 里扮演什么角色?用的是哪一塔、冻结还是可训练?
更新于 2026-08-12
🎯
检验攻克程度:针对「CLIP 双塔架构」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
下一个知识点InfoNCE 对比损失

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用