🎯核心定义
CLIP (Contrastive Language-Image Pretraining) 是 OpenAI 的多模态对比预训练模型, 采用「图像塔 + 文本塔」双塔结构: 图像塔用 ViT (如 ViT-B/32) 或 ResNet, 文本塔用 Transformer, 在 4 亿图文对 (WIT) 上联合训练, 把图像与文本编码进同一个对比空间——训练时拉近同对图文 (正对) 的余弦相似度、推远 batch 内其他样本 (负对), 对称地计算图像→文本与文本→图像两个方向的 InfoNCE 损失。
💡使用场景
零样本图像分类 (ImageNet 76.2% top-1, 无需微调)、图文检索、文生图的条件编码器 (Stable Diffusion 复用 CLIP 文本塔)、以及各种 VLM 的视觉塔底座。
⚡解决的核心痛点
传统分类器需要固定的标注类别集合, 新类别必须重训模型; CLIP 把类别从「有限集合」变成「无限语言空间」——推理时把候选类别填入 prompt 模板 (“a photo of a {label}”) 编码成文本特征, 与图像特征算相似度取最高者, 从而零样本迁移到任意新数据集, 一次预训练覆盖检索/分类/排序多个下游。