🎯核心定义
CLIP 学到的是「图文共享语义空间」, 因此是零样本任务的多模态底座, 四大类应用: ① 零样本检索/分类——文本→图像检索、ImageNet 76.2% 零样本 top-1; ② 文生图的条件编码器——Stable Diffusion 用 CLIP 文本塔把 prompt 编码成 text embedding 作为生成条件 (同时用 CLIP 视觉塔做图文相似度损失辅助训练); ③ 多模态 embedding 底座——图像检索去重、配文 (caption) 质量过滤、Multimodal RAG 的图文联合检索; ④ 反馈信号——CLIP score 作为生成质量评估与图像奖励模型的代理指标。
💡使用场景
电商以图搜文/以文搜图、UGC 文图一致性审核、SD/ComfyUI 出图工作流、多模态检索增强; 面试常问「CLIP 的 embedding 还能干什么」。
⚡解决的核心痛点
用「相似度计算」统一替换「分类头 + 固定类别集合 + 逐任务微调」的传统管线——检索、分类、排序、条件生成、质量打分全部基于同一对比空间, 一次预训练到处可用, 且与 T2I/VLM/RAG 生态天然兼容 (SD 直接消费文本塔输出, LLaVA 直接复用视觉塔权重, 节省大量从头训练成本)。