M6-013M6: Multimodal & Generative ModelsVision-Language Alignment (CLIP)Hard
Mastery:

Vision-Language Alignment (CLIP): 解释 CLIP 的零样本分类机制。

📐 Mathematical Definition
y^=arg⁡max⁡c ⟨zI, zT(prompt(c))⟩;prompt ensemble↑\hat y=\arg\max_c\ \langle z^I,\ z^T(\text{prompt}(c))\rangle;\qquad \text{prompt ensemble}\uparrow
⚡ Executive Summary
Core Concept: 把类别名写成 prompt('a photo of a {}'),用文本塔编码为'分类器权重',与图像嵌入比对取最大。

📌 Key Takeaways

  • •
    类别名 → prompt 模板 → 文本嵌入(相当于分类器权重)
  • •
    图像嵌入与各文本嵌入比对,取相似度最高
  • •
    prompt ensemble(多模板平均)显著提升准确率

📐 Mathematical Derivations

数学机理:<strong>零样本分类的机制</strong>——(1) <strong>构造分类器</strong>——把每个类别名 c 填入 prompt 模板(如 'a photo of a {}')得到文本 t_c;用<strong>文本塔</strong>编码并 L2 归一化得到 z^T(t_c)——这相当于'分类器的权重向量'(因为 CLIP 的相似度是内积)。(2) <strong>分类</strong>——用视觉塔编码图像得 z^I,与所有 z^T(t_c) 计算余弦相似度,<strong>取最大</strong>者作为预测:ŷ=argmax_c ⟨z^I, z^T(t_c)⟩。(3) <strong>softmax 概率</strong>——把相似度乘以温度(CLIP 的 logit scale)后 softmax 得到类别概率。<strong>为什么有效</strong>——CLIP 的训练使'图像嵌入'与'匹配的文本嵌入'靠近;故'与图像最匹配的类别描述'即为预测(无需任何标注训练)。<strong>prompt 模板的重要性</strong>——(a) <strong>模板影响嵌入</strong>——'a photo of a {}' vs 'a {}' vs 'a blurry photo of a {}' 产生不同的文本嵌入,导致不同的准确率(差异可达几个百分点);(b) <strong>为什么</strong>——CLIP 训练数据的文本是'自然语句'(caption 风格),故 prompt 应<strong>贴近 caption 的分布</strong>('a photo of a X' 比孤立的 'X' 更接近);(c) <strong>prompt ensemble</strong>——用 <strong>80 个模板</strong>('a photo of a {}'、'a bad photo of a {}'、'a sketch of a {}' 等)的嵌入<strong>平均</strong>,显著提升准确率(ImageNet 上约 +3~5 分);这是 CLIP 论文的标准做法,成本极低。<strong>与线性探针的对比</strong>——(a) <strong>零样本</strong>——用文本嵌入做分类器(无需训练数据);(b) <strong>线性探针(linear probe)</strong>——在<strong>冻结的 CLIP 视觉特征</strong>上训练一个线性分类器(需标注数据);通常线性探针<strong>优于零样本</strong>(因为用任务数据适配),但需标注。<strong>其他提升技巧</strong>——(a) <strong>类别描述</strong>(用更详细的描述而非单词);(b) <strong>上下文提示</strong>('a photo of a {}, a type of pet');(c) <strong>在域内数据上微调</strong>(少样本适配)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'prompt ensemble 是免费午餐'</strong>——用多个模板平均可显著提升零样本准确率,成本极低(只需多次文本编码,可离线缓存);故<strong>必做</strong>。② <strong>'模板要贴近 caption 分布'是理解 prompt 敏感性的钥匙</strong>——CLIP 的训练文本是自然语句,故 prompt 也应是自然语句(而非孤立词)。③ <strong>'零样本 vs 线性探针'的选择</strong>——(a) <strong>无标注数据</strong> → 零样本;(b) <strong>有少量标注</strong> → 线性探针(更准);(c) <strong>有较多标注</strong> → 微调(更准但可能损害零样本泛化)。④ <strong>'零样本的鲁棒性优势'</strong>——CLIP 的零样本在<strong>分布偏移</strong>(如 ImageNet-R/A/Sketch)上常优于监督模型(因为没在特定分布上过拟合);这是它的重要价值。⑤ <strong>'类别名设计'的技巧</strong>——用'人类可理解的描述'(而非模型内部标签);对细粒度类别,加区分性描述('a photo of a {} bird')。⑥ <strong>面试要点</strong>——被问'CLIP 零样本怎么做',应给出'<strong>类别名 → prompt → 文本嵌入作为分类器权重 → 与图像嵌入比对</strong>'三步与'<strong>prompt ensemble(80 模板平均,+3~5 分)</strong>';能指出'模板需贴近 caption 分布'与'零样本在分布偏移上鲁棒'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用孤立的类别词做 prompt(不贴近 caption 分布)
  • ✕
    不做 prompt ensemble(错失免费提升)
🎯 Interviewer Follow-ups
  • ?
    为什么 prompt 模板影响这么大?
  • ?
    零样本分类与线性探针(linear probe)的差异?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-012: Vision-Language Alignment (CLIP): 解释 CLIP 在检索中的应用与分数融合。📋Back to BankNext →M6-014: Vision-Language Alignment (CLIP): 解释 CLIP 训练的数据规模与噪声(Alt-text 的噪声标签)。