M6-004M6: Multimodal & Generative ModelsVision Encoders (ViT / ConvNeXt)Medium
Mastery:

Vision Encoders (ViT / ConvNeXt): 解释自监督视觉预训练的主要范式。

📐 Mathematical Definition
\text{contrastive}:\ \mathcal{L}_{\text{InfoNCE};\quad \text{masked}:\ \text{reconstruct};\quad \text{distill}:\ \text{teacher-student}
⚡ Executive Summary
Core Concept: 对比式(SimCLR/MoCo/CLIP)、掩码重建式(MAE/BEiT)、自蒸馏式(DINO/DINOv2)、以及多模态对齐式。

📌 Key Takeaways

  • •
    对比式:拉近正样本、推远负样本(需负样本或动量队列)
  • •
    掩码重建式:MAE 掩 75% patch 并重建像素(高效)
  • •
    自蒸馏式:DINO 用 teacher-student + 无负样本

📐 Mathematical Derivations

数学机理:<strong>四类范式</strong>。<strong>(1) 对比式(contrastive)</strong>——用数据增强产生正样本对(同一图的两个视图),拉近正样本、推远负样本:L=−log[ e^{s(z_i,z_j)/τ} / Σ_k e^{s(z_i,z_k)/τ} ]。代表:(a) <strong>SimCLR</strong>(大 batch 内负样本);(b) <strong>MoCo</strong>(动量编码器 + 队列,解耦 batch 与负样本数);(c) <strong>CLIP</strong>(图文对作为正样本,跨模态)。<strong>特点</strong>——需要负样本(或队列)、对增强策略敏感、依赖大 batch。(2) <strong>掩码重建式(masked image modeling)</strong>——随机<strong>掩码</strong>部分 patch,让模型<strong>重建</strong>被掩部分。代表:<strong>MAE</strong>(掩 <strong>75%</strong> patch,只对可见 patch 编码、用轻量解码器重建像素)、<strong>BEiT</strong>(重建离散 token,用 dVAE 的码本)。<strong>MAE 为什么掩 75%</strong>——(a) 图像<strong>冗余度高</strong>(相邻像素高度相关),若掩码比例低(如 15%),任务太简单(插值即可完成),学不到语义;(b) 高掩码比例使任务<strong>困难</strong>(需理解全局结构);(c) 只编码可见 patch(25%)使训练<strong>高效</strong>(计算量降 4 倍)。<strong>特点</strong>——无需负样本、训练高效、学到的是'低层+中层'特征。(3) <strong>自蒸馏式(self-distillation)</strong>——<strong>teacher-student</strong> 结构:student 预测 teacher 的输出(teacher 是 student 的 EMA),配合'多裁剪'(不同尺度视图)与'避免坍缩'的机制。代表:<strong>DINO</strong>(用 centering + sharpening 避免坍缩)、<strong>DINOv2</strong>(大规模 + 精心数据 + 蒸馏)。<strong>特点</strong>——无负样本、学到的特征<strong>语义性强</strong>(DINOv2 特征在分割/深度估计等下游任务上'免微调'就很好)。(4) <strong>多模态对齐式</strong>——用图文对做对比学习(CLIP/SigLIP),学到'语言对齐的视觉表示'(见下一主题)。<strong>对比总结</strong>——(a) <strong>MAE</strong>:重建式、高效、适合'需要低层细节'的任务(检测、分割);(b) <strong>DINOv2</strong>:自蒸馏、语义强、适合'通用视觉特征'(检索、分割、深度);(c) <strong>CLIP</strong>:语言对齐、适合'零样本分类与跨模态检索';(d) <strong>实践中常组合</strong>(如用 CLIP 或 DINOv2 作为 VLM 的视觉编码器)。<strong>选择依据</strong>——(a) VLM 的视觉塔常用 <strong>CLIP/SigLIP</strong>(因需与语言对齐);(b) 通用视觉任务(分割/深度/检索)常用 <strong>DINOv2</strong>;(c) 检测/分割的骨干常用 <strong>MAE 预训练</strong>。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'MAE 掩 75%'的直觉很关键</strong>——图像的冗余度远高于文本(掩 15% 文本已很难,掩 15% 图像太简单);故图像掩码比例需高得多。② <strong>'CLIP vs DINOv2 的定位'</strong>——CLIP 的表示<strong>语言对齐</strong>(适合跨模态、零样本),DINOv2 的表示<strong>纯视觉语义</strong>(适合密集预测、检索);VLM 通常用 CLIP/SigLIP(因需与 LLM 对接),但 DINOv2 在'无需语言'的视觉任务上更强。③ <strong>'自监督降低了对标注数据的依赖'</strong>——这是 ViT '数据饥渴'的主要解法(可用海量无标注图像预训练)。④ <strong>'增强策略的影响'</strong>——对比式方法对增强高度敏感(增强定义了'什么是不变的');MAE/DINO 对增强的依赖较小(这是它们的优势之一)。⑤ <strong>'与 VLM 训练的关系'</strong>——VLM 的视觉塔通常<strong>直接用现成的</strong> CLIP/SigLIP(不再自监督预训练);故 VLM 训练的'视觉侧'主要是'如何对齐与压缩'(见连接器与视觉 token 题)。⑥ <strong>面试要点</strong>——被问'自监督视觉预训练有哪些范式',应给出'<strong>对比式(SimCLR/MoCo/CLIP)+ 掩码重建式(MAE/BEiT)+ 自蒸馏式(DINO/DINOv2)+ 多模态对齐式</strong>'与'<strong>MAE 掩 75% 的原因(图像冗余度高)</strong>';能指出'CLIP 语言对齐 vs DINOv2 纯视觉语义'的定位差异是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用低掩码比例做 MAE(任务太简单)
  • ✕
    把 CLIP 与 DINOv2 的定位混为一谈
🎯 Interviewer Follow-ups
  • ?
    MAE 为什么掩码比例这么高(75%)?
  • ?
    DINOv2 的特征为什么适合做下游任务?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-003: Vision Encoders (ViT / ConvNeXt): 解释 Swin Transformer 的窗口注意力与层级设计。📋Back to BankNext →M6-005: Vision Encoders (ViT / ConvNeXt): 解释视觉编码器的输出如何与语言模型对齐。