ViT 将图像切成
p×p 的 patch, 展平后线性映射成 token 序列(首部加 [CLS] token 用于分类, 并加位置编码), token 数
T=(H/p)(W/p)——224×224 输入、patch=16 时
T=14×14=196(加 [CLS] 共 197), 送入标准 Transformer 编码器。与 CNN 对比: CNN 内建平移等变+局部性归纳偏置(参数共享、局部连接), 小数据下高效; ViT 只在 patch 层面有位置先验, attention 是全局的, 缺乏像素级局部归纳偏置 → 数据饥渴: 在 ImageNet-1K(128 万张)上从头训练的 ViT-B/16(~74% top-1)明显落后同规模 CNN(~76%), 而在 JFT-300M(3 亿张)预训练后 ViT-L/16 达到 ~87.8% top-1, 全面超越 CNN 约 1~2 个点。