返回 多模态 思维导图
中文·English
👁️ 多模态ID: jepa

JEPA 联合嵌入预测

JEPA Joint-Embedding Prediction
🎯核心定义
JEPA (Joint Embedding Predictive Architecture, 联合嵌入预测架构) 在潜空间做预测式自监督学习:上下文编码器 gg 以当前潜表示 ztz_t 与动作 ata_t 为输入, 预测目标表示 f(zt+1)f(z_{t+1}), 目标编码器 ff 由 EMA (指数移动平均) 更新, 训练损失为: =g(zt,at)f(zt+1)2\ell = \lVert g(z_t, a_t) - f(z_{t+1}) \rVert^2 即最小化预测表示与目标表示间的均方误差。EMA 目标 + 非对称结构 (梯度不回传到 ff) 防止表示塌缩, 无需负样本即可学习。
💡使用场景
图像/视频自监督表示学习 (I-JEPA、V-JEPA)、世界模型学习; 面试常以"JEPA 与 VAE/扩散重建有什么区别"切入考察。
解决的核心痛点
VAE/扩散在像素空间重建, 大量算力花在不可预测的细节 (背景、纹理) 上; JEPA 只在抽象潜空间预测目标表示, 主动丢弃不可预测成分——计算开销更低, 学到的表示更语义化, 下游线性探针/少样本分类提升显著。
🎯5 个高频面试考点 (Exam Points)
1
写出 JEPA 的潜空间预测损失函数, 并解释 ggffztz_tata_t 的含义?
2
EMA 目标编码器起什么作用? 为什么 JEPA 不用负样本也不会表示塌缩?
3
JEPA 与 VAE/扩散重建式自监督方法的本质区别是什么?
4
V-JEPA 如何把 JEPA 用于视频理解? 预测的是什么表示?
5
JEPA 与对比学习 (如 CLIP/InfoNCE) 在训练目标与负样本使用上的异同?
📖 关联深度指南:📄 world-models-jepa
更新于 2026-08-12
🎯
检验攻克程度:针对「JEPA 联合嵌入预测」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点RVQ 码本下一个知识点世界模型应用

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用