TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
多模态 思维导图
›
JEPA 联合嵌入预测
← 返回 多模态 思维导图
中文
·
English
👁️ 多模态
ID:
jepa
JEPA 联合嵌入预测
JEPA Joint-Embedding Prediction
🎯
核心定义
JEPA (Joint Embedding Predictive Architecture, 联合嵌入预测架构) 在潜空间做预测式自监督学习:上下文编码器
g
g
g
以当前潜表示
z
t
z_t
z
t
与动作
a
t
a_t
a
t
为输入, 预测目标表示
f
(
z
t
+
1
)
f(z_{t+1})
f
(
z
t
+
1
)
, 目标编码器
f
f
f
由 EMA (指数移动平均) 更新, 训练损失为:
ℓ
=
∥
g
(
z
t
,
a
t
)
−
f
(
z
t
+
1
)
∥
2
\ell = \lVert g(z_t, a_t) - f(z_{t+1}) \rVert^2
ℓ
=
∥
g
(
z
t
,
a
t
)
−
f
(
z
t
+
1
)
∥
2
即最小化预测表示与目标表示间的均方误差。EMA 目标 + 非对称结构 (梯度不回传到
f
f
f
) 防止表示塌缩, 无需负样本即可学习。
💡
使用场景
图像/视频自监督表示学习 (I-JEPA、V-JEPA)、世界模型学习; 面试常以"JEPA 与 VAE/扩散重建有什么区别"切入考察。
⚡
解决的核心痛点
VAE/扩散在像素空间重建, 大量算力花在不可预测的细节 (背景、纹理) 上; JEPA 只在抽象潜空间预测目标表示, 主动丢弃不可预测成分——计算开销更低, 学到的表示更语义化, 下游线性探针/少样本分类提升显著。
🎯
5 个高频面试考点 (Exam Points)
1
写出 JEPA 的潜空间预测损失函数, 并解释
g
g
g
、
f
f
f
、
z
t
z_t
z
t
、
a
t
a_t
a
t
的含义?
2
EMA 目标编码器起什么作用? 为什么 JEPA 不用负样本也不会表示塌缩?
3
JEPA 与 VAE/扩散重建式自监督方法的本质区别是什么?
4
V-JEPA 如何把 JEPA 用于视频理解? 预测的是什么表示?
5
JEPA 与对比学习 (如 CLIP/InfoNCE) 在训练目标与负样本使用上的异同?
📖 关联深度指南:
📄 world-models-jepa →
更新于 2026-08-12
🎯
检验攻克程度:针对「JEPA 联合嵌入预测」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
RVQ 码本
下一个知识点 →
世界模型应用
🔗 更多 多模态 知识点卡片
语音识别 ASR
音频表示
Classifier-Free Guidance (CFG)
CLIP 应用