JEPA 是自监督学习、表征学习、世界模型、具身智能和下一代人工智能研究中非常重要的一个术语,全称是 Joint-Embedding Predictive Architecture,通常可译为“联合嵌入预测架构”或“联合表征预测架构”。它用来描述一种让模型在抽象表征空间中进行预测的学习方法。换句话说,JEPA 架构是在回答:AI 是否可以不直接预测像素、单词或声音波形,而是预测更高层、更有语义的信息表示。
如果说生成式模型常常学习“如何重建原始数据”,例如生成下一个 token、补全图像像素或还原被遮挡区域,那么 JEPA 更强调“预测隐藏部分的表征”。它不是要求模型把每个细节都复原出来,而是希望模型抓住数据中真正重要的结构和语义关系。
因此,JEPA 常用于图像表征学习、视频理解、世界模型、机器人感知、具身智能和自监督学习中,是理解“从低层重建走向高层预测”的重要基础概念。
一、基本概念:什么是 JEPA
JEPA 的核心思想是:用已知部分的表征,预测未知部分的表征。
这里有三个关键词:
• Joint:联合,表示模型把不同部分放到同一个表示空间中比较
• Embedding:嵌入,表示模型内部的向量化表征
• Predictive:预测,表示根据已知信息推断未知信息
例如,在一张图片中,可以遮住一部分区域。模型看到未遮住的上下文区域后,不直接预测被遮住区域的像素,而是预测这个区域在表征空间中的向量。
可以简单表示为:
可见上下文 → 编码为表征 → 预测目标区域表征
从通俗角度看:JEPA 不要求模型把缺失区域“画出来”,而是让模型理解“缺失区域大概是什么含义”。
例如,图片中有一只猫的头部和身体轮廓,遮住了尾巴。生成式模型可能需要还原尾巴的具体像素;JEPA 更关心的是:被遮住的部分在语义上应当属于猫的一部分,而不是汽车、树或天空。
二、为什么需要 JEPA
JEPA 之所以重要,是因为现实世界的信息非常复杂。如果模型总是学习重建原始数据,可能会把大量计算花在不重要的细节上。
例如,在图像中,像素级重建会关心:
• 纹理细节
• 局部颜色
• 光照噪声
• 背景细节
• 边缘微小变化
但对很多智能任务来说,更重要的是:
• 物体是什么
• 物体之间有什么关系
• 场景结构如何
• 事件可能如何发展
• 哪些信息对决策有用
从通俗角度看:生成像素像是在临摹一张图。预测表征像是在理解这张图的意思。
JEPA 希望模型学习更抽象、更稳定、更有语义的信息,而不是被表面细节牵着走。这对视觉理解、视频预测、机器人决策和世界模型尤其重要。
三、JEPA 的基本结构
典型 JEPA 架构通常包含几个部分:
上下文编码器 → 预测器 → 目标编码器 → 表征对齐

图 1:JEPA 架构的基本思想
1、上下文编码器
上下文编码器负责处理可见信息。
例如,在图片中,模型只能看到未被遮挡的区域。
可以表示为:
其中:
• x_c 表示上下文区域
• E_c 表示上下文编码器
• z_c 表示上下文表征
从通俗角度看:上下文编码器负责“读懂已知部分”。
2、目标编码器
目标编码器负责把目标区域编码成目标表征。
可以表示为:
其中:
• x_t 表示目标区域
• E_t 表示目标编码器
• z_t 表示目标表征
需要注意:训练时可以看到目标区域,用它生成学习目标;但模型预测时不能直接依赖目标区域本身。
3、预测器
预测器根据上下文表征,预测目标表征。
可以表示为:
其中:
• P 表示预测器
• z_c 表示上下文表征
• ẑ_t 表示预测出的目标表征
训练目标是让 ẑ_t 尽量接近 z_t。
从通俗角度看:预测器负责根据已知部分推断未知部分的语义表示。
四、JEPA 与生成式模型的区别
JEPA 经常和生成式模型进行比较。

图 2:JEPA 与生成式模型的区别
1、生成式模型:预测原始数据
生成式模型通常预测像素、token 或波形。
例如:
• 前文 token → 下一个 token
• 遮挡图像 → 缺失像素
• 噪声图像 → 清晰图像
这类方法强调生成可见内容。
2、JEPA:预测抽象表征
JEPA 不直接预测原始数据,而是预测目标区域的嵌入表示。
例如:
• 图像上下文 → 被遮挡区域的语义表征
• 视频前后文 → 未来片段的抽象表征
这让模型可以忽略许多低层细节,把学习重点放在语义和结构上。
3、核心区别
可以概括为:
• 生成式模型:重建数据本身
• JEPA 架构:预测数据的高层表征
从通俗角度看:生成式模型更像“把答案写出来”。JEPA 更像“理解答案代表什么”。
五、I-JEPA:图像中的 JEPA
I-JEPA 是 Image-based Joint-Embedding Predictive Architecture,即图像 JEPA。它的基本思路是:从图像中的上下文区域,预测目标区域的表征。

图 3:I-JEPA 的图像表征学习
例如,一张图像被分成多个块:
• 一些块作为上下文
• 一些块作为目标
模型看上下文块,然后预测目标块的表征。
与一些图像自监督方法不同,I-JEPA 不需要直接重建图像像素,也不强依赖手工设计的数据增强。它更强调通过掩码策略,让模型学习图像中的语义结构。
从通俗角度看:I-JEPA 不是让模型“补图”,而是让模型“理解被挡住的区域应该是什么”。
六、V-JEPA:视频中的 JEPA
V-JEPA 是 Video Joint Embedding Predictive Architecture,即视频 JEPA。视频比图像更复杂,因为它包含时间变化。
V-JEPA 的基本思想是:根据视频中可见的时空上下文,预测被遮挡部分的抽象表征。

图 4:V-JEPA 的视频表征学习
例如,在一段视频中,模型看到物体运动的前后片段,需要推断被遮住的片段在表征空间中应是什么样。
这对学习世界动态很重要。因为视频中包含:
• 物体运动
• 动作连续性
• 空间关系变化
• 因果线索
• 场景演化
从通俗角度看:V-JEPA 让模型不只是识别一帧画面,而是学习“世界如何随时间变化”。这也是它与世界模型、具身智能关系密切的原因。
七、JEPA 与世界模型的关系
世界模型强调智能体对环境变化规律的内部建模。
例如:当前状态 + 动作 → 未来状态。
JEPA 与世界模型的关系在于:它提供了一种在抽象表征空间中预测未来或缺失信息的方法。
也就是说,JEPA 不一定要精确生成未来画面的每个像素,而是可以预测未来状态的高层表征。
从通俗角度看:世界模型关心“接下来会发生什么”。JEPA 提供一种方式,让模型在“语义空间”中预测接下来会怎样。
对于机器人、自动驾驶和具身智能来说,这种思想很有价值。因为智能体不一定需要生成完整画面,它更需要知道哪些变化对行动决策重要。
八、JEPA 的优势、局限与常见误解
1、JEPA 的主要优势
JEPA 最大的优势是关注高层语义,而不是低层细节。
它可以:
• 减少对像素级重建的依赖
• 学习更抽象的表征
• 提高自监督学习效率
• 更适合视觉理解和视频理解
• 为世界模型提供表征预测思路
从通俗角度看:JEPA 让模型学习“重要含义”,而不是死记“表面细节”。
2、JEPA 的主要局限
JEPA 也有局限。
首先,表征空间的质量非常关键。如果编码器学到的表征不好,预测目标也会受影响。
其次,JEPA 需要避免表征坍塌。
如果模型把所有输入都编码成相似向量,看似预测很容易,但实际没有学到有用信息。
再次,JEPA 更偏向表征学习,不一定直接生成用户可见内容。
例如,它不像文本生成模型那样直接输出文章,也不像图像生成模型那样直接生成图片。
此外,JEPA 如何与大语言模型、机器人控制和长期规划更好结合,仍然是开放研究方向。
3、常见误解
误解一:JEPA 就是另一种图像生成模型。
不准确。JEPA 的核心是预测表征,而不是生成像素。
误解二:JEPA 不需要预测,所以不是学习模型。
不对。JEPA 仍然是预测模型,只是预测目标从原始数据变成了抽象嵌入。
误解三:JEPA 一定比生成式模型更好。
不一定。不同任务需要不同方法。生成式模型适合内容生成,JEPA 更适合表征学习和抽象预测。
误解四:JEPA 已经等同于完整世界模型。
不对。JEPA 可以支持世界模型思想,但完整世界模型还需要状态、动作、反馈、规划和长期预测能力。
九、JEPA 与其他模型的区别
1、JEPA 与 Autoencoder
自编码器通常学习:
输入 → 压缩表示 → 重构输入
它强调把输入还原出来。
JEPA 则强调:
已知部分表征 → 预测未知部分表征
它不一定重构原始输入。
2、JEPA 与 GPT
GPT 是自回归生成模型,通常预测下一个 token。
JEPA 不一定按 token 顺序生成,而是在表征空间中预测目标部分。
可以概括为:
• GPT:预测下一个 token
• JEPA:预测目标区域或未来片段的表征
3、JEPA 与 CLIP
CLIP 学习图像和文本的对齐关系。
JEPA 学习上下文和目标之间的预测关系。
CLIP 更强调跨模态对齐,JEPA 更强调同一环境或同一数据内部的预测。
十、Python 示例
下面用简化示例说明 JEPA 的基本思想。
示例 1:上下文与目标
sample = {"context": "图像中可见区域","target": "被遮挡区域"}print(sample)
JEPA 不是直接重建目标区域,而是预测目标区域的表征。
示例 2:表征预测
import torchcontext_embedding = torch.randn(1, 768)target_embedding = torch.randn(1, 768)predictor = torch.nn.Linear(768, 768)predicted_target = predictor(context_embedding)print("预测表征形状:", predicted_target.shape)print("目标表征形状:", target_embedding.shape)
这里的 predicted_target 表示根据上下文预测出的目标表征。
示例 3:让预测表征接近目标表征
import torch.nn.functional as Floss = F.mse_loss(predicted_target,target_embedding)print("预测损失:", loss.item())
这个例子表示:学生模型不是还原像素,而是让预测出的表征接近目标表征。
示例 4:图像块任务的直观结构
image_blocks = ["上下文块 1","上下文块 2","目标块 1","目标块 2"]context_blocks = image_blocks[:2]target_blocks = image_blocks[2:]print("上下文:", context_blocks)print("目标:", target_blocks)
真实 I-JEPA 会使用更复杂的掩码策略和视觉编码器。这个示例只用于说明“上下文预测目标”的基本思想。
JEPA 是 Joint-Embedding Predictive Architecture,即联合嵌入预测架构。它的核心思想是:不直接重建像素或 token,而是在抽象表征空间中根据已知部分预测未知部分。JEPA 适合自监督表征学习、视觉理解、视频理解和世界模型研究。对初学者而言,可以把 JEPA 理解为:让 AI 学会根据上下文预测隐藏信息的高层语义表示,而不是机械地还原表面细节。

夜雨聆风