具身智能新手名词表English

联合嵌入预测架构

Joint-Embedding Predictive ArchitectureJEPA常用

在抽象表征空间里预测被遮住或未来的内容,而不还原像素的自监督架构。

JEPA 是 Yann LeCun 在 2022 年立场论文《A Path Towards Autonomous Machine Intelligence》中提出的架构,Meta 随后做出图像版 I-JEPA(2023)和视频版 V-JEPA。它把输入的一部分(上下文)编码后,让预测器去预测另一部分(被遮住的区域或未来帧)的表征,损失算在表征上而不是像素上,因此不必还原树叶纹理这类难以预测的细节,更专注物体和运动等语义信息,但要额外设计来防止表征坍缩。2025 年 6 月的 V-JEPA 2 用超过 100 万小时视频预训练,再用不到 62 小时机器人视频训练出动作条件版 V-JEPA 2-AC,能零样本在 Franka 机械臂上按目标图像规划抓放。LeCun 已于 2025 年 11 月离开 Meta,创办 AMI Labs 继续做世界模型。

例子V-JEPA 2-AC 做抓放:给一张「杯子已放到盘子上」的目标图,模型在表征空间里推演多组候选动作的结果,选预测表征最接近目标图的那组执行。

也叫
I-JEPA、V-JEPA
相关
V-JEPA 2、世界模型、自监督学习、隐空间世界模型、掩码自编码器、表征坍缩
来源
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)
Meta AI: I-JEPA, the first AI model based on Yann LeCun's vision
Wikipedia: Yann LeCun
信息截至
2025-11

在完整名词表里查看 →