具身智能新手名词表English

自监督学习

Self-Supervised LearningSSL常用

不用人工标注,从数据自身构造「题目和答案」来训练模型。

自监督学习指监督信号来自数据本身、不需要人工标签的训练方式:把输入的一部分藏起来,让模型根据其余部分去预测它。Yann LeCun 等人把它称为智能的「暗物质」并大力推广。常见形式有:遮住文本中的词让模型补全(BERT;GPT 的下一个 token 预测也常归入此类)、遮住 75% 的图像块再重建(MAE,掩码自编码器)、让同一内容不同视角的表征彼此靠近(对比学习)。它解决的是人工标注昂贵、数据量上不去的问题,是大模型预训练的基础。在具身智能里,带动作标签的机器人数据很少,研究者常先在海量人类视频上自监督预训练视觉表征或世界模型,再用少量机器人数据微调。

例子Meta 的 V-JEPA 2 先在超过 100 万小时互联网视频上自监督预训练,再用不到 62 小时、不带标签的 DROID 机器人视频训练出动作条件世界模型 V-JEPA 2-AC,在不同实验室的 Franka 机械臂上不做任务专门训练、靠图像目标规划完成抓取放置。

也叫
自监督、自监督预训练
相关
对比学习、掩码自编码器、预训练、表征学习、下一个 token 预测、V-JEPA 2
来源
Self-supervised learning: The dark matter of intelligence (Meta AI, 2021)
Masked Autoencoders Are Scalable Vision Learners (arXiv 2111.06377)
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv 2506.09985)

在完整名词表里查看 →