对比学习
Contrastive Learning常用让相似样本的表示靠近、不相似样本的表示远离,从无标签数据里学特征。
对比学习是一类自监督表征学习方法:构造「正样本对」(应当相似的两份数据,如同一张图的两种随机增强、一张图和它的配文)和「负样本」,训练编码器把正样本对的向量拉近、把负样本推远。常用损失是 InfoNCE,源自 2018 年的 CPC 论文。代表工作有 SimCLR、MoCo 和 CLIP。它不需要人工标签,能从海量图像、视频和图文里学到通用视觉特征。具身智能里,很多 VLA 的视觉编码器(如 CLIP、SigLIP)就是用对比目标训出来的;R3M 则在人类视频上用时间对比学习预训练机器人视觉表征。
例子CLIP 用 4 亿对网上图文训练,任务是判断哪段文字配哪张图;R3M 在 Ego4D 人类视频上结合时间对比学习等目标预训练,冻结后给 Franka 机械臂用,只需 20 条演示就能在真实杂乱的公寓里学会操作任务。
- 也叫
- 对比表征学习、Contrastive Representation Learning
- 相关
- 自监督学习、InfoNCE 损失、CLIP、SigLIP、时间对比学习、R3M
- 来源
- Representation Learning with Contrastive Predictive Coding (arXiv 1807.03748)
Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)
R3M: A Universal Visual Representation for Robot Manipulation (arXiv 2203.12601)