CLIP
Contrastive Language-Image Pre-training常用OpenAI 用 4 亿对图文训练的模型,把图片和文字映射进同一个向量空间。
CLIP 是 OpenAI 在 2021 年发布的图文模型,由一个图像编码器和一个文本编码器组成,在从互联网收集的 4 亿对「图片-配文」上用对比学习训练:让配对的图文向量互相靠近、不配对的互相远离。训练完后,图片和文字落在同一个嵌入空间里,可以直接算相似度,所以不用再训练就能做零样本分类——把类别名写成一句话,看图片和哪句话最接近。论文报告,这样在 ImageNet 上的零样本精度追平了用 128 万张标注图训练的 ResNet-50。在具身智能里,CLIP 常被当作开放词汇的视觉或语言编码器:早期的 CLIPort 用它理解指令里物体的语义;后来不少 VLM 和 VLA 的视觉编码器沿用 CLIP 或其改进版 SigLIP。
例子把桌面照片里裁出的几块物体小图和「红色杯子」这句话都送进 CLIP 编码成向量,相似度最高的那块小图就是指令要找的目标。
- 也叫
- 对比语言-图像预训练
- 相关
- 对比学习、SigLIP、视觉编码器、开放词汇、嵌入向量、CLIPort
- 来源
- Learning Transferable Visual Models From Natural Language Supervision (CLIP, arXiv 2103.00020)
CLIPort: What and Where Pathways for Robotic Manipulation (arXiv 2109.12098)