DINOv2
DINOv2 (self-DIstillation with NO labels, v2)常用Meta 2023 年发布的自监督视觉模型,不用标注就能学出通用图像特征。
DINOv2 是 Meta AI 在 2023 年 4 月发布的视觉基础模型,是 2021 年 DINO 的第二代,名字意为「无标签自蒸馏」。它不用人工标注:让学生网络在同一张图的不同裁剪上去匹配教师网络的输出(自监督学习),团队还用自动筛选流程整理出 1.42 亿张图片的 LVD-142M 数据集。最大的 ViT-g/14 约 11 亿参数,并蒸馏出 2100 万到 3 亿参数的小版本。它的特征不用微调,接一个线性层就能做分类、分割、深度估计,而且保留了较细的空间和几何信息,这正是机器人需要的。OpenVLA 把 DINOv2 和 SigLIP 的特征融合后作为视觉编码器,DINO-WM 则直接在 DINOv2 的图块特征上训练世界模型。
例子OpenVLA 把同一张相机图像分别送进 DINOv2 和 SigLIP,两者的特征融合后再投影进 Llama 2 语言模型:DINOv2 补充空间几何细节,SigLIP 提供和语言对齐的语义。
- 也叫
- DINO v2、DINO 特征
- 相关
- 视觉基础模型、自监督学习、视觉 Transformer、DINOv3、预训练视觉表征、OpenVLA
- 来源
- DINOv2: Learning Robust Visual Features without Supervision (arXiv 2304.07193)
facebookresearch/dinov2 (GitHub)
OpenVLA: An Open-Source Vision-Language-Action Model (arXiv 2406.09246)