VC-1
VC-1 (Visual Cortex; Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence?)进阶Meta 用 4000 多小时第一人称视频 MAE 预训练、给具身任务用的视觉编码器
Meta AI(FAIR)2023 年 3 月发布的研究,也是当时规模最大的一次预训练视觉表征(给机器人当「眼睛」的现成视觉编码器)系统评测。作者先搭了 CortexBench,含行走、导航、灵巧操作、移动操作等 17 个任务;再把 7 个来源、4000 多小时的第一人称视频加上 ImageNet 拼起来,用掩码自编码器(MAE,遮住图像块再还原)训练不同大小的 ViT,最大的 ViT-L 即 VC-1。结论是:没有哪个视觉表征在所有任务上都最好,扩大数据规模和多样性只在平均意义上有用;针对任务再做适配后的 VC-1 在各项上达到或超过已知最好结果。模型和代码已开源。
例子做一个机械臂模仿学习项目时,可以直接把 VC-1 当冻结的图像编码器,把相机画面变成特征向量,再在上面训练一个小的策略网络。
- 也叫
- Visual Cortex 1、人工视觉皮层
- 相关
- 预训练视觉表征、掩码自编码器、R3M、VIP(价值隐式预训练)、Ego4D 数据集、视觉 Transformer
- 来源
- Where are we in the search for an Artificial Visual Cortex (arXiv 2303.18240)
VC-1 project page - 信息截至
- 2023-03