R3M
R3M: A Universal Visual Representation for Robot Manipulation进阶用人类第一人称视频预训练、专供机器人操作使用的通用视觉表征
斯坦福与 Meta AI 的 Suraj Nair、Chelsea Finn、Abhinav Gupta 等人 2022 年 3 月发布,发表于 CoRL 2022。机器人演示少,从零训练视觉编码器难学好;R3M 先在 Ego4D 人类第一人称视频上预训练图像编码器,目标组合了时间对比学习(时间上接近的帧表征更接近)、视频与语言描述对齐,以及让表征稀疏紧凑的 L1 惩罚。之后把它冻结当感知模块,下游只训练策略。在 12 个仿真操作任务上,成功率比从零训练高 20% 以上,比 CLIP、MoCo 表征高 10% 以上。它是「预训练视觉表征」路线的代表,常与 VC-1、MVP、VIP 对比。
例子在杂乱的真实公寓里,Franka 机械臂以冻结的 R3M 编码器作视觉模块,每个任务只用 20 条演示就学会了操作。
- 相关
- 预训练视觉表征、VC-1、MVP(掩码视觉预训练)、VIP(价值隐式预训练)、Ego4D 数据集、时间对比学习
- 来源
- R3M (arXiv 2203.12601)
- 信息截至
- 2022-03