具身智能新手名词表English

VIP(价值隐式预训练)

VIP: Towards Universal Visual Reward and Representation via Value-Implicit Pre-TrainingVIP进阶

在人类视频上自监督预训练,同时给出视觉表征和稠密奖励的方法

Meta AI(FAIR)与宾夕法尼亚大学的 Jason Ma、Amy Zhang 等人 2022 年 9 月发布,发表于 ICLR 2023(Spotlight)。机器人强化学习常卡在两件事:没有好用的视觉特征,也没有好写的奖励函数。VIP 把「看人类视频学表征」当成一个离线的目标条件强化学习问题,推出一个不需要动作标签的价值函数目标,本质上是一种隐式的时间对比学习,使得时间上越接近完成的画面在特征空间里离目标越近。在 Ego4D 第一人称视频上预训练后冻结使用,奖励直接取当前画面与目标图在特征空间的距离变化,就能为多种仿真和真机任务提供稠密奖励;在真机上只用约 20 条轨迹即可做少样本离线强化学习。

例子给机器人一张「抽屉已关上」的目标照片,VIP 把每一帧相机画面和目标图都编码成特征,距离缩小就给正奖励,机器人据此学会把抽屉推上,而无需人工写奖励函数。

也叫
Value-Implicit Pre-Training
相关
R3M、VC-1、预训练视觉表征、时间对比学习、目标条件强化学习、Ego4D 数据集
来源
VIP (arXiv 2210.00030)
VIP project page
信息截至
2023-03

在完整名词表里查看 →