具身智能新手名词表English

预训练视觉表征

Pre-trained Visual RepresentationPVR进阶

在大规模图像或视频上预先训练好的视觉编码器,拿来给机器人策略当「眼睛」。

预训练视觉表征指先在大量图像或视频上训练好的视觉编码器,它把相机画面压成特征向量,再交给机器人策略或导航智能体使用,编码器通常冻结或只轻微微调。它要解决的是机器人数据少、从零学视觉效率低的问题。2022 年 Parisi 等人发现,只用 ImageNet 等通用视觉数据预训练的表征,训出的控制策略能追平甚至超过直接用真值状态(物体精确位置等)训练的策略。之后出现了 R3M(用 Ego4D 人类第一视角视频训练)、MVP(掩码自编码预训练)、VC-1 等面向具身任务的 PVR。VC-1 论文在含 17 个任务的 CortexBench 上比较后发现,没有哪种 PVR 在所有任务上都最好。现在的 VLA 更多直接用 SigLIP、DINOv2 这类视觉基础模型当编码器。

例子VC-1 用 4000 多小时第一视角视频加 ImageNet、以掩码自编码方式训练 ViT,冻结后接一个小策略网络,在 CortexBench 的行走、导航、灵巧操作、移动操作等任务上评测。

也叫
视觉预训练表征、PVRs、预训练视觉编码器
相关
视觉编码器、R3M、VC-1、MVP(掩码视觉预训练)、视觉基础模型、冻结骨干网络
来源
The Unsurprising Effectiveness of Pre-Trained Vision Models for Control (arXiv 2203.03580)
Where are we in the search for an Artificial Visual Cortex for Embodied Intelligence? (VC-1, arXiv 2303.18240)

在完整名词表里查看 →