具身智能新手名词表English

人类视频预训练

Pretraining on Human Videos常用

先用大量人类做事的视频预训练机器人模型,再用少量机器人数据微调。

真机数据采集贵、规模小,而人类日常操作的视频(如第一人称数据集 Ego4D、互联网视频)量大、场景多,于是先在人类视频上预训练,再用少量机器人数据微调。难点有两个:视频里没有机器人动作标签;人手和机械手结构不同(本体差异)。主要路线有三类:一是只学视觉表征,如 R3M(CoRL 2022)在 Ego4D 上用时间对比学习和视频-语言对齐训练视觉编码器;二是从前后帧变化里提取潜在动作当伪标签,如 LAPA 用 VQ-VAE 得到离散潜在动作来预训练 VLA;三是估计人手的三维运动当作动作,如 Being-H0 把人手当通用操作器来预训练 VLA。

例子R3M 在 Ego4D 人类视频上预训练视觉表征后冻结,接上小策略网络,让 Franka 机械臂在真实杂乱的公寓里仅凭 20 条演示学会多种操作任务。

也叫
从人类视频学习、Human Video Pretraining、Learning from Human Videos
相关
人类视频数据、第一人称视频、潜在动作预训练、本体差异、R3M、LAPA
来源
R3M: A Universal Visual Representation for Robot Manipulation
Latent Action Pretraining from Videos (LAPA)
Being-H0: Vision-Language-Action Pretraining from Large-Scale Human Videos
信息截至
2025-07

在完整名词表里查看 →