无动作标签视频
Action-free Video常用只有画面、没有逐帧动作记录的视频,比如人类视频和网络视频。
无动作标签视频指只有图像序列、没有逐帧动作标签的视频,常见来源是网上的人类操作视频、第一人称视频,以及只存了画面的机器人录像。它的量远大于带动作的机器人数据,里面有大量「物体怎么动、任务怎么做」的信息,但不能直接拿来做行为克隆。常见用法有几类:训练逆动力学模型给它补伪动作标签;用潜在动作模型从相邻帧学出离散的「潜在动作」做预训练,如 LAPA、Genie;先生成未来画面再推算动作,如 UniPi、AVDC;或只用来预训练视觉表征和世界模型。LAPA 报告,这样预训练的模型在真机任务上超过了用机器人动作标签训练的 VLA。
例子AVDC 只用不带动作的 RGB 视频训练:先用视频生成模型合成机器人完成任务的画面,再根据相邻帧之间的稠密对应(光流)推算机器人该怎么动,在桌面操作和导航任务上做了验证。
- 也叫
- 无动作视频、无动作标注视频、Actionless Video
- 相关
- 潜在动作预训练、人类视频数据、互联网视频数据、伪动作标签、潜在动作模型、从观测中模仿学习
- 来源
- Ko et al. 2023: Learning to Act from Actionless Videos through Dense Correspondences (AVDC)
Ye et al. 2024: Latent Action Pretraining from Videos (LAPA)