具身智能新手名词表English

潜在动作预训练

Latent Action Pretraining进阶

从没有动作标签的视频里提取「潜在动作」,用它来预训练机器人模型。

潜在动作预训练指先从无动作标签的视频中学出「潜在动作」——描述相邻两帧之间发生了什么变化的编码,再让 VLA 预测这些潜在动作来做预训练,最后用少量真机数据把潜在动作映射成真实的机器人动作。代表工作是 2024 年 10 月华盛顿大学、KAIST、微软研究院、英伟达等提出的 LAPA,用 VQ-VAE(向量量化自编码器)学离散潜在动作。它的价值在于能利用互联网视频、人类操作视频这类海量但没有机器人动作标签的数据。Genie 的潜在动作模型、UniVLA、智元 GO-1 也采用了类似思路。

例子LAPA 论文报告:只用 Something-Something V2 人类操作视频预训练也有正迁移;在需要语言条件和泛化的真机任务上,它超过了用真实动作标签训练的 OpenVLA,预训练算力约为后者的 1/30。

也叫
隐动作预训练
相关
潜在动作、潜在动作模型、LAPA、无动作标签视频、人类视频预训练、向量量化变分自编码器
来源
Latent Action Pretraining from Videos (LAPA, arXiv:2410.11758)
LAPA 论文 HTML 版
信息截至
2024-10

在完整名词表里查看 →