具身智能新手名词表English

Genie(初代)

Genie: Generative Interactive Environments进阶

谷歌 DeepMind 从无标注视频里学出「可玩世界」的生成式交互环境模型

Google DeepMind 于 2024 年 2 月发布,参数量 110 亿,是首个只用无标注互联网视频、以无监督方式训练出来的生成式交互环境。它由三部分组成:时空视频分词器,把视频压成离散 token;潜在动作模型,从前后两帧推断发生了哪种动作,动作只有一小组离散编号(论文中为 8 个);自回归动力学模型,根据当前帧和动作预测下一帧。关键在于训练时不需要动作标签,却能让人逐帧操控生成的世界。它主要用 2D 平台跳跃游戏视频训练,也在 RT-1 机器人视频上做过验证;潜在动作的思路后来被 LAPA 等机器人预训练工作沿用。

例子给 Genie 一张手绘草图,它会把草图变成一个可以按动作一帧帧玩下去的 2D 平台游戏。

也叫
Genie 1
相关
Genie 2、Genie 3、潜在动作模型、视频分词器、可交互世界模型、LAPA
来源
Genie: Generative Interactive Environments (arXiv:2402.15391)
Genie 项目主页
信息截至
2024-02

在完整名词表里查看 →