文本驱动动作生成
Text-to-Motion (Text-Driven Humanoid Motion Generation)进阶输入一句文字描述,输出一段对应的人体或人形机器人全身动作。
起源于图形学和视觉领域的人体动作生成:输入「一个人向前走几步再挥手」这样的文字,模型输出一段三维人体姿态序列,代表数据集是 HumanML3D(CVPR 2022,14,616 段动作、44,970 条文本描述),代表模型有基于扩散模型的 MDM(2022)。搬到人形机器人上,生成的人体动作不一定符合机器人的关节结构和物理约束,通常要先做动作重定向(把人的动作映射到机器人骨架),再交给强化学习训练的运动跟踪或全身控制策略执行。2024 年 12 月的 UH-1 从约 240 小时视频整理出 Humanoid-X 数据集,训练模型从文字生成人形动作,并在宇树 H1-2 上做了真机验证。
例子UH-1 论文中,给宇树 H1-2 输入「拳击」「鼓掌」「弹吉他」等 12 条语言指令,模型生成对应的全身动作,论文报告真机成功率接近 100%。
- 也叫
- 文本生成动作、Text-to-Motion、语言驱动人形动作生成
- 相关
- MDM(人体动作扩散模型)、HumanML3D 数据集、UH-1 / Humanoid-X、动作重定向、运动跟踪、全身控制
- 来源
- Generating Diverse and Natural 3D Human Motions from Texts (HumanML3D, CVPR 2022)
Human Motion Diffusion Model (MDM)
Learning from Massive Human Videos for Universal Humanoid Pose Control (UH-1) - 信息截至
- 2024-12