人体动作生成模型(文本生成动作)
Human Motion Generation / Text-to-Motion (e.g. MDM)进阶根据文字描述等条件,生成一段三维人体骨骼动作序列的模型。
这类模型输入一句描述(如「一个人向前走然后坐下」)或一个动作类别,输出一段逐帧的三维人体骨骼姿态序列。常用训练数据是 2022 年发布的 HumanML3D,含 14616 段动作、44970 条文字描述,动作取自 AMASS 等动捕数据。代表作 MDM(Human Motion Diffusion Model)由 Tevet 等人提出、发表于 ICLR 2023:用 Transformer 实现扩散模型,每一步直接预测干净的动作而不是噪声,方便加入脚部接触等几何约束;同一个模型还能做动作补全、中间帧插补和身体局部编辑。这类模型原本服务于动画和游戏;在具身智能里,生成的人体动作经动作重定向(把人体关节映射到机器人关节)后,可交给人形机器人的运动跟踪控制器执行,是「用一句话让人形机器人做动作」的一条路线。
例子给 MDM 输入「a person walks forward and then sits down」,它会输出一段先向前走几步、再坐下的三维人体骨骼动画,可再重定向到人形机器人上。
- 也叫
- 文本生成动作、Text-to-Motion、人体运动生成、动作扩散模型、Human Motion Generation
- 相关
- MDM(人体动作扩散模型)、HumanML3D 数据集、扩散模型、动作重定向、运动跟踪、文本驱动动作生成
- 来源
- Human Motion Diffusion Model (Tevet et al., arXiv:2209.14916)
MDM 项目主页(ICLR 2023)
HumanML3D 数据集(GitHub) - 信息截至
- 2023-05