具身智能新手名词表English

人体动作生成模型(文本生成动作)

Human Motion Generation / Text-to-Motion (e.g. MDM)进阶

根据文字描述等条件,生成一段三维人体骨骼动作序列的模型。

这类模型输入一句描述(如「一个人向前走然后坐下」)或一个动作类别,输出一段逐帧的三维人体骨骼姿态序列。常用训练数据是 2022 年发布的 HumanML3D,含 14616 段动作、44970 条文字描述,动作取自 AMASS 等动捕数据。代表作 MDM(Human Motion Diffusion Model)由 Tevet 等人提出、发表于 ICLR 2023:用 Transformer 实现扩散模型,每一步直接预测干净的动作而不是噪声,方便加入脚部接触等几何约束;同一个模型还能做动作补全、中间帧插补和身体局部编辑。这类模型原本服务于动画和游戏;在具身智能里,生成的人体动作经动作重定向(把人体关节映射到机器人关节)后,可交给人形机器人的运动跟踪控制器执行,是「用一句话让人形机器人做动作」的一条路线。

例子给 MDM 输入「a person walks forward and then sits down」,它会输出一段先向前走几步、再坐下的三维人体骨骼动画,可再重定向到人形机器人上。

也叫
文本生成动作、Text-to-Motion、人体运动生成、动作扩散模型、Human Motion Generation
相关
MDM(人体动作扩散模型)、HumanML3D 数据集、扩散模型、动作重定向、运动跟踪、文本驱动动作生成
来源
Human Motion Diffusion Model (Tevet et al., arXiv:2209.14916)
MDM 项目主页(ICLR 2023)
HumanML3D 数据集(GitHub)
信息截至
2023-05

在完整名词表里查看 →