具身智能新手名词表English

人体姿态估计

Human Pose EstimationHPE常用

从图像或视频里找出人的各个关节位置,连成一副骨架。

人体姿态估计的输入是图片或视频,输出是人身上肩、肘、腕、髋、膝、踝等关节的 2D 像素坐标或 3D 位置,连起来就是一副骨架。COCO 数据集按每人 17 个关键点标注,用 OKS(按人体尺度归一化的关键点相似度)打分;卡内基梅隆的 OpenPose(CVPR 2017)先找出画面里所有关节再分配给各人,多人也能实时;谷歌 MediaPipe 可输出 33 个身体点。对具身智能,它是把人的动作变成机器人数据的第一步:遥操作时实时读取操作者姿态,或从人类视频中提取动作,再经动作重定向(映射到机器人关节)交给机器人。

例子斯坦福的 HumanPlus 只用一个 RGB 摄像头实时估计操作者的身体和手部姿态,让自制的 33 自由度人形机器人同步模仿,并借此遥操作采集演示数据。

也叫
人体关键点检测、人体动作捕捉(视觉)
相关
关键点检测、无标记动捕、动作重定向、SMPL 人体模型、手部姿态估计、MediaPipe(手部/人体关键点)
来源
Realtime Multi-Person 2D Pose Estimation using Part Affinity Fields (OpenPose, arXiv:1611.08050)
COCO Keypoint Evaluation (OKS)
MediaPipe Pose Landmarker 官方文档

在完整名词表里查看 →