具身智能新手名词表English

视频动捕(无标记动捕)

Markerless / Video-based Motion Capture进阶

不贴标记点、不穿动捕服,直接从普通视频里估计人体三维动作。

视频动捕指不依赖反光标记点或惯性传感器,只用一台或几台普通相机拍摄,再由计算机视觉算法估计人体(包括手)的三维姿态和运动轨迹。与光学动捕相比,它不需要专门场地和穿戴准备,也能处理手机拍摄或互联网视频,因此能大量获取人类动作;代价是精度较低、噪声较多,单目视频还有深度和尺度不确定、遮挡等问题,通常需要后处理或物理约束修正。常用模型有 WHAM、GVHMR(浙江大学,从单目视频恢复世界坐标系下的人体运动)等,手部常用 HaMeR。在具身智能中,它是人形机器人从人类视频学动作、做实时遥操作的数据入口:估计出的人体动作经动作重定向映射到机器人上,再用于训练运动跟踪策略。

例子HumanPlus 用一台 RGB 相机实时估计人的身体(WHAM)和手部(HaMeR)姿态,让人形机器人跟随操作员动作;伯克利 VideoMimic 从随手拍的单目视频里同时重建人体轨迹和场景几何,训练人形机器人上下楼梯、坐下和起身。

也叫
无标记动捕、单目动捕、Markerless Mocap、视觉动捕
相关
动作捕捉、光学动捕、人体网格恢复、GVHMR、HumanPlus、VideoMimic
来源
Motion capture - Wikipedia(Markerless 部分)
HumanPlus: Humanoid Shadowing and Imitation from Humans (arXiv 2406.10454)
VideoMimic 项目主页
信息截至
2025-09

在完整名词表里查看 →