手部姿态估计
Hand Pose Estimation常用从图像或传感器数据估计人手各关节位置和手指弯曲姿态的任务。
手部姿态估计是从图像、深度图或头显传感器数据中估计人手各关节的位置和手指姿态。常见输出有两种:一是 21 个二维或三维关键点(手腕加每根手指 4 个点),MediaPipe 输出的就是这种;二是参数化手部网格,最常用 MANO 模型(2017 年提出,778 个顶点,由姿态和形状参数控制),HaMeR 就用大规模 ViT 从单张图片直接回归 MANO 网格。难点是手指细、自遮挡多,握东西时还被物体挡住。对具身智能,它是把人手动作变成机器人动作的第一步:遥操作时由头显手部追踪提供实时关键点,再经动作重定向驱动灵巧手;从人类视频学操作时,也要先估出手的轨迹作为伪动作标签。
例子Open-TeleVision 用 Apple Vision Pro 实时获取操作员的手部关键点,经 dex-retargeting 优化成灵巧手关节角,操作员握拳,Unitree H1 的手也跟着握拳。
- 也叫
- 手势估计、手部追踪、Hand Tracking、手部网格重建、Hand Mesh Recovery
- 相关
- MANO 手部模型、HaMeR、MediaPipe(手部/人体关键点)、动作重定向、手物交互、人体姿态估计
- 来源
- HaMeR: Reconstructing Hands in 3D with Transformers (arXiv:2312.05251)
MANO 官网
Open-TeleVision (arXiv:2407.01512)