具身智能新手名词表English

HaMeR

HaMeR (Hand Mesh Recovery)进阶

从单张 RGB 图像重建 3D 手部网格的 Transformer 模型。

HaMeR 由 UC Berkeley、密歇根大学、纽约大学的研究者提出,发表于 CVPR 2024。它用 ViT-H 视觉 Transformer 作骨干,从图像中的手部区域回归 MANO 手部模型参数(MANO 用少量姿态和形状参数描述一只手的 3D 网格)以及相机参数。作者把 10 个带 2D 或 3D 手部标注的数据集合并成约 270 万个训练样本,还从 Ego4D 等视频里标注了 HInt 评测集,专门考察真实场景中的手。它是单帧方法,但用在视频上结果也比较平滑。在具身智能里,它是从人类视频提取手指姿态的常用工具,结果可重定向给灵巧手或夹爪,作为模仿学习的动作来源。

例子OKAMI 从一段人类演示视频教人形机器人做操作时,身体动作用 SLAHMR 重建,手部姿态则对每只手用 HaMeR 估计。

也叫
Reconstructing Hands in 3D with Transformers
相关
MANO 手部模型、手部姿态估计、WiLoR、人体网格恢复、OKAMI、人类视频数据
来源
arXiv 2312.05251: Reconstructing Hands in 3D with Transformers
HaMeR 项目主页
OKAMI: Teaching Humanoid Robots Manipulation Skills through Single Video Imitation
信息截至
2024-06

在完整名词表里查看 →