具身智能新手名词表English

WiLoR

WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild进阶

从图像中快速找出多只手,并重建成三维手部网格

WiLoR 是帝国理工学院与上海交通大学团队提出的三维手部重建方法,发表于 CVPR 2025。它分两步:先用实时的全卷积网络在图里检测出所有手,再用基于 Vision Transformer 的重建网络,对每只手由粗到精地回归 MANO 参数(一种用少量参数描述手形和手势的参数化手模型)和相机参数,得到三维手部网格。作者还整理了超过 200 万张野外手部图像的数据集 WHIM。不加任何时序模块,它就能从单目视频逐帧得到较平滑的手部跟踪;代码、模型和数据均已开源。在具身智能里,可用它从人类视频中提取手的三维姿态,再重定向到灵巧手上作为模仿学习数据。

例子把一段人类叠衣服的第一人称视频逐帧送入 WiLoR,得到每帧双手的 MANO 姿态和指尖三维位置,再重定向成灵巧手的关节目标。

相关
MANO 手部模型、手部姿态估计、HaMeR、动作重定向、人类视频数据、第一人称视频
来源
WiLoR: End-to-end 3D Hand Localization and Reconstruction in-the-wild (arXiv)
WiLoR 项目主页
信息截至
2025-03

在完整名词表里查看 →