位姿跟踪
Pose Tracking进阶在连续视频帧里持续估计物体的 3D 位置和朝向。
位姿指物体的 3D 位置加 3D 朝向,共 6 个自由度,所以也叫 6D 位姿。6D 位姿估计通常对单帧从零算出位姿;位姿跟踪则利用上一帧的结果,在新一帧里只做小幅修正,因此更快、更平滑,适合实时闭环控制。英伟达的 FoundationPose(CVPR 2024 Highlight)把估计和跟踪统一在一个框架里:输入 RGB-D 图像,对没见过的物体只需 CAD 模型或少量参考图,用「渲染-比较」迭代细化位姿。机器人抓取移动物体、手内调整物体、视觉伺服时都依赖它;物体被遮挡或运动过快时容易跟丢,需要重新做全局估计。SLAM 里估计相机自身位姿也叫跟踪,对象不同。
例子机器人拧瓶盖时,每帧用 FoundationPose 跟踪瓶子的 6D 位姿,控制器据此调整夹爪位置。
- 也叫
- 6D 位姿跟踪、物体位姿跟踪
- 相关
- 6D位姿估计、FoundationPose、视觉伺服、手内操作、遮挡、位姿
- 来源
- FoundationPose: Unified 6D Pose Estimation and Tracking of Novel Objects (arXiv 2312.08344)
FoundationPose 项目主页 (NVIDIA) - 信息截至
- 2024-06