TAPIR
TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement进阶DeepMind 的任意点跟踪模型:先逐帧找候选匹配,再沿时间精修轨迹。
TAPIR 是 Google DeepMind 与牛津大学 VGG 组在 2023 年提出的点跟踪模型(ICCV 2023),用于「任意点跟踪」任务:给定视频里某一帧上的任意一个点,输出它在其余每一帧中的位置,以及是否被遮挡。方法分两阶段:匹配阶段在每一帧上独立寻找和查询点最像的候选位置,作为初始化;精修阶段利用局部相关性,沿时间方向反复更新整条轨迹和查询特征。论文在 TAP-Vid 基准上较此前方法有明显提升。TAPNet 是同团队在 TAP-Vid 论文里给出的早期基线,代码仓库沿用 tapnet 这个名字。机器人上它被用来跟踪物体或夹爪上的关键点,比如 DeepMind 的 RoboTAP 就用点轨迹来做少样本模仿。
例子在一段机械臂叠毛巾的视频里点选毛巾的一个角,TAPIR 能输出这个角在后续每一帧的像素坐标,即使中途被夹爪短暂挡住也能接回来。
- 也叫
- TAPNet
- 相关
- 任意点跟踪、CoTracker、光流、ATM(任意点轨迹建模)、关键点检测、遮挡
- 来源
- TAPIR: Tracking Any Point with per-frame Initialization and temporal Refinement (arXiv 2306.08637)
- 信息截至
- 2023-06