场景流
Scene Flow进阶场景中每个 3D 点在相邻两帧之间的三维运动向量
场景流是光流的三维版本:光流描述图像上每个像素在两帧之间的 2D 位移,场景流描述真实世界里每个点的 3D 位移。这个概念由 CMU 的 Vedula、Kanade 等人在 1999 年提出(2005 年发表于 TPAMI 的期刊版)。早期方法从多视角或双目图像求解,深度相机和激光雷达普及后,出现了直接在两帧点云上学习的网络,如 2018 年的 FlowNet3D。它能告诉系统「哪些东西在动、往哪动、动多快」,用于自动驾驶的运动分割和动态物体跟踪。在机器人操作中,预测物体上各点未来的 3D 运动轨迹(常称 3D flow)也被当作一种与本体无关的中间表示,用来从人类视频学技能再迁移到机器人。
例子General Flow(2024)用人类 RGB-D 视频训练模型,按语言指令预测物体上各点未来的 3D 轨迹,再转成机器人动作,实现零样本技能迁移。
- 也叫
- 3D 光流、3D flow
- 相关
- 光流、任意点跟踪、点云、中间表示、RAFT 光流、4D重建
- 来源
- Three-Dimensional Scene Flow (Vedula et al., CMU RI)
arXiv 1806.01411: FlowNet3D
arXiv 1612.02590: Scene Flow Estimation: A Survey