DROID-SLAM
DROID-SLAM: Deep Visual SLAM进阶普林斯顿提出的深度学习视觉 SLAM,循环迭代估计相机位姿和稠密深度。
DROID-SLAM 是普林斯顿大学 Zachary Teed 和 Jia Deng 发表在 NeurIPS 2021 的视觉 SLAM(同步定位与建图)系统。它借用同组 RAFT 光流的结构,在相关帧之间计算稠密像素对应,由循环网络反复更新相机位姿和每个像素的深度,中间嵌入一个可微的稠密光束法平差层(BA,联合优化相机位姿和三维结构),把几何约束直接放进网络。它只在合成数据集 TartanAir 上用单目视频训练,测试时也能用双目或 RGB-D 输入,在 TartanAir、EuRoC、TUM-RGBD、ETH3D 上精度明显超过以往方法,灾难性失败也少得多。代价是依赖 GPU,推理需要至少 11 GB 显存。后来 MASt3R-SLAM 等深度 SLAM 工作常拿它作对比基线。
例子给一段手持相机绕房间拍摄的视频,DROID-SLAM 输出每一帧的相机位姿和稠密深度,可拼成房间的点云,也可为人类示范视频恢复相机运动轨迹。
- 也叫
- DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras
- 相关
- 视觉SLAM、光束法平差、RAFT 光流、ORB-SLAM3、MASt3R-SLAM、视觉里程计
- 来源
- arXiv 2108.10869: DROID-SLAM: Deep Visual SLAM for Monocular, Stereo, and RGB-D Cameras
princeton-vl/DROID-SLAM (GitHub)