具身智能新手名词表English

前馈式三维重建

Feed-Forward 3D Reconstruction进阶

一次网络前向计算就从图像直接输出相机参数、深度和点云的三维重建方法。

传统三维重建走运动恢复结构(SfM)加多视图立体(MVS)的流程:先匹配特征点、估计相机位姿,再用光束法平差反复迭代优化,步骤多、耗时长,纹理少或视角少时容易失败。前馈式三维重建用在大规模三维数据上训练的大网络(多为 Transformer),输入一张或多张图像,一次前向计算就直接输出点图(每个像素对应的三维坐标)、深度、相机内外参等。代表工作有 Naver 的 DUSt3R(CVPR 2024,不需要事先标定相机)、Meta 与牛津大学的 VGGT(CVPR 2025 最佳论文)、π³ 和 MapAnything。对机器人来说,它能从普通 RGB 图像快速得到场景几何,可用于建图、位姿估计,或给策略提供三维输入。

例子VGGT 输入同一场景的一张到几百张照片,据论文可在一秒内直接预测出相机参数、深度图、点图和三维点轨迹,不再依赖光束法平差等后处理优化。

也叫
前馈重建、3D 重建基础模型、前馈式 3D 重建、Feed-forward Reconstruction
相关
DUSt3R、VGGT、π³(Pi3)、MapAnything、点图、运动恢复结构
来源
DUSt3R: Geometric 3D Vision Made Easy
VGGT: Visual Geometry Grounded Transformer
MapAnything: Universal Feed-Forward Metric 3D Reconstruction
信息截至
2025-09

在完整名词表里查看 →