具身智能新手名词表English

VGGT

VGGT: Visual Geometry Grounded Transformer进阶

一次前向就从多张图算出相机参数、深度和点云的三维视觉模型

VGGT 是牛津大学视觉几何组(VGG)和 Meta AI 提出的前馈式三维重建模型,约 10 亿参数,获 CVPR 2025 最佳论文。输入一张、几张到上百张图,它一次前向推理就输出每张图的相机参数、深度图、点图(每个像素对应的 3D 坐标)和 3D 点跟踪,通常不到一秒,不需要再做光束法平差(传统重建里反复优化相机和三维点的步骤)。过去要靠 COLMAP 等多阶段流程完成的重建,被压成一个网络。具身智能里常用它从多视角图像快速拿到场景几何。原始权重仅限非商用,2025 年 7 月另发了可商用权重并开放训练代码。

例子用手机围着桌面拍 20 张照片输入 VGGT,约一秒得到每张照片的相机位姿和整张桌面的稠密点云。

也叫
VGGT-1B
相关
前馈式三维重建、DUSt3R、π³(Pi3)、运动恢复结构、点图、光束法平差
来源
VGGT: Visual Geometry Grounded Transformer (arXiv)
facebookresearch/vggt (GitHub)
信息截至
2025-07

在完整名词表里查看 →