Depth Anything 3
Depth Anything 3: Recovering the Visual Space from Any ViewsDA3进阶字节 Seed 的几何模型,从任意张图恢复深度和相机位姿,位姿可给可不给。
Depth Anything 3 由字节跳动 Seed 团队于 2025 年 11 月发布,是 Depth Anything 系列第三代。前两代只做单张图的深度估计,DA3 扩展到任意数量的输入图像,相机位姿已知或未知都行,输出空间上一致的深度和相机参数,并可进一步得到点云或 3D 高斯。设计上很简洁:骨干就是一个普通 Transformer(原版 DINO 编码器),训练目标统一成「深度 + 光线」预测。论文在自建的视觉几何基准上报告,相机位姿精度平均比此前最好的 VGGT 高 44.3%,几何精度高 25.1%。模型从 Small(0.08B)到 Giant(1.15B)有多个尺寸,另有度量深度和单目专用版本。
例子手机绕着桌子拍 5 张照片、不提供任何相机参数,DA3 一次前向就给出每张图的深度和相机位姿,融合成一份桌面点云。
- 也叫
- DA3
- 相关
- Depth Anything、VGGT、前馈式三维重建、单目深度估计、3D高斯泼溅、DINOv2
- 来源
- Depth Anything 3: Recovering the Visual Space from Any Views (arXiv 2511.10647)
ByteDance-Seed/Depth-Anything-3 (GitHub) - 信息截至
- 2025-12