DINOv3
DINOv3 (Meta self-supervised vision foundation model)常用Meta 2025 年 8 月发布的第三代 DINO,70 亿参数、17 亿张图自监督训练。
DINOv3 是 Meta 在 2025 年 8 月发布的自监督视觉基础模型,是 DINOv2 的后继。最大模型 70 亿参数,在 17 亿张图片上训练,模型规模约为上一代的 7 倍,数据约为 12 倍。大模型长时间训练时,逐图块的稠密特征会逐渐变差,DINOv3 为此提出 Gram anchoring(格拉姆锚定)来稳住这类特征。Meta 称它在不微调、只接轻量任务头的情况下,在检测、语义分割等任务上超过了专门训练的模型。除 70 亿参数的大模型外,还蒸馏出多个尺寸的 ViT 和 ConvNeXt 小模型,以及一个用卫星图像训练的版本。对机器人来说,它可以当作比 DINOv2 更强的冻结视觉编码器,提供高分辨率的稠密特征。
例子把机械臂腕部相机的画面送进冻结的 DINOv3,取出每个图块的特征向量,再在上面训练一个轻量头来做物体分割或抓取点预测,不必从头训练视觉网络。
- 也叫
- DINO v3
- 相关
- DINOv2、视觉基础模型、自监督学习、视觉编码器、预训练视觉表征、语义分割
- 来源
- DINOv3: Self-supervised learning for vision at unprecedented scale (Meta AI Blog)
DINOv3 (arXiv 2508.10104) - 信息截至
- 2025-08