具身智能新手名词表English

DINOv3

DINOv3 (Meta self-supervised vision foundation model)常用

Meta 2025 年 8 月发布的第三代 DINO,70 亿参数、17 亿张图自监督训练。

DINOv3 是 Meta 在 2025 年 8 月发布的自监督视觉基础模型,是 DINOv2 的后继。最大模型 70 亿参数,在 17 亿张图片上训练,模型规模约为上一代的 7 倍,数据约为 12 倍。大模型长时间训练时,逐图块的稠密特征会逐渐变差,DINOv3 为此提出 Gram anchoring(格拉姆锚定)来稳住这类特征。Meta 称它在不微调、只接轻量任务头的情况下,在检测、语义分割等任务上超过了专门训练的模型。除 70 亿参数的大模型外,还蒸馏出多个尺寸的 ViT 和 ConvNeXt 小模型,以及一个用卫星图像训练的版本。对机器人来说,它可以当作比 DINOv2 更强的冻结视觉编码器,提供高分辨率的稠密特征。

例子把机械臂腕部相机的画面送进冻结的 DINOv3,取出每个图块的特征向量,再在上面训练一个轻量头来做物体分割或抓取点预测,不必从头训练视觉网络。

也叫
DINO v3
相关
DINOv2、视觉基础模型、自监督学习、视觉编码器、预训练视觉表征、语义分割
来源
DINOv3: Self-supervised learning for vision at unprecedented scale (Meta AI Blog)
DINOv3 (arXiv 2508.10104)
信息截至
2025-08

在完整名词表里查看 →