具身智能新手名词表English

DINO-WM

DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning进阶

在 DINOv2 图像特征空间里预测未来的世界模型,训练后能零样本规划到新目标。

DINO-WM 由纽约大学的 Gaoyue Zhou、Hengkai Pan 与 Yann LeCun、Lerrel Pinto(后两位同属 Meta FAIR)提出,2024 年 11 月发布,发表于 ICML 2025。很多世界模型要重建像素,或和任务奖励绑定。DINO-WM 用预训练且冻结的 DINOv2 提取图块(patch)特征,只训练一个预测器:给定当前特征和动作,预测下一步特征,不重建图像。训练只用离线收集的轨迹,不需要专家演示、奖励模型或逆动力学模型。测试时给一张目标图像,用模型预测控制(MPC)搜索动作序列,让预测出的未来特征尽量接近目标特征,实现零样本规划。它代表了在预训练表征的隐空间里做世界模型的路线,与 JEPA、V-JEPA 2 思路相近。

例子在 Push-T 任务中给出目标摆放图像,DINO-WM 在特征空间里推演不同推动动作,选出让 T 形块最接近目标位姿的序列;同一方法还用于迷宫导航、绳子和颗粒物操作等环境。

也叫
DINO World Model
相关
世界模型、隐空间世界模型、DINOv2、模型预测控制、联合嵌入预测架构、V-JEPA 2
来源
DINO-WM (arXiv:2411.04983)
DINO-WM 项目主页
Gaoyue Zhou 个人主页(标注 ICML 2025)
信息截至
2025

在完整名词表里查看 →