具身智能新手名词表English

隐空间世界模型

Latent World Model进阶

在压缩后的隐状态里预测「执行某个动作后世界会怎样变化」的世界模型。

世界模型指能根据当前状态和动作预测未来的模型。直接预测未来图像要生成大量与决策无关的像素细节,又慢又难;隐空间世界模型先把观测编码成低维隐状态,只在隐空间里预测下一步的隐状态,规划或训练策略也在隐空间完成。Hafner 等人 2018 年的 PlaNet 提出兼含确定性和随机成分的循环状态空间模型(RSSM),后来的 Dreamer 系列用它在「想象」中训练策略。另一条路线不重建像素:DINO-WM 直接预测预训练视觉模型 DINOv2 的图像块特征;Meta 2025 年的 V-JEPA 2-AC 只用不到 62 小时的 DROID 机器人视频训练动作条件预测器,就在两个实验室的 Franka 机械臂上零样本完成抓取放置。难点是隐状态无法直接查看,不重建像素的方法还要防止表征坍缩(所有输入被编码成几乎相同的向量)。

例子V-JEPA 2-AC 做抓取放置时,把目标图像编码成隐向量,在隐空间里对多组候选动作分别预测结果,选出预测结果最接近目标的动作去执行,全程不生成图像。

也叫
潜在世界模型、潜在动力学模型、Latent Dynamics Model、隐空间动力学模型
相关
世界模型、循环状态空间模型、DINO-WM、V-JEPA 2、联合嵌入预测架构、想象中学习
来源
Learning Latent Dynamics for Planning from Pixels (PlaNet, arXiv:1811.04551)
DINO-WM: World Models on Pre-trained Visual Features enable Zero-shot Planning (arXiv:2411.04983)
V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning (arXiv:2506.09985)
信息截至
2025-06

在完整名词表里查看 →